跳到内容

渲染器 API

我们的渲染器 API 旨在将渲染阶段(预处理)解耦,并实现“Token 输入 / Token 输出”的 API 服务器。

  • 无需 GPU 的前端部署:允许预处理(分词、多模态输入处理)和后处理(反分词、工具调用解析、推理解析)在没有 GPU 的情况下运行。
  • 解耦分词:支持诸如 llm-d、Dynamo 以及需要利用 vLLM 预处理逻辑而无需运行完整推理引擎的自定义前端等用例。
  • Token 输入 / Token 输出引擎:使引擎成为纯粹的 Token 输入 / Token 输出服务,与请求预处理解耦。

API 参考