渲染器 API¶
我们的渲染器 API 旨在将渲染阶段(预处理)解耦,并实现“Token 输入 / Token 输出”的 API 服务器。
- 无需 GPU 的前端部署:允许预处理(分词、多模态输入处理)和后处理(反分词、工具调用解析、推理解析)在没有 GPU 的情况下运行。
- 解耦分词:支持诸如 llm-d、Dynamo 以及需要利用 vLLM 预处理逻辑而无需运行完整推理引擎的自定义前端等用例。
- Token 输入 / Token 输出引擎:使引擎成为纯粹的 Token 输入 / Token 输出服务,与请求预处理解耦。
API 参考¶
- Completions 渲染 API (
/v1/completions/render)- 渲染补全请求
- Chat Completions 渲染 API (
/v1/chat/completions/render)- 渲染聊天补全