BentoML¶ BentoML 允许您使用 vLLM 作为后端部署大语言模型(LLM)服务器,该服务器提供与 OpenAI 兼容的 API 端点。您可以在本地运行模型,或将其容器化为符合 OCI 标准的镜像并部署到 Kubernetes 上。 有关详细信息,请参阅 BentoML 文档中的教程:使用 vLLM 进行推理。