跳到内容

概述

vLLM x Intel-Gaudi

Star Watch Fork

Intel® Gaudi® vLLM 硬件插件是一个社区驱动的集成层,旨在 Intel® Gaudi® AI 加速器上实现高效、高性能的大语言模型(LLM)推理。

Intel® Gaudi® vLLM 硬件插件将 vLLM 服务引擎Intel® Gaudi® 硬件连接起来,为企业级 LLM 工作负载提供优化的推理能力。该插件由 Intel® Gaudi® 团队开发和维护,并遵循硬件可插拔 RFCvLLM 插件架构 RFC 以实现模块化集成。

优势

Intel® Gaudi® vLLM 硬件插件提供以下主要优势:

  • 针对 Intel® Gaudi® 的优化:支持分桶(bucketing)机制、8 位浮点(FP8)量化和自定义图缓存(graph caching)等高级功能,以实现快速预热和高效的内存使用。
  • 可扩展性和效率:旨在最大限度地提高吞吐量并最大限度地减少大规模部署的延迟,使其成为生产级 LLM 推理的理想选择。
  • 社区支持:由 Intel® Gaudi® 团队和更广泛的 vLLM 生态系统共同贡献,并在 GitHub 上进行积极维护。

入门

开始使用 Intel® Gaudi® vLLM 硬件插件:

  • 使用快速入门指南设置您的环境,并在本地或容器化环境中使用该插件。
  • 使用支持的模型(如 Llama 3.1、Mixtral 或 DeepSeek)运行推理。
  • 探索 FP8 量化、配方缓存(recipe caching)和专家并行(expert parallelism)等高级功能。
  • 通过向 vLLM-Gaudi GitHub 仓库贡献代码,加入社区。

参考

有关更多信息,请参阅: