Files
wehub-resource-sync d841ba7f76
pre-commit / pre-commit (push) Has been cancelled
docs: make Chinese README the default
2026-07-13 10:18:44 +00:00

7.9 KiB
Raw Permalink Blame History

Note

本文档由 WeHub 基于上游 README 翻译整理,属于社区翻译,非官方中文文档。
English · 原始项目 · 上游 README
原作者、版权与许可证归属以原始项目及本仓库 LICENSE 文件为准。

vllm-omni

简单、快速且低成本的面向所有人的全模态模型服务

| 文档 | DeepWiki | 用户论坛 | 开发者 Slack | 微信 | 论文 | 幻灯片 |


最新动态 🔥

  • [2026/07] 我们发布了 0.24.0 - 与 vLLM 0.24 发布线对齐,扩展了 TTS、语音、扩散、图像/视频生成以及机器人策略(robot-policy)服务的生产就绪覆盖范围,并包含 Omni 阶段运行时的重大重构、扩散请求级批处理、异步输出物化、量化/缓存/内存改进,以及对 CUDA/ROCm/XPU/NPU 的广泛支持。
  • [2026/06] 我们发布了 0.22.0 - 与 vLLM 0.22 对齐的**全模态世界模型(omnimodal world-model**发布,支持 Nvidia Cosmos3/DreamZero 世界模型,在 Blackwell/NPU/XPU 上扩展了量化覆盖,改进了 TTS 生产可用性,新增 MiniCPM-o 4.5、MOSS-TTS、Lance 等模型,并与 VeRL-Omni. 集成强化学习(RL)。
  • [2026/05] 我们发布了 0.20.0 - 为大规模全模态工作负载刷新了服务/运行时栈,并改进了扩散模型性能、量化以及在 CUDA、ROCm、MUSA、NPU 和 XPU 后端上的硬件就绪度。
  • [2026/03] 我们发布了 0.18.0 - 通过大规模入口点重构以及调度器/运行时清理强化核心运行时,扩展了统一量化与扩散执行,拓宽了多模态模型覆盖,并提升了音频、全模态、图像、视频、RL 及多平台部署的生产就绪度。
  • [2026/03] 欢迎查看我们在 vLLM 香港 Meetup 上的首次公开 项目深度分享
  • [2026/03] vllm-omni-skills 是由社区驱动的 AI 助手技能(skills)集合,帮助开发者更高效地使用 vLLM-Omni。这些技能可与 Cursor IDEClaudeCodex 等流行的智能体 AI 编程助手配合使用。
  • [2026/02] 我们发布了 0.16.0 - 一次重要的对齐与能力发布:基于上游 vLLM v0.16.0 重新基线化,并显著扩展了 Qwen3-Omni / Qwen3-TTSBagelMiMo-AudioGLM-Image 以及扩散(DiT)图像/视频栈在性能、分布式执行和生产就绪度方面的能力,同时改进了平台覆盖(CUDA / ROCm / NPU / XPU)、CI 质量与文档。
  • [2026/02] 我们发布了 0.14.0 - 这是 vLLM-Omni 的首个稳定版本(stable release,扩展了 Omni 的扩散/图像-视频生成以及音频/TTS 栈,改进了分布式执行与内存效率,并拓宽了平台/后端覆盖(GPU/ROCm/NPU/XPU)。它还带来了服务 API、性能分析与基准测试以及整体稳定性的重要升级。请查看我们最新的论文 了解架构设计与性能结果。
  • [2025/11] vLLM 社区正式发布 vllm-project/vllm-omni,以支持全模态模型服务。

关于

vLLM 最初旨在支持大语言模型,用于基于文本的自回归生成任务。vLLM-Omni 是一个扩展框架,将其支持范围延伸至全模态模型推理与服务:

  • 全模态(Omni-modality:文本、图像、音频、视频与动作(action)数据处理
  • 非自回归架构(Non-autoregressive Architectures:将 vLLM 的 AR 支持扩展至扩散 Transformer(DiT)及其他并行生成模型
  • 异构输出(Heterogeneous outputs:从传统文本生成到多模态与动作输出

vllm-omni

vLLM-Omni 之所以快速,得益于:

  • 借助 vLLM 高效的 KV 缓存管理,提供最先进的 AR(自回归)支持
  • 流水线阶段执行重叠,实现高吞吐性能
  • 基于 OmniConnector 的完全解耦,以及跨阶段的动态资源分配

vLLM-Omni 灵活且易于使用:

  • 异构流水线抽象,用于管理复杂模型工作流
  • 与流行的 Hugging Face 模型无缝集成
  • 支持张量、流水线、数据与专家并行,用于分布式推理
  • 流式输出
  • 兼容 OpenAI 的 API 服务器

vLLM-Omni 无缝支持 HuggingFace 上大多数流行的开源模型,包括:

  • 全模态模型(例如 Qwen3-Omni、Cosmos3、HunyuanImage、BAGEL
  • TTS 模型(例如 Qwen3-TTS、VoxCPM2、Ming-Omni-TTS、CosyVoice3
  • 扩散模型 — 图像、视频与音频生成(例如 Qwen-Image、Wan2.2、FLUX
  • 机器人策略与动作模型(例如 GR00T-N1.7、DreamZero-DROID、InternVLA-A1、Cosmos3 action policy

入门指南

访问我们的文档 了解更多。

贡献

我们欢迎并重视任何贡献与合作。 请查看 Contributing to vLLM-Omni 了解如何参与。

引用

如果你在研究中使用 vLLM-Omni,请引用我们的论文:

@article{yin2026vllmomni,
  title={vLLM-Omni: Fully Disaggregated Serving for Any-to-Any Multimodal Models},
  author={Peiqi Yin, Jiangyun Zhu, Han Gao, Chenguang Zheng, Yongxiang Huang, Taichang Zhou, Ruirui Yang, Weizhi Liu, Weiqing Chen, Canlin Guo, Didan Deng, Zifeng Mo, Cong Wang, James Cheng, Roger Wang, Hongsheng Liu},
  journal={arXiv preprint arXiv:2602.02204},
  year={2026}
}

加入社区

欢迎随时提问、提供反馈,并在 slack.vllm.ai#sig-omni Slack 频道,或 discuss.vllm.ai. 的 vLLM 用户论坛中与 vLLM-Omni 的其他用户交流讨论。

Star 历史

Star History Chart

许可证

Apache License 2.0,详见 LICENSE 文件。