百度开源 LoongForge:一套代码同时跑 NVIDIA 和昆仑芯,多模态训练提速 45%

阅读时长:7分钟

训练大模型最痛苦的事,不是模型设计,是框架和硬件的割裂。

你在 NVIDIA GPU 上跑得好好的 Megatron-LM,换到国产芯片上几乎每个环节都要定制修改。“可以运行"和"高效运行"之间,隔着三到四周的侵入式二次开发。

2026 年 10 月,百度百舸开源了 LoongForge——一套代码同时跑 NVIDIA GPU 和昆仑芯 XPU,覆盖 LLM、VLM、扩散模型、具身模型(VLA),端到端训练提速 15%~45%,在 5000+ 卡昆仑 P800 集群上实现 90%+ 线性扩展效率。

GitHub 575 stars,Apache 2.0 协议,基于 Megatron-LM 核心引擎原生重构。HelloGitHub 10 月 5 日推荐。

TL;DR

  • LoongForge 是百度百舸开源的全模态训练框架,基于 Megatron-LM 重构,Apache 2.0
  • 一套代码同时跑 NVIDIA GPU 和昆仑芯 XPU,20+ 模型族开箱即用(DeepSeek/Qwen/InternVL/ERNIE/Pi0.5/WAN 等)
  • 端到端训练提速 15%~45%,DeepSeek V3.2 等前沿架构倍级提升
  • 核心优化:DP 负载均衡、模型异构并行(ViT 与 LLM 独立策略)、ChunkPipe 长序列流水线、自适应 FP8、FusedDSA/Sparse MLA
  • 5000+ 卡昆仑 P800 集群 90%+ 线性扩展效率,具身模型近 200% 加速

为什么需要 LoongForge?——框架与硬件的割裂

大模型训练框架的现状是一个"不可能三角”:要性能用 Megatron-LM,要易用用 HuggingFace,要国产硬件兼容就从头魔改。

Megatron-LM 是 NVIDIA 生态的事实标准,深度绑定 CUDA。换到昆仑芯 XPU 上,FlashAttention 要重写、通信原语要替换、算子要逐个适配——三到四周起步,还容易因代码冲突导致后续社区版本升级困难。

HuggingFace Transformers/accelerate 易用但性能不够,千卡以上规模训练效率明显落后。DeepSpeed 在 ZeRO 优化上做得好,但多模态场景支持不足。ColossalAI 试图统一,但生产验证不够。

LoongForge 的定位是:在 Megatron-LM 的性能基础上,原生支持多模态 + 双硬件平台。不是"能跑就行",而是"跑得快"。

LoongForge 的架构:三层拆解

LoongForge 的整体架构由三层构成,分别对应多模态训练中的三个结构性问题:

模型层:统一抽象。 内置 20+ 模型族标准组件,原生兼容 DeepSeek、Qwen、InternVL、LLaVA-OV、ERNIE、MiniMax、MIMO,以及 Pi0.5、WAN 等主流模型。VLM 通过 YAML 组合 ViT × LLM,不用写代码。

系统层:训练优化。 覆盖 LLM 基座优化、多模态专项优化、底层算子加速的完整链路。核心优化包括:

  • DP 负载均衡:多模态样本由单图、多图、视频、纯文本混合组成,序列长度差异极大。传统数据并行将样本平均分配到各 GPU,因 Attention 的二次复杂度特性,各卡实际计算量可能相差悬殊。LoongForge 在每轮迭代前对样本分配进行动态重排,显著收窄各 Rank 间的负载差距。这是千卡级集群 90%+ 线性扩展效率的关键支撑。
  • 模型异构并行:典型 VLM 模型中,ViT 参数量约 300M,LLM 主干可高达数百 B,两者相差数百倍。LoongForge 允许视觉编码器与语言主干各自独立配置最优策略,并实现 Encoder-Decoder 全分离并行训练,消除视觉编码器引入的流水线负载不均与气泡损耗。实测 Qwen3-VL-30B 32K 序列训练,端到端吞吐提升 50%。
  • ChunkPipe 长序列流水线:分块长序列流水线,面向百万长度上下文。
  • 自适应 FP8:按 GEMM shape 逐算子决定 FP8 策略,不是全局一刀切。
  • FusedDSA / Sparse MLA:融合算子,端到端提速。
  • MoE A2A overlap:MoE 模型 All-to-All 通信与计算重叠。

硬件层:双后端。 NVIDIA GPU 和昆仑芯 XPU 原生兼容,同一套配置和脚本切换硬件平台。

实测数据:提速 45% 是怎么来的

LoongForge 官方公布的性能数据:

场景 加速效果 备注
主流模型端到端 15%~45% 覆盖 LLM/VLM/扩散
DeepSeek V3.2 倍级提升 前沿架构专项优化
Qwen3-VL-30B 32K 序列 50% 吞吐提升 模型异构并行
具身模型(pi05/GR00T/xVLA 等) 近 200% 训练时间减半
5000+ 卡昆仑 P800 集群 90%+ 线性扩展 DP 负载均衡

具身模型近 200% 加速这个数字尤其值得关注。LoongForge 覆盖了 pi05、GR00T、xVLA、FastWAM、Lingbot-VA、Cosmos、Dreamzero 等主流具身模型,开箱即用。

和现有框架比,LoongForge 的位置在哪?

框架 核心引擎 多模态 国产硬件 生产验证 适合谁
Megatron-LM 自研 需自行扩展 仅 NVIDIA 大规模 NVIDIA 生态深度用户
DeepSpeed ZeRO 优化 支持有限 仅 NVIDIA 大规模 ZeRO 优化需求
HF Transformers 易用 支持 仅 NVIDIA 中小规模 快速原型
ColossalAI 自研 支持 部分 中小规模 统一框架需求
LoongForge Megatron-LM 重构 原生全模态 NVIDIA + 昆仑芯 数千卡 多模态 + 国产硬件

一句话版本:要极致性能 + 国产硬件选 LoongForge,纯 NVIDIA 生态选 Megatron-LM,快速原型选 HuggingFace。

我的建议

有国产芯片训练需求的团队:LoongForge 是目前唯一经过大规模生产验证的 NVIDIA + 昆仑芯双后端框架。5000+ 卡集群 90%+ 线性扩展不是 PPT 数字,是长期生产跑出来的。

纯 NVIDIA 生态团队:Megatron-LM 仍然是更成熟的选择,社区更大、文档更全。LoongForge 的多模态优化思路值得参考,但切换成本要考虑。

具身模型团队:LoongForge 对 pi05/GR00T/xVLA 等模型的开箱即用支持是独家优势,近 200% 加速直接砍半训练时间。

常见问题

Q1: LoongForge 和 Megatron-LM 是什么关系?

A: LoongForge 基于 Megatron-LM 核心引擎原生重构,不是 fork。针对多模态场景做了架构级改造,增加了 DP 负载均衡、模型异构并行、ChunkPipe 等优化。

Q2: 支持哪些模型?

A: 20+ 模型族,包括 DeepSeek、Qwen、InternVL、LLaVA-OV、ERNIE、MiniMax、MIMO、Pi0.5、WAN 等。覆盖 LLM、VLM、扩散模型、具身模型(VLA)。

Q3: 昆仑芯 XPU 性能怎么样?

A: 5000+ 卡昆仑 P800 集群 90%+ 线性扩展效率。官方称在主流模型上普遍实现 15%~45% 端到端训练加速。

Q4: 能跑 LoRA 吗?

A: 能。预训练 + SFT + LoRA 全流程覆盖,一套代码搞定。

Q5: 和 vLLM-Kunlun Plugin 什么关系?

A: LoongForge 管训练,vLLM-Kunlun Plugin 管推理。都是百度百舸 Loong 开源系列,配合使用覆盖训练到部署全链路。

Q6: 支持哪些硬件?

A: NVIDIA GPU 和昆仑芯 XPU 双后端。同一套配置和脚本切换硬件平台。

Q7: 开源协议是什么?

A: Apache 2.0,可商用。

相关阅读

© 2026 softon.top

本站已稳定运行 277 天 14 小时 · 130 篇文章

使用 Hugo 构建 主题 Stack 由 Jimmy 设计 由 softon 魔改

最近构建时间:2026-10-05 22:51:00 CST