训练大模型最痛苦的事,不是模型设计,是框架和硬件的割裂。
你在 NVIDIA GPU 上跑得好好的 Megatron-LM,换到国产芯片上几乎每个环节都要定制修改。“可以运行"和"高效运行"之间,隔着三到四周的侵入式二次开发。
2026 年 10 月,百度百舸开源了 LoongForge——一套代码同时跑 NVIDIA GPU 和昆仑芯 XPU,覆盖 LLM、VLM、扩散模型、具身模型(VLA),端到端训练提速 15%~45%,在 5000+ 卡昆仑 P800 集群上实现 90%+ 线性扩展效率。
GitHub 575 stars,Apache 2.0 协议,基于 Megatron-LM 核心引擎原生重构。HelloGitHub 10 月 5 日推荐。
TL;DR
- LoongForge 是百度百舸开源的全模态训练框架,基于 Megatron-LM 重构,Apache 2.0
- 一套代码同时跑 NVIDIA GPU 和昆仑芯 XPU,20+ 模型族开箱即用(DeepSeek/Qwen/InternVL/ERNIE/Pi0.5/WAN 等)
- 端到端训练提速 15%~45%,DeepSeek V3.2 等前沿架构倍级提升
- 核心优化:DP 负载均衡、模型异构并行(ViT 与 LLM 独立策略)、ChunkPipe 长序列流水线、自适应 FP8、FusedDSA/Sparse MLA
- 5000+ 卡昆仑 P800 集群 90%+ 线性扩展效率,具身模型近 200% 加速
为什么需要 LoongForge?——框架与硬件的割裂
大模型训练框架的现状是一个"不可能三角”:要性能用 Megatron-LM,要易用用 HuggingFace,要国产硬件兼容就从头魔改。
Megatron-LM 是 NVIDIA 生态的事实标准,深度绑定 CUDA。换到昆仑芯 XPU 上,FlashAttention 要重写、通信原语要替换、算子要逐个适配——三到四周起步,还容易因代码冲突导致后续社区版本升级困难。
HuggingFace Transformers/accelerate 易用但性能不够,千卡以上规模训练效率明显落后。DeepSpeed 在 ZeRO 优化上做得好,但多模态场景支持不足。ColossalAI 试图统一,但生产验证不够。
LoongForge 的定位是:在 Megatron-LM 的性能基础上,原生支持多模态 + 双硬件平台。不是"能跑就行",而是"跑得快"。
LoongForge 的架构:三层拆解
LoongForge 的整体架构由三层构成,分别对应多模态训练中的三个结构性问题:
模型层:统一抽象。 内置 20+ 模型族标准组件,原生兼容 DeepSeek、Qwen、InternVL、LLaVA-OV、ERNIE、MiniMax、MIMO,以及 Pi0.5、WAN 等主流模型。VLM 通过 YAML 组合 ViT × LLM,不用写代码。
系统层:训练优化。 覆盖 LLM 基座优化、多模态专项优化、底层算子加速的完整链路。核心优化包括:
- DP 负载均衡:多模态样本由单图、多图、视频、纯文本混合组成,序列长度差异极大。传统数据并行将样本平均分配到各 GPU,因 Attention 的二次复杂度特性,各卡实际计算量可能相差悬殊。LoongForge 在每轮迭代前对样本分配进行动态重排,显著收窄各 Rank 间的负载差距。这是千卡级集群 90%+ 线性扩展效率的关键支撑。
- 模型异构并行:典型 VLM 模型中,ViT 参数量约 300M,LLM 主干可高达数百 B,两者相差数百倍。LoongForge 允许视觉编码器与语言主干各自独立配置最优策略,并实现 Encoder-Decoder 全分离并行训练,消除视觉编码器引入的流水线负载不均与气泡损耗。实测 Qwen3-VL-30B 32K 序列训练,端到端吞吐提升 50%。
- ChunkPipe 长序列流水线:分块长序列流水线,面向百万长度上下文。
- 自适应 FP8:按 GEMM shape 逐算子决定 FP8 策略,不是全局一刀切。
- FusedDSA / Sparse MLA:融合算子,端到端提速。
- MoE A2A overlap:MoE 模型 All-to-All 通信与计算重叠。
硬件层:双后端。 NVIDIA GPU 和昆仑芯 XPU 原生兼容,同一套配置和脚本切换硬件平台。
实测数据:提速 45% 是怎么来的
LoongForge 官方公布的性能数据:
| 场景 | 加速效果 | 备注 |
|---|---|---|
| 主流模型端到端 | 15%~45% | 覆盖 LLM/VLM/扩散 |
| DeepSeek V3.2 | 倍级提升 | 前沿架构专项优化 |
| Qwen3-VL-30B 32K 序列 | 50% 吞吐提升 | 模型异构并行 |
| 具身模型(pi05/GR00T/xVLA 等) | 近 200% | 训练时间减半 |
| 5000+ 卡昆仑 P800 集群 | 90%+ 线性扩展 | DP 负载均衡 |
具身模型近 200% 加速这个数字尤其值得关注。LoongForge 覆盖了 pi05、GR00T、xVLA、FastWAM、Lingbot-VA、Cosmos、Dreamzero 等主流具身模型,开箱即用。
和现有框架比,LoongForge 的位置在哪?
| 框架 | 核心引擎 | 多模态 | 国产硬件 | 生产验证 | 适合谁 |
|---|---|---|---|---|---|
| Megatron-LM | 自研 | 需自行扩展 | 仅 NVIDIA | 大规模 | NVIDIA 生态深度用户 |
| DeepSpeed | ZeRO 优化 | 支持有限 | 仅 NVIDIA | 大规模 | ZeRO 优化需求 |
| HF Transformers | 易用 | 支持 | 仅 NVIDIA | 中小规模 | 快速原型 |
| ColossalAI | 自研 | 支持 | 部分 | 中小规模 | 统一框架需求 |
| LoongForge | Megatron-LM 重构 | 原生全模态 | NVIDIA + 昆仑芯 | 数千卡 | 多模态 + 国产硬件 |
一句话版本:要极致性能 + 国产硬件选 LoongForge,纯 NVIDIA 生态选 Megatron-LM,快速原型选 HuggingFace。
我的建议
有国产芯片训练需求的团队:LoongForge 是目前唯一经过大规模生产验证的 NVIDIA + 昆仑芯双后端框架。5000+ 卡集群 90%+ 线性扩展不是 PPT 数字,是长期生产跑出来的。
纯 NVIDIA 生态团队:Megatron-LM 仍然是更成熟的选择,社区更大、文档更全。LoongForge 的多模态优化思路值得参考,但切换成本要考虑。
具身模型团队:LoongForge 对 pi05/GR00T/xVLA 等模型的开箱即用支持是独家优势,近 200% 加速直接砍半训练时间。
常见问题
Q1: LoongForge 和 Megatron-LM 是什么关系?
A: LoongForge 基于 Megatron-LM 核心引擎原生重构,不是 fork。针对多模态场景做了架构级改造,增加了 DP 负载均衡、模型异构并行、ChunkPipe 等优化。
Q2: 支持哪些模型?
A: 20+ 模型族,包括 DeepSeek、Qwen、InternVL、LLaVA-OV、ERNIE、MiniMax、MIMO、Pi0.5、WAN 等。覆盖 LLM、VLM、扩散模型、具身模型(VLA)。
Q3: 昆仑芯 XPU 性能怎么样?
A: 5000+ 卡昆仑 P800 集群 90%+ 线性扩展效率。官方称在主流模型上普遍实现 15%~45% 端到端训练加速。
Q4: 能跑 LoRA 吗?
A: 能。预训练 + SFT + LoRA 全流程覆盖,一套代码搞定。
Q5: 和 vLLM-Kunlun Plugin 什么关系?
A: LoongForge 管训练,vLLM-Kunlun Plugin 管推理。都是百度百舸 Loong 开源系列,配合使用覆盖训练到部署全链路。
Q6: 支持哪些硬件?
A: NVIDIA GPU 和昆仑芯 XPU 双后端。同一套配置和脚本切换硬件平台。
Q7: 开源协议是什么?
A: Apache 2.0,可商用。