BigMac快速摘要
BigMac是小红书(Rednote)Dots Infra团队于2026年7月发布并开源的多模态大模型训练框架,主要用于解决MLLM训练过程中计算效率与显存占用之间的矛盾,支持视觉编码器、语言模型和生成器协同训练,适用于多模态理解模型和生成模型训练场景。
- 开发团队:Rednote Dots Infra
- 发布时间:2026年7月22日
- 项目定位:多模态大模型训练框架
- 核心功能:优化Pipeline Parallel训练效率与显存占用
- 技术特点:Dependency-safe Nested Pipeline嵌套流水线架构
- 开源情况:GitHub开源发布
- 性能表现:训练速度提升1.08-1.9倍,据论文实验数据显示
- 使用要求:需要GPU集群及Megatron Core等训练环境支持
- 价格信息:开源免费使用

BigMac的核心优势
- 突破计算与显存权衡:依赖安全嵌套流水线可同时优化训练吞吐量与显存占用,据官方论文显示训练速度提升最高达1.9倍。
- 激活显存占用稳定:支持梯度就绪后立即反向传播,降低Encoder和Generator激活保留时间,实现O(1)级显存复杂度。
- 兼容主流训练框架:保留Megatron Core等成熟LLM流水线调度逻辑,降低多模态模型训练系统改造成本。
- 支持复杂生成任务:适用于Encoder、LLM与Generator联合训练场景,可减少多模态生成任务中的Pipeline Bubble。
- 完整工程工具链:集成Profiler、Simulator和可视化调度工具,方便定位训练瓶颈并优化GPU资源利用率。
BigMac的主要功能
- 全局训练调度:自动生成覆盖全部Pipeline Rank与Microbatch的执行计划,提升分布式训练可观测性。
- 多模态协同训练:支持视觉编码器、音频编码器、LLM及生成器统一调度,适用于MLLM训练场景。
- 流水线透明接口:开发者仅需定义模块输入输出关系,系统自动完成通信、梯度同步与激活传递。
- 训练性能分析:内置Pipeline Profiler,可分析GPU等待时间、通信瓶颈和负载均衡情况。
- 并行策略模拟:支持PP、VPP和Microbatch配置仿真,帮助预测吞吐量并减少训练试错成本。
BigMac的技术原理
- 嵌套流水线架构:以LLM Pipeline为核心,在依赖满足节点插入Encoder和Generator计算任务。
- 全局调度表机制:统一生成覆盖全部GPU节点和模块的执行计划,支持可视化分析与优化。
- 算子级执行模型:将前向传播、反向传播和通信操作抽象为独立算子统一调度执行。
- 激活生命周期优化:采用梯度就绪立即反向传播机制,缩短激活保存时间并降低显存压力。
- 调度执行解耦:调度器负责生成计划,执行器负责调用Megatron Core和通信后端完成训练。
BigMac与主流模型对比
| 对比维度 | BigMac | Megatron Core | DeepSpeed | Colossal-AI |
|---|---|---|---|---|
| 产品类型 | 多模态训练框架 | LLM训练框架 | 分布式训练框架 | AI训练框架 |
| 多模态支持 | 原生支持 | 部分支持 | 依赖扩展 | 支持 |
| 显存优化 | Encoder/Generator O(1) | 一般 | 较强 | 较强 |
| 训练加速 | 1.08-1.9倍 | 基准 | 依场景变化 | 依场景变化 |
| 调度可视化 | 内置支持 | 有限 | 有限 | 有限 |
| 开源情况 | 开源 | 开源 | 开源 | 开源 |
据BigMac论文实验数据显示,在MLLM-Understanding任务中,BigMac相较Megatron-DistTrain获得1.6-1.9倍训练加速;在MLLM-Generation任务中获得1.5-1.9倍训练加速。性能提升主要来源于嵌套流水线架构避免了Encoder与Generator阻塞LLM主流水线。传统训练框架虽然能够实现流水并行,但在多模态训练场景下容易产生Pipeline Bubble,而BigMac通过依赖安全调度机制减少等待时间。同时其显存表现接近Memory-efficient方案,因此能够突破传统计算效率与显存占用之间的Pareto Frontier限制。
如何使用BigMac
- 部署训练环境:准备支持CUDA和NCCL通信的GPU集群环境,安装Python、PyTorch以及Megatron Core相关依赖。建议使用多机多卡配置,以充分发挥流水线并行能力并提升训练吞吐量。
- 接入模型模块:将Vision Encoder、LLM Backbone以及Generator按照BigMac接口规范注册。配置PP Size、VPP Size和Microbatch数量等参数,例如PP=8、Microbatch=16可用于大规模训练测试。
- 生成全局调度:调用BigMac Scheduler自动生成Pipeline执行计划。系统会自动完成算子排序、依赖检查以及通信配置,并生成可视化执行图用于验证训练流程正确性。
- 运行训练任务:启动Executor执行训练计划,系统自动管理前向传播、反向传播和通信操作。建议监控GPU利用率和显存变化,以便根据实际情况调整训练参数。
- 分析并优化性能:利用PP Profiler查看执行时间和Pipeline Bubble分布情况。根据分析结果调整Microbatch数量、模块布局或并行策略,从而获得更高吞吐量和更稳定训练性能。
BigMac的局限性
- 适用门槛较高:BigMac主要面向大规模多模态模型训练环境,需要具备Megatron Core、Pipeline Parallel以及GPU集群管理经验。普通开发者难以直接应用于个人项目或小规模实验环境。
- 生态成熟度有限:作为2026年发布的新项目,目前生态规模和社区活跃度仍无法与DeepSpeed、Megatron Core等成熟框架相比。部分第三方工具和训练组件兼容性仍需进一步验证。
- 主要针对训练阶段:BigMac核心优化目标是训练过程中的吞吐量和显存效率,并不直接解决推理部署、模型量化或在线服务问题。据公开资料显示目前重点仍集中于训练系统优化方向。
BigMac相关资源
- 官网介绍:BigMac: Breaking the Pareto Frontier in Multimodal LLM Training
- GitHub仓库:https://github.com/Dots-Infra/BigMac/
- arXiv技术论文:https://arxiv.org/pdf/2605.25451
BigMac的典型应用场景
- 视觉语言模型训练:适用于图像理解、多模态问答等任务,可提升视觉编码器与LLM协同训练效率。
- 多模态生成模型训练:支持图像生成等复杂训练流程,减少Generator对主流水线的性能影响。
- 视频理解模型训练:适合视频内容分析、视频问答等场景,帮助控制大规模训练显存占用。
- 语音语言模型训练:支持音频编码器与大语言模型联合训练,优化跨模态训练资源利用率。
- 企业级训练平台:适用于构建统一AI训练基础设施,提升多模态模型研发和运维效率。
BigMac常见问题
BigMac是什么?
BigMac是小红书Dots Infra团队于2026年开源的多模态大模型训练框架,主要解决MLLM训练中的流水线并行效率和显存占用问题,适用于大规模模型训练场景。
BigMac免费吗?
BigMac采用开源模式发布,开发者可免费下载和使用源码。实际成本主要来自GPU算力、服务器资源及训练过程中产生的基础设施投入。
BigMac怎么用?
开发者需要部署GPU训练环境,并接入Encoder、LLM和Generator模块,通过BigMac Scheduler生成调度计划后启动训练任务,适合具备分布式训练经验的团队使用。
BigMac和Megatron Core有什么区别?
Megatron Core主要面向通用LLM训练,而BigMac重点优化多模态训练中的显存和吞吐量问题。据官方论文实验,部分场景可实现1.5倍以上训练加速。
BigMac适合哪些群体使用?
BigMac主要面向大模型研发团队、AI基础设施团队和训练平台开发团队,尤其适合需要训练视觉语言模型和多模态生成模型的企业用户。
浙公网安备33010202004812号