文心4.5系列模型，正式开源

作者： CBISMB

责任编辑：邹大斌

来源： ISMB

时间： 2025-06-30 11:07

关键字：文心,大模型,AI,百度,开源

点赞： 38

收藏： 12

文心4.5系列模型宣布正式开源。现在可以在文心一言官网体验最新开源能力。

文心4.5系列开源模型共10款，涵盖了激活参数规模分别为47B和3B的混合专家（MoE）模型（最大的模型总参数量为424B），以及0.3B的稠密参数模型。

本次发布的全部模型（包括预训练权重和推理代码）和项目均已完全开源至 Hugging Face、GitHub、飞桨星河社区，更多技术细节可以下载技术报告查阅。

针对 MoE 架构，文心提出了一种创新性的多模态异构模型结构，通过跨模态参数共享机制实现模态间知识融合，同时为各单一模态保留专用参数空间。此架构非常适用于从大语言模型向多模态模型的持续预训练范式，在保持甚至提升文本任务性能的基础上，显著增强多模态理解能力。

文心4.5系列模型均使用飞桨深度学习框架进行高效训练、推理和部署。在大语言模型的预训练中，模型FLOPs利用率（MFU）达到47%。实验结果显示，该系列模型在多个文本和多模态基准测试中达到SOTA水平，在指令遵循、世界知识记忆、视觉理解和多模态推理任务上效果尤为突出。模型权重按照Apache 2.0协议开源，支持开展学术研究和产业应用。此外，基于飞桨提供开源的产业级开发套件，广泛兼容多种芯片，降低后训练和部署门槛。

以下是文心4.5系列开源模型核心技术亮点：

1. 多模态混合专家模型预训练

文心4.5通过在文本和视觉两种模态上进行联合训练，更好地捕捉多模态信息中的细微差别，提升在文本生成、图像理解以及多模态推理等任务中的表现。为了让两种模态学习时互相提升，文心提出了一种多模态异构混合专家模型结构，结合了多维旋转位置编码，并且在损失函数计算时，增强了不同专家间的正交性，同时对不同模态间的词元进行平衡优化，达到多模态相互促进提升的目的。

2. 高效训练推理框架

为了支持文心4.5模型的高效训练，文心提出了异构混合并行和多层级负载均衡策略。通过节点内专家并行、显存友好的流水线调度、FP8混合精度训练和细粒度重计算等多项技术，显著提升了预训练吞吐。推理方面，文心提出了多专家并行协同量化方法和卷积编码量化算法，实现了效果接近无损的4-bit量化和2-bit量化。此外，文心还实现了动态角色转换的预填充、解码分离部署技术，可以更充分地利用资源，提升文心4.5 MoE模型的推理性能。基于飞桨框架，文心4.5在多种硬件平台均表现出优异的推理性能。

3. 针对模态的后训练

为了满足实际场景的不同要求，文心对预训练模型进行了针对模态的精调。其中，大语言模型针对通用语言理解和生成进行了优化，多模态大模型侧重于视觉语言理解，支持思考和非思考模式。每个模型采用了SFT、DPO或UPO（Unified Preference Optimization，统一偏好优化技术）的多阶段后训练。

©本站发布的所有内容，包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等，除特别标明外，均来源于网络或用户投稿，版权归原作者或原出处所有。我们致力于保护原作者版权，若涉及版权问题，请及时联系我们进行处理。

文心4.5系列模型，正式开源

相关推荐

智库专家

解决方案