分类:AI动态 标签:人工智能、大模型、小米、开源项目
在人工智能大模型领域,追求更高的智能上限始终是核心命题。自今年 4 月份开源 MiMo-v2.5 之后,小米 MiMo 大模型团队经历了一段时间的“沉寂”。日前,小米 MiMo 大模型负责人罗福莉发文揭晓了这半年来团队的核心攻关方向:探索强化学习究竟能扩展到多远。目前,全新的 MiMo-V2.6 模型正处于强化学习的中间训练阶段,并且小米首次采取了公开直播训练进程的方式,引发了业界的高度关注。
三大核心能力升级:推助 MiMo-V2.6 突破边界
为了探寻强化学习的极限,小米 MiMo 团队在 MiMo-V2.6 的研发过程中为其扩展并强化了三项关键能力:
- 庞大的计算规模:每步计算量约达 20 亿个 Token,采用 1,568 个 Prompt 与 16 条 Rollout 的完全异步架构,保障了充足的算力输出与数据吞吐。
- 复杂的环境与工具支持:引入了多任务智能体强化学习(Agent RL),能够在单次运行中无缝混合多种框架,大幅提升模型在真实复杂场景下的适应与操作能力。
- 评判算力增强(Grader Compute):创新性地为打分与评分过程本身增加算力,应用了 Agentic In-group Credit Assignment 技术,融合了测试案例与评分标准的双重奖励机制,确保模型训练方向的精确性。
投入超百万美元,训练全过程开启直播
除了技术层面的深度迭代,小米此次在训练透明度上也迈出了大胆的一步。罗福莉直接晒出了 MiMo-V2.6 模型的训练直播链接。数据显示,该模型的训练总花费已超过 125 万美元(约合 840.3 万元人民币)。通过官方搭建的专属直播页面,外界可以直观地追踪到模型训练的实时进展。
结语与展望
从 MiMo-v2.5 到如今蓄势待发的 MiMo-V2.6,小米在 AI 大模型赛道上的技术路线正变得愈发清晰与坚定。据悉,小米 MiMo 团队计划在接下来的几周内逐步开源这些核心技术细节。随着 MiMo-V2.6 模型的正式推出,其在强化学习领域的创新成果或将为整个开源大模型社区带来全新的启发与参考。