分类:AI动态 标签:人工智能、大模型、小米、强化学习
自今年 4 月开源 MiMo-V2.5 模型之后,小米的大模型团队经历了一段时间的“沉寂”。近日,小米 MiMo 大模型负责人罗福莉正式发文并开启直播,揭晓了团队这半年来集中钻研的核心课题:探索强化学习(RL)究竟能扩展到多远。目前,全新的 MiMo-V2.6 模型正处于强化学习的中间训练阶段,并即将正式推出。
三大核心技术维度的扩展
为了推动强化学习在模型训练中的边界,小米 MiMo 团队在 MiMo-V2.6 的研发过程中为其重点扩展了三项关键能力:
- 计算规模飞跃:在计算方面实现了每步约 20 亿个 Token 的处理能力,通过 1568 个 Prompt 乘以 16 条 Rollout 的完全异步架构运行 -> 保证了训练的高效与广度。
- 环境与工具融合:构建了多任务智能体强化学习环境,支持在一次运行中混合多个框架 -> 显著提升了模型处理复杂任务的灵活性。
- 评分算力升级(Grader Compute):为评分与打分过程本身增加了独立算力,引入了 Agentic In-group Credit Assignment 机制,并融合了测试案例与评分标准奖励 -> 让奖励机制更加精准可靠。
斥巨资直播训练全过程
除了技术层面的突破,小米此次还采取了极具透明度的做法 —— 直接公开了 MiMo-V2.6 模型的训练直播链接。数据显示,该模型的训练总花费已经超过 125 万美元(折合人民币超 840 万元)。这种将前沿大模型训练过程公之于众的做法,在业界并不多见,也引发了数码与科技爱好者的广泛关注。
总结与开源计划
随着 MiMo-V2.6 训练进入关键阶段,模型距离正式发布已经为期不远。同时,小米 MiMo 团队表示,将在接下来的几周内逐步开源相关的技术细节。这一举措不仅展现了小米在AI基础研究领域的持续投入,也将为整个开源大模型社区在强化学习扩展性探索方面提供宝贵的实践经验。