分类:AI动态 标签:小米、大模型、人工智能、开源项目


自今年 4 月份开源 MiMo-v2.5 之后,小米大模型团队在过去半年里似乎进入了低调期。日前,小米 MiMo 大模型负责人罗福莉发文揭晓了这段时间团队潜心钻研的核心课题 —— 探索强化学习(Reinforcement Learning)的扩展极限。目前,全新的 MiMo-V2.6 模型正在进行紧张的强化学习训练,并向公众开启了罕见的实时训练直播。

历时半年的技术跃迁:MiMo-V2.6 突破的三大核心能力

为了探寻强化学习究竟能扩展到多远,小米 MiMo 团队在 MiMo-V2.6 的研发过程中,为其构建并扩展了三项关键能力:

  1. 庞大的计算规模:每步计算达到约 20 亿个 Token,采用 1,568 个 Prompt 乘以 16 条 Rollout 的完全异步架构,为模型提供充沛的算力支撑。
  2. 丰富的环境和工具支持:引入多任务智能体(Agent)强化学习,在单次运行中无缝混合多个框架,让模型能够适应更复杂的交互场景。
  3. 评分算力增强(Grader Compute):在打分与评分过程中额外增加算力,实现基于智能体的组内信用分配(Agentic In-group Credit Assignment),引入更严谨的测试案例和评分标准奖励。

据悉,小米 MiMo 团队计划在接下来的几周内,逐步向外界开源这一系列训练细节与技术成果。

耗资百万美元:训练过程全程公开直播

除了技术层面的攻坚,小米此次还选择将 MiMo-V2.6 的训练过程进行公开直播。从官方展示的直播页面来看,该模型的训练总花费已超过 125 万美元(约合 840.3 万元人民币),这也折射出当前头部大模型在强化学习阶段巨大的算力与资金投入。

随着训练进度的推进,直播页面明确显示 MiMo-V2.6 模型已经进入倒计时阶段,即将正式与公众见面。对于关注大模型演进路径的开发者与科技爱好者而言,这次公开直播无疑提供了一个观察前沿 AI 训练细节的窗口。