分类:AI动态 标签:人工智能、大模型、小米、强化学习
在人工智能大模型领域快速迭代的今天,各大厂商纷纷加快发布节奏。然而,小米 MiMo 大模型团队却选择了一条“慢工出细活”的路。自今年 4 月份开源 MiMo-v2.5 之后,小米在公众视野中沉寂了近半年时间。
近日,小米 MiMo 大模型负责人罗福莉正式发文揭晓了这半年的钻研成果 —— 探索强化学习(RL)的扩展边界,并首次公开直播训练全新一代的 MiMo-V2.6 模型。
核心技术突破:三大维度全面扩展
目前,MiMo-V2.6 正处于强化学习的关键中间阶段。为了突破现有模型的性能瓶颈,小米团队为其扩展了三项核心能力:
- 计算规模升级:每步计算量达到约 20 亿个 Token,支持 1,568 个 Prompt 乘(x)16 条 Rollout,且实现完全异步处理。
- 环境与工具扩展:引入多任务智能体(Agent)强化学习,支持在单次运行中混合多个复杂的计算框架。
- 评分算力增强(Grader Compute):为打分和评分过程本身注入更多算力,采用智能体组内信用分配机制(Agentic In-group Credit Assignment),融合了测试案例与精细化的评分标准奖励。
小米 MiMo 团队表示,将在接下来的几周内逐步向开源社区公开这些核心技术细节,推动行业共同进步。
直播训练与高额投入
除了技术层面的解密,罗福莉还晒出了 MiMo-V2.6 模型的实时训练直播链接。数据显示,该模型的训练总花费已超过 125 万美元(约合 840.3 万元人民币),展现了小米在 AI 基础研究上的坚定投入与雄厚算力支持。
从官方公开的直播页面来看,MiMo-V2.6 模型目前进展顺利,已经进入发布倒计时阶段。感兴趣的读者可以通过官方直播页面(mimo.xiaomi.com/rl)实时关注训练进展。
科技编辑点评
从 MiMo-v2.5 的开源到如今 MiMo-V2.6 的深度强化学习探索,小米在大模型赛道上正在从“追赶”走向“深耕”。强化学习作为当前大模型通往通用人工智能(AGI)的关键钥匙之一,其扩展边界的探索往往伴随着高昂的算力消耗与技术壁垒。小米此次公开直播训练全过程,不仅体现了对自身技术路线的自信,也将为整个开源 AI 社区提供宝贵的实践参考。