小米新大模型训练成本曝光,罗福莉分享进展
小米于9月22日推出并开源其最新一代MiMo大模型,涵盖全模态旗舰版MiMo-V2.6-Pro和高效推理版MiMo-V2.6-Flash,同时推出了Pro版本的超高速模式V2.6-Pro-UltraSpeed以及MiMo Desktop桌面客户端和会员订阅方案。根据第三方评测平台Artificial Analysis的综合智能指数,MiMo-V2.6-Pro获得46分,在当前开源模型中名列第一,超越了Kimi K3和GLM-5.3,并明显高于其前一代MiMo-V2.5-Pro的26分。
在智能任务成本方面,MiMo-V2.6-Pro的单任务成本为0.13美元,小米表示该模型在同等智能水平上相比于海外模型成本仅为其二十分之一至六十分之一,API定价维持在V2.5系列的水平。发布前五天,小米已提前展示了模型的训练过程。团队负责人罗福莉于9月17日在社交平台上透露,MiMo-V2.6正在进行强化学习,并公开了实时训练的进度、Token消耗和成本数据,这在国内大模型厂商中尚属首次。
在不到六天的训练中,强化学习的成本高达347万美元,其中Pro版本约262万美元,Flash版本约85万美元,各自完成了30步,累计生成约75万条轨迹。罗福莉提到,此次训练背后有长达半年的研究和开发积累。训练过程中,公开统计数据显示,两个版本的训练成本在9月17日下午已超过135万美元,平均每小时高达3.1万美元。 龙8头号玩家国际
训练配置在成本之外也得到了披露。本次训练在算力方面采用了大Batch和全异步架构,支持高达百万级的上下文长度,并在评估计算上引入了精准的奖励信号。最终结果显示,两个版本的训练任务平均通过率分别提升了25%和12%。在软件工程评测基准DeepSWE v1.1中,Flash版的得分从48.8提升至65.68,Pro版则从58.4升至72.57。根据投行的分析,高盛指出,两个版本在DeepSWE基准中的得分提升幅度显著,并认为强化学习的瓶颈已转向工程优化。
罗福莉在分享中反思了强化学习的扩展性,并将此次发布视为探索递归自我改进的重要一步。此外,除了开放Pro与Flash模型的技术报告外,小米还推出了蒸馏版本MiMo-V2.6-Distill-Qwen-9B及相关强化学习代码,旨在帮助研究者重现和验证成果。通过蒸馏模型的训练,相关得分也有所提升。
尽管获得46分在开源模型中位列前茅,但面对机器学习界的强劲对手,如GPT-6 Astra和Claude Opus等,MiMo-V2.6-Pro仍有差距。在智能体评测的多个方面,其表现与前五名的闭源模型相比较具竞争力,在综合智能指数上与顶尖模型仍相距7分。此次发布突显了在智能水平相近的情况下面临的成本竞争问题。 龙8头号玩家国际