图片经AI处理 出品 |搜狐科技 作者 |常博硕 9月22日,小米正式发布MiMo-V2.6系列,包括旗舰推理模型MiMo-V2.6-Pro和更强调效率的MiMo-V2.6-Flash,同时推出MiMo-V2.6-Pro-UltraSpeed,官方表示其在保持模型质量的前提下,输出速度最高可达到Pro版本的 20 倍。 其中,MiMo-V2.6-Pro是一款万亿参数级模型,支持文本、图像、视频和音频输入,上下文长度达到100万Token,最大输出长度为12.8万Token。它可以进行深度思考、调用工具、联网搜索,也可以处理结构化输出。Flash则是更轻量的版本,总参数约3090亿,激活参数约150亿,同样支持100万Token上下文。 每小时烧20万,小米要上桌 9月17日,罗福莉就在社交媒体上披露了小米MiMo-V2.6的训练细节,并随帖发布了MiMo-V2.6-Pro和MiMo-V2.6-Flash的实时训练数据看板。训练步数、Token消耗量、任务通过率、累计花费,甚至哪个节点的显卡出了故障,全都实时可查,把两款模型的训练过程做成了一场面向全网的直播。 按页面设定的费用速率计算, 两轮训练合计每小时约3.08万美元,约合人民币20万。 根据小米最终公布的数据,MiMo-V2.6-Pro和MiMo-V2.6-Flash分别完成30个强化学习Step,累计约75万条轨迹,两轮训练成本分别约为262万美元和85万美元,合计347万美元,折合人民币约2328万元。 模型发布当天,罗福莉在社交媒体上发文表示,MiMo-V2.6很可能是迄今为止任何开源模型团队根据计算量进行的最大的单一RL运行。在推文中她还公开表示:“今天,它(MiMo-V2.6)是排名第一的开源模型。我强烈推荐阅读技术报告。我相信它将成为AgentRL从业者反复打开并每次都发现新内容的论文之一。在我看来,它背后的研究创新和工程挑战超过了DeepSeekR1,后者我曾部分参与。” 从模型结构本身看,小米这次并没有把全部赌注押在“更大的模型”上。 MiMo-V2.6技术报告题为《Scaling Reinforcement Learning Towards Self-Improvement》,小米团队把这项工作的核心概括为:继续扩大强化学习规模,并把它作为模型走向自我改进的一条路径。 从外部结果看,MiMo-V2.6确实完成了一次明显跃升。MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3 中获得 46.32 分,超过 Kimi K3 和 Qwen3.8 Max,与马斯克新发的Grok4.7持平,目前是全球开源模型首位。 图片源自Artificial Analysis官网 具体到各项基准测试成绩,Pro在DeepSWE v1.1中获得71.9分,接近DeepSeek V4.1 Flash的74.2、Claude Opus 5与 GPT 6 Astra 的74.0;在Toolathlon-verified中获得76.9 分,高于GPT 5.6 Sol的 74.9。 看模型本身,Pro是一个1.02万亿参数的稀疏MoE模型,但每个Token实际激活的参数约为420亿,Flash是3090亿参数、150亿激活参数。 在底层架构上,Pro的语言骨干共有70层,其中60层采用128 Token窗口的滑动窗口注意力,10层采用全局注意力。 Pro和Flash两者都是稀疏MoE结构,通过局部注意力和少量全局注意力结合,在长上下文场景下降低计算和显存压力。 多模态部分也不是简单外挂几个模型,文字、图像、视频和音频最终进入的是同一套模型体系,而不是多个彼此独立的模型拼在一起。 在推理速度上,MiMo-V2.6继续采用多Token预测机制。官方数据来看,它加入了5层SWA结构的MTP推测解码器,每次前向过程可以提出后续多个Token,再进行并行验证。 当然,小米自己也承认,MiMo-V2.6和目前顶尖的闭源模型依然有差距。 不过如果按照性价比来看,MiMo-V2.6非常能打。 搜狐科技整理了目前主流的一些大模型的API价格。 搜狐科技制图,数据源自网络 “You Only RL Once” DeepSeek R1已经证明,模型在经过足够的强化学习后,可以出现明显的推理能力跃升。但如果把问题继续往前推一步,就会遇到新的瓶颈。如果题目越来越复杂,模型需要执行越来越长的任务,训练就需要更多尝试;任务变得开放之后,过去简单的答对还是答错又开始不够用了。 MiMo-V2.6解决的就是这几个问题。小米在这次训练中同时扩大了三件事。 第一是训练本身的规模。 每个RL Step使用1568个样本,每个样本可以进行16次尝试,单Step处理
发表评论