9 月 23 日的腾讯研究院 AI 速递里,一条国产模型动态格外硬核:小米发布并开源 MiMo-V2.6 Pro 与 Flash 两款原生全模态模型。它们不只是"能聊天",而是把文本、图像、音频、视频统一进一个模型,再用大规模在线强化学习(Live RL)把"动手能力"喂出来——最终能搭 3D 游戏、做 Blender 建模、控制机械臂,甚至写出 Lean 形式化数学证明。
原生全模态,意味着什么
所谓"原生全模态",指的是模型从架构层面就统一处理多种模态,而不是把几个单模态模型拼起来、再靠桥接层翻译。MiMo-V2.6 Pro 在 Artificial Analysis 综合智能指数拿到 46 分,被多家媒体称为"当前最强开源模型"之一;API 沿用了 V2.5 的定价,等于在能力提升的同时没有抬高使用门槛。
这对开发者更友好的地方在于:一个模型就能吃进截图、听懂语音、看懂视频,再输出可执行的操作或代码,省去了过去"先 OCR、再分类、再调不同模型"的流水线拼装。对端侧和工具链来说,全模态是智能体真正"看懂世界"的前提。
不到 6 天的 Live RL,烧出了什么
更值得拆解的是训练范式。小米披露:在不到 6 天的 Live RL 训练中,Flash 与 Pro 的强化学习成本分别约为 85 万美元和 262 万美元,累计约 75 万条训练轨迹;在 DeepSWE(代码/软件工程基准)上,相比 v1.1 分别提升约 17 分和 14 分。
"Live RL"和传统的"先收集数据、再离线训练"不同:模型在持续交互的环境里实时获得奖励信号、边跑边改策略,更接近"在干中学"。代价也很直观——262 万美元的训练成本,意味着这种范式目前仍是大厂才玩得起的游戏。但小米把关键资产开源了:7k+ 个 RL 任务环境,以及端到端训练框架。这等于把"如何大规模做 Live RL"的方法论摊开给社区,降低了后来者试错的成本。
它能做什么:从 3D 游戏到机械臂
模型的能力边界通过几个具体任务被验证:3D 游戏搭建、Blender 三维建模、机械臂控制,以及 Lean 形式化证明。前两者对应"空间理解与操作",机械臂控制对应"具身/机器人"方向,Lean 证明则对应"严谨逻辑推理"——这四类任务恰好覆盖了"智能体要进入物理与数学世界"的几道关键门槛。
尤其机械臂控制和 3D 搭建,暗示小米在"AI + 硬件/机器人"上的野心:模型不只是云端 API,更要能驱动真实设备。这与小米本身具备的智能家居、汽车、手机硬件生态天然契合——一个能理解多模态指令、并输出可执行动作的全模态模型,正是把"小爱同学"式语音助手升级为"能办事的数字劳动力"的技术底座。
冷静判断:开源是弹药,也是门槛
把 MiMo-V2.6 放回国产开源模型的整体格局看,它的信号很明确:头部厂商正在把"全模态 + 大规模 Live RL"当作下一代模型的标配打法,而且愿意把训练环境和方法开源,以此换取社区生态与反馈飞轮。对中小团队来说,直接用开源权重和 RL 环境做二次开发,比从零起步划算得多。
但也要清醒:模型"会搭 3D 游戏"不等于通用 AGI,Live RL 的高成本也意味着能力天花板高度依赖算力投入。普通开发者拿到的是能力和框架,真正把训练跑起来、复现 262 万美元级别的效果,依然需要相当的资源和工程积累。换句话说,开源降低了"上手门槛",却没有抹平"规模门槛"。
无论如何,MiMo-V2.6 代表了国产大模型在工程范式上的一次实打实推进——当模型开始自己学会搭游戏、控机械臂、证数学,我们离"能动手的 AI"又近了一步。