跳到主内容
南宫娱乐平台

开源王座易主?小米罗福莉发新模型:工程难度超DeepSeek-R1

2026-09-22 · 孙婉婷 · 更新于 2026-09-23

智东西9月22日消息,今天上午,小米大模型团队推出并对外开放了新一代模型Xiaomi MiMo-V2.6系列,包括两款原生全模态模型MiMo-V2.6-Pro与MiMo-V2.6-Flash。小米后续还将逐步开放MiMo-V2.6-Pro-UltraSpeed版本,相较MiMo-V2.6-Pro,在同等智力水平下输出速度提升了20倍。

此外,小米同步开源了用于新模型训练的RL环境、框架以及模型技术报告。

罗福莉今早在社交平台发文称,MiMo-V2.6聚焦于大规模RL扩展,进行了开源模型史上最大规模的一次RL训练,团队将其视为探索RSI(递归自我改进)、迈向AGI的新举措。她直言,MiMo-V2.6在创新性和工程难度上已超过DeepSeek R1。

MiMo-V2.6-Pro在Artificial Analysis智能指数上获得46.32分,超越了Kimi K3与Qwen3.8 Max,成为该榜单上得分最高的开源模型。不过从分数来看,与顶尖开源模型差距不大,其得分与刚发布的Grok 4.7相当。

在聚焦AI网页开发能力的Code Arena WebDev榜单中,MiMo-V2.6-Pro首次测试取得1628分,相比上一代MiMo-V2.5-Pro的1475分提升了153分,目前位列全球前十,在开源权重模型中排名第三。

定价方面,MiMo-V2.6系列延续了V2.5系列的API定价策略。MiMo-V2.6-Pro输入(缓存命中)0.025元/百万tokens,缓存未命中3元/百万tokens,输出6元/百万tokens;MiMo-V2.6-Flash输入(缓存命中)0.02元/百万tokens,缓存未命中1元/百万tokens,输出2元/百万tokens;MiMo-V2.6-Pro-UltraSpeed的定价是MiMo-V2.6-Pro的十倍。

有网友对比了MiMo-V2.6-Pro与Grok 4.7的价格,在同等智力水平下,Grok 4.7的价格大约是MiMo-V2.6-Pro的29倍。

Xiaomi MiMo-V2.6系列发布的预热方式也别具一格。9月17日凌晨,罗福莉在社交媒体上公布了这两款模型的训练数据实时看板,全程“直播”了小米MiMo-V2.6的训练细节,两轮训练平均每小时消耗约3.08万美元。

有网友评论称,这是有史以来最酷的开源发布之一,不仅直播了训练过程,还开源了技术细节,性能强劲的同时,定价低得惊人。

不过,也有开发者对模型能力提出质疑,认为MiMo-V2.6系列中至少Flash模型未达到预期,在OpenCode中会反复执行命令和读取文件,执行能力较弱。

智东西第一时间在OpenCode中对MiMo-V2.6系列模型进行了实际测试。从效果来看,MiMo-V2.6系列模型的多模态能力和编程水平表现尚可,但存在长时间思考及查找目录文件等问题。

01. 6天30步75万条轨迹:从编程到3D、科研,持续探索RL扩展

罗福莉提到的大规模RL扩展,在MiMo-V2.6的技术报告中以具体数字呈现。在为期6天的直播训练过程中,MiMo-V2.6-Flash与MiMo-V2.6-Pro各自完成了30步,累计覆盖约75万条轨迹,对应训练成本分别约为85万美元和262万美元。经过这一轮训练,两款模型的训练任务平均通过率分别提升了25%和12%。

在DeepSWE v1.1测试中,Flash从48.8分提升至65.68分,Pro从58.4分提升至72.57分,分别增加了约17分和14分。

在RL训练阶段,MiMo-V2.6投入了大量算力。经过大规模、多任务强化学习训练,MiMo-V2.6-Flash与MiMo-V2.6-Pro在多数Agent Benchmark上取得了接近Claude Opus5和GPT-5.6 Sol的分数。

训练系统方面,RL算力扩展主要体现在训练规模、任务环境和基础设施三个层面。小米采用全异步架构,单次更新1568个样本,训练最高支持100万token上下文,每个RL step消耗约35亿至37亿token。

训练任务不再局限于编程,而是覆盖了通用Agent、视觉和Cyber等场景,并混合多种Harness,使不同任务产生的训练信号能共同作用于模型。

奖励机制也进行了创新。对于长程RL任务,小米采用组内评分机制,将同一任务下不同轨迹的完成情况和质量进行对比,再重新分配奖励信号。这样既能区分“完成了任务”与“高质量完成任务”的差异,也能引导模型减少完成单个任务所需的路径和token。

随着训练规模扩大,稳定性问题随之出现。小米冻结了MoE Router,以减少训练中的模型漂移;针对Reward hacking,则从奖励设计、对抗评估到验证器交叉校验设置了多层防护。在工程层面,小米还统一了轨迹表示和惩罚机制,并针对不同Agent框架进行高并发交互。

训练规模扩大后,MiMo-V2.6的能力覆盖范围也随之扩展。新一代模型处理的任务已从编程延伸到3D内容、计算机操作、设计、视频和音乐等场景。

例如,在3D游戏开发任务中,模型可接收一段视频、一张图片或一句提示词,自行拆解任务,协调多个Agent搭建3D场景、实现交互逻辑,并根据渲染结果进行视觉检查和迭代。

在Blender中,它还能根据文本描述或参考图片生成3D资产,并进一步用于动画、3D打印和游戏开发。

通过Computer Use,MiMo-V2.6可进入具身仿真环境。模型能接收多视角相机画面,持续进行推理和决策,再通过视觉反馈控制Franka Panda机械臂,完成物体抓取、颜色匹配和精确放置。

设计类任务也在其能力范围内。MiMo-V2.6可生成完整的前端界面或演示文稿,包含版式结构、组件、交互元素和动效,并能与Figma以及图像、视频生成工具配合。

MiMo-V2.6系列模型还能进行视频制作。在小米展示的一支产品宣传片中,从视觉设计、镜头与动效编排,到音乐创作和卡点剪辑,均由模型完成。

音乐是新增的能力。小米方面称,MiMo-V2.6强化了音乐理解、审美判断和乐理运用,并首次探索了作曲任务。

小米方面展示的科研案例进一步体现了通用能力的迁移。小米明确表示,这些科研任务并未经过专门的科研RL训练,更多依赖模型已有的通用能力完成。

在材料科学方面,小米让MiMo-V2.6-Pro设计一种用于吸附全氟和多氟烷基物质(PFAS)的全新金属有机框架(MOF)。在材料专家的引导下,模型完成网络检索、文献与专利梳理、提出假设和新颖性评估,随后调用开源计算工具搭建仿真环境,计算MOF与PFASs之间的结合强度,最终筛选出三种候选框架,再交由湿实验进一步验证。

数学方向则是对Li与Yorke经典论文《周期三蕴含混沌》中的主定理进行Lean 4形式化。研究者设计探索策略后,MiMo-V2.6-Pro通过subagent协作推进定理陈述与证明,最终项目包含6000多行Lean代码,并通过Lean内核完成完整验证,没有留下未完成的证明占位符。

02. 赛车游戏开发、小米汽车官网设计,容易长考,爱翻目录

智东西首先测试了基础的多模态能力。输入一张Hermes Agent应用的截图,让MiMo-V2.6-Pro不依赖工具进行识别,模型很快完成了读图任务,精准度不错,但速度稍慢。

同样的提示词,更换了模型和截图,我们让MiMo-V2.6-Flash执行这项任务。可以看到MiMo-V2.6-Flash仅用了6秒,但返回的结果在内容丰富程度上比Pro模型差很多。

首先,我们用一个网页开发任务来测试MiMo-V2.6-Flash的网络搜索、文件操控和前端设计能力,让MiMo-V2.6-Flash自行搜索信息并开发一个小米汽车官网的Demo。

在这项任务中,尽管我们给出的提示词对网页开发要求很高,但MiMo-V2.6-Flash作为Flash级别模型,整体开发时间仍然过长。不过网页开发质量不错,交互流畅程度以及图片嵌入都表现良好,比如下面演示的预约试驾功能。

但美中不足的是,MiMo-V2.6-Flash开发的小米汽车官网,虽然文字部分都是小米汽车的性能参数,但搜索并嵌入的图片却是奔驰、宝马、奥迪。

最后,智东西输入了一个经典赛车游戏开发提示词,测试MiMo-V2.6-Pro的游戏开发能力。提示词如下:

MiMo-V2.6-Pro花了64分钟完成游戏开发任务。开发出的游戏效果存在不少问题:赛道本身不清晰,路径没有严格限制好,初始状态下赛车的建模被埋在了下方。做得较好的地方是游戏操控感和整体的光影效果。

此外,在测试MiMo-V2.6-Pro游戏开发能力时,智东西还输入了一个3D世界游戏开发的提示词。在没有专业游戏开发工具依赖的情况下,MiMo-V2.6-Pro最终交付的3D世界本身构建不错,功能、下落的雨丝以及人物动作都比较合理,仅存在雨伞不在手上的小问题。

整体实测下来,MiMo-V2.6系列模型与上一代给我们的感受类似——主打性价比。模型基础能力不错,但在思考时间和执行任务的路径上存在一些问题,整体模型在任务交付效率上稍弱一些。

当然,智东西所做的实测均基于OpenCode上提供的模型进行,不能代表模型在小米官方Agent和API中的实际效果,也不能完全代表模型能力。

03. 结语:小米RSI道路新作,但模型能力仍需更多实测验证

从这次发布来看,MiMo-V2.6将重点放在了大规模RL训练的进一步扩展上:6天完成30个RL step、覆盖约75万条轨迹,训练任务也从编程延伸到Agent、视觉、3D、Computer Use以及科研任务。

与此同时,小米将RL训练环境、代码和技术报告一并开源,将训练过程中的基础设施、奖励机制等细节也公开出来。

从Benchmark到实际测试,MiMo-V2.6展现了较强的基础能力,但不同任务之间仍存在明显差异。尤其在长程任务中,模型的思考时间、工具调用和执行路径都会直接影响最终交付效率,实测过程中的表现也存在很多问题。

模型最终能走到什么位置,除了榜单分数,后续实际使用中的任务完成质量和效率同样重要。

小米希望通过持续扩大RL训练规模探索RSI,这条路线能否进一步提升模型的自主任务能力,还需要后续版本和更多实际任务来验证。在南宫平台,类似的模型评估和用户反馈也在持续进行中。

本文来自微信公众号 “智东西”(ID:zhidxcom),作者:毕伟豪,36氪经授权发布。

更多文章