小米 MiMo-V2.6 深度解读:46 分登顶开源榜首,1 万亿参数单任务成本不到 1 元
MiMo-V2.6-Pro 和 Flash 均采用稀疏混合专家(MoE)架构,原生支持文本、图像、视频和音频全模态输入(AA 实测确认 text/image/speech/video),最大上下文窗口…
📑 本页目录
小米 MiMo-V2.6 深度解读:46 分登顶开源榜首,1 万亿参数单任务成本不到 1 元
2026 年 9 月 22 日,小米正式发布并开源了全新一代 MiMo 大模型——MiMo-V2.6 系列,包含全模态旗舰模型 MiMo-V2.6-Pro、高效推理模型 MiMo-V2.6-Flash,并同步上线了 Pro 版超高速模式 V2.6-Pro-UltraSpeed 和 MiMo Desktop 桌面客户端正式版。这次发布被小米定义为探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算力,让模型在持续的探索与反馈中不断拓展智能边界。
一、双版本定位:1 万亿参数的“猛兽”与 3090 亿的“效率尖兵”
MiMo-V2.6-Pro 和 Flash 均采用稀疏混合专家(MoE)架构,原生支持文本、图像、视频和音频全模态输入(AA 实测确认 text/image/speech/video),最大上下文窗口达到 100 万 Token(AA 实测 1M tokens ✅)。Pro 版总参数约 1.02 万亿,每次推理激活约 420 亿参数(AA 实测口径:1.0T 总参数、42B 激活),路由专家总数 384 个,每次激活其中 8 个;Flash 版总参数 3090 亿,激活约 150 亿参数(以上架构参数为官方口径)。
两款模型共用视觉和音频编码器,并配备 5 层多 Token 预测模块用于投机解码,采用 DFlash 风格设计,每次前向传播可预测未来 7 个 Token 以进行并行验证。值得关注的是,Flash 版主干为 48 层(39 层滑动窗口、9 层全局注意力),滑动窗口为 128 个 Token,无共享专家,在效率层面做了深度优化(架构细节为官方口径)。
两个版本均以 MIT 许可证 在 Hugging Face 上开源权重(AA 确认 open weights + MIT,允许商业使用、微调和再分发,无收入门槛或研究条款限制)。Hugging Face 上发布的 Flash 版权重索引显示,65 个分片中共有 172.9 GB 权重数据,采用 FP8(e4m3)格式并配合动态激活方案,交付的是完整的大模型而非为笔记本瘦身的量化版本(模型卡口径)。
二、性能突破:46 分登顶开源榜首,半年提升 20 分
得益于强化学习算力的大规模扩展,MiMo-V2.6-Pro 在 Artificial Analysis 综合智能指数 v4.3.2 中取得 46 分(AA 实测确认,且排名 #1/114),超越 Kimi K3(44 分)和 GLM-5.3(45 分),成为该榜单上排名最高的开源权重模型。相较前代 MiMo-V2.5-Pro 的 26 分,一代之内提升了 20 分,堪称代际跃升(前代分数为官方口径)。
在具体基准测试中,Pro 版表现同样亮眼(均为官方评测口径):DeepSWE v1.1 获得 71.9 分,前代仅为 19 分;Terminal Bench 2.1 达到 89.9%,超越 Claude Opus 5 和 GPT-5.6 Sol;网络安全评测 CyberGym 取得 94.0% 的领先成绩。Flash 版在 DeepSWE v1.1 中也达到了 67.9 分,展现出远超参数规模的工程能力。在 Code Arena 评测中,MiMo-V2.6-Pro 整体排名跻身开源模型第三,与 Claude Fable 5 高配版并列。
小米官方也坦承,Pro 版与 Claude Fable 5.1 和 GPT-6 Astra(均为 53 分,AA 实测一致)等顶级闭源模型相比仍有差距。但在开源权重模型这一赛道上,MiMo-V2.6-Pro 已经站到了最高的位置。
三、定价策略:性能翻倍,价格不变,单任务成本不到 1 元
API 定价与前代 V2.5 完全持平(AA 实测确认 Pro 定价):Flash 版每百万 Token 输入 1 元、输出 2 元;Pro 版输入 3 元、输出 6 元,并提供 99% 缓存折扣。以美元计价,Flash 的输入/输出分别为 0.14/0.28 美元每百万 Token,Pro 为 0.435/0.87 美元(AA 实测一致)。
更有冲击力的指标来自单任务成本:MiMo-V2.6-Pro 实测每个智能指数任务成本仅 0.13 美元(AA 实测 0.133 美元,约 0.9 元人民币),首次将前沿智能带入“0.1 美元成本区间”。同等智能水平下,价格仅为海外模型的 1/20 至 1/60(对比口径来自官方)。
与 DeepSeek-V4-Pro 相比(空闲时段输入 0.15 元、输出 4.5 元/13.5 元),MiMo 便宜 33% 至 83%。而 Flash 版 2 元的输出定价,相较 DeepSeek-V4.1-Flash 高峰时段 8 元的输出价格,实现了大幅的成本压缩(对比口径来自官方)。
此外,UltraSpeed 模式在保持模型质量不变的前提下,输出速度最高可达标准 Pro 版的 20 倍,定价为输入 4.35/输出 8.70 美元每百万 Token,为对延迟敏感的企业级场景提供了分层选择(models.dev 已收录 V2.6-Pro-UltraSpeed,官方站确认 UltraSpeed 模式存在)。
四、技术路径:6 天烧掉 347 万美元,一场史上罕见的“炼丹直播”

MiMo-V2.6 系列的核心技术突破在于强化学习算力的规模化扩展。Pro 与 Flash 的后训练仅耗时不到 6 天,分别完成 30 个 RL step,训练成本约为 262 万美元和 85 万美元,合计超过 347 万美元(折合人民币超 2000 万元),累计约 75 万条训练轨迹。训练任务平均通过率分别相对提升 25% 和 12%(以上为官方技术口径)。
小米 MiMo 团队负责人罗福莉表示,按算力投入衡量,这“很可能是开源模型团队迄今完成的最大单次强化学习训练”。在她看来,MiMo-V2.6 背后的研究创新和工程难度,甚至超过她曾部分参与的 DeepSeek R1。
在训练方法上,小米从三个维度扩展 RL 算力:
- 更大的 Batch 与更高吞吐——采用大 Batch 和全异步架构,单次更新使用 1568 个样本、每个样本 16 次尝试,一批包含 25,088 条尝试轨迹,单步训练 Token 达 3.5 至 3.7B,支持 100 万上下文长度训练。
- 更多任务与复杂环境——构建覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系,并混合多个 Harness 框架。
- 更大的 Grader 算力——通过 Group 内相对比较,为长程 RL 任务提供更精准、多样的奖励信号,形成模型自我改进闭环,并引导模型以更短路径、更少 Token 完成任务。
随着训练规模扩大,小米冻结 MoE Router 以抑制专家负载漂移,并建立覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的 Reward Hacking 防线。
更让行业震撼的是,罗福莉在 9 月 17 日直接公开了 MiMo-V2.6 的训练直播,向外界展示训练步数、Token 消耗、任务通过率、评测成绩和累计费用。训练合计每小时约 3.08 万美元(折合人民币超 20 万元)。Jina AI 创始人 Han Xiao 称赞公开训练流程的大胆与开放,Hugging Face CEO 也评价“令人惊艳”(社区反馈口径)。
五、能力扩展:从 Vibe Coding 到 Vibe World
MiMo-V2.6 融合了 3D 空间推理、多模态感知与计算机操作能力,推出了 “Vibe World”范式——用户输入图片、视频或文字后,模型可将需求拆解为多个任务,由多智能体协作完成 3D 场景搭建、交互逻辑编写与视觉验证,最终生成可运行的交互世界(官方演示口径)。
在具身仿真环境中,模型可直接以多视角相机画面为输入,通过视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色匹配与精准放置。在 Blender 3D 建模中,MiMo-V2.6 能根据文字描述或参考图片完成三维建模,生成可用于动画制作、3D 打印与游戏开发的 3D 资产。
Pro 版还以“Co-Scientist”角色参与真实科研:协助筛选用于吸附 PFAS 的候选材料,以及在 Lean 4 中完成超过 6000 行可验证代码的定理形式化。在音乐创作方面,模型还展示了为约十种乐器编写管弦乐总谱并自主转换为 MIDI 格式的能力。
不过用户实测反馈褒贬不一。有开发者反映 Pro 版“速度太慢,总是触发雷霆大思考”,有人反馈 Flash 在 OpenCode 中会不断循环执行命令和读取文件,执行能力较差。但也有用户表示 Flash“品味分第一,速度和价格跟 DeepSeek V4.1 Flash 打平”,说话风格自然流畅,没有为了 Token 效率变成“caveman”风格(社区实测反馈,仅供参考)。
六、开源力度:不只是权重,而是一整套 RL 基础设施
除了模型权重和技术报告,小米还公开了约 7000 个训练任务环境、配套 RL 训练框架、基于 verl 的端到端训练流程、轻量化 Agent 框架以及一个 90 亿参数的蒸馏模型 MiMo-V2.6-Distill-Qwen-9B。任务环境覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务(官方口径)。
这一开源力度在全球大模型社区引发强烈反响。有 AI 研究者评价“开源模型与闭源前沿之间的差距,又被大幅缩小了,而且这一次出手的还不是大家熟悉的中国玩家”。斯坦福学者等海外 AI 研究者将其称为“最具分量的大规模 RL 公开资源之一”(社区评价口径)。
七、战略布局:三年 600 亿,AI 贯穿“人车家全生态”
MiMo-V2.6 的发布是小米 AI 战略加速推进的最新注脚。雷军此前在春季发布会上宣布,未来三年小米计划在 AI 领域投入超过 600 亿元,其中 2026 年的 AI 研发与资本开支已超 160 亿元(公开报道口径)。
对小米而言,AI 并非孤立的技术赛道,而是贯穿“人车家全生态”的连接器。MiMo 大模型已登陆 Xiaomi Miclaw AI 原生手机、MiMo Studio、金山办公、小米浏览器等产品。新一代小米 SU7 全系标配升级的 XLA 认知大模型,首次打通“辅助驾驶”和“具身机器人”两大任务,通过融入 MiMo-Embodied 具身基座模型,让车辆能融合视频、雷达、声音甚至机器人物理数据,更全面地理解真实世界(官方产品口径)。
高盛在研报中指出,小米正加快将其 AI 研发投资转化为实质性成果,凭借领先的多模态 AI 能力及在“人车家全生态”中丰富的应用场景,小米有能力捕捉全球 AI 模型行业的增长潜力,同时创造差异化的消费级 AI 终端(公开报道口径)。
结语
从 26 分到 46 分,从“无人在意”到登顶开源榜首,小米 MiMo 团队用半年时间完成了一次代际跃迁。6 天 347 万美元的 RL 训练投入,换来的不只是一个榜单第一,更是一次对“强化学习究竟能扩展到哪里”的极限探索。在开源权重模型的赛道上,小米已经站到了最高的位置;而在通往 AGI 的长路上,这或许只是小米 600 亿投入计划中的第一声号角。
📌 数据说明:本文关键信息经多源核验(2026-09-23):① Artificial Analysis /models/mimo-v2-6-pro 实测(Intelligence Index 46 分且排名 #1/114、1.0T 总参数/42B 激活、MIT 开放权重、In 0.435 / Out 0.87 美元 / 99% 缓存折扣、任务成本 0.133 美元、1M 上下文、text/image/speech/video 全模态输入、2026-09 发布);② models.dev(xiaomi 直接提供 mimo-v2.6-pro/flash/pro-ultraspeed,knowledge=2026-09-22);③ 小米官方站点 mimo.xiaomi.com(MiMo-V2.6-Series、MiMo Desktop、UltraSpeed 模式)。DeepSWE/Terminal Bench/CyberGym 等基准分数、训练成本 347 万美元/6 天/75 万轨迹、Flash 版定价 1 元/2 元、HF 权重 172.9GB/65 分片 FP8 等为官方发布/模型卡口径;用户实测反馈与社区评价为社区口径,仅供参考。