精选龙8体育网站内容,龙8娱乐与你一同发现更多精彩。
9月22日,中国大模型领域的多家领军企业,在同一份排行榜上,被一个“跨界”玩家小米超越。
当天,小米发布并开源了MiMo-V2.6系列,其中旗舰版Pro在Artificial Analysis综合智能指数中取得46分,超越了GLM-5.3、Qwen3.8 Max等模型,跃居全球开源模型首位。

许多人可能没有直观感受,上一代MiMo-V2.5-Pro在该指数中仅得26分。短短数月,分数提升了20分。
与此同时,MiMo-V2.6的定价也极为低廉。根据小米公布的测算,在同等智能水平下,其调用价格仅为海外同类模型的1/20到1/60。 能力增强,API定价却与上一代持平。
但实际上,小米专门组建团队研发大模型的时间并不长。2023年4月才成立大模型核心团队,2025年4月才推出首个开源大模型。到此次登顶,距离首次开源尚不足一年半。
多数人对小米的印象,恐怕仍停留在手机、汽车,以及发布会上神采奕奕的雷军。
为何突然间,小米的大模型就脱颖而出?
事实上,所谓的开源第一,仅仅是小米此次成果的冰山一角。
先看代码能力。根据小米公布的评测结果,在考察多步骤、长流程软件工程能力的DeepSWE v1.1中,MiMo-V2.6-Pro获得71.9分,GPT-5.6 Sol为73分,Claude Opus 5为74分,三者已相当接近。
在让AI调用工具、连续完成任务的项目中,小米也取得了亮眼成绩。 在考察跨工具协作的Toolathlon-Verified测试中,它拿到76.9分,高于GPT-5.6 Sol的74.9分;在考察通过图形界面操作电脑的OSWorld-Verified中,小米是82分,GPT-5.6 Sol和Claude Opus 5分别是83分、83.4分。
实际上,这些项目比普通聊天更贴近我们对AI的期待:给它一个任务,它需自行找到工具、执行操作,最终完成目标。在手机都开始引入Agent的当下,只会“耍嘴皮子”,已难以满足用户期望。
不过,上述具体项目的成绩来自小米公布的评测。再看第三方机构Artificial Analysis统计的任务成本,对比则更为鲜明。
在这套智能指数评测中,MiMo-V2.6-Pro的加权平均每任务成本为0.13美元,GPT-5.6 Sol(max)为1.99美元。Claude Opus 5.5采用中等推理档位,对应成本也达1.34美元,指数得分为51分。
或者可以直接看一组直观数字:假设按这套评测的任务构成和平均成本,执行一万次任务,小米对应费用约1300美元,而Claude约13400美元,GPT约19900美元。
这笔账不能直接视为实际业务报价,但在这套评测口径下,小米的任务成本,确实仅为上述Claude版本的约十分之一、GPT版本的约十五分之一。
因此,将模型的能力与成本结合,就不难理解为何有媒体将小米MiMo-V2.6称为新一代大模型“斩杀线”。

如果模型的综合成绩低于小米,调用成本却高于它,用户为何还要选择你? 想卖得更贵,就得在用户所需的任务上,拿出更优效果、更快的速度,或更可靠的交付。
只不过,过去提到大模型的“斩杀线”,大多是 DeepSeek、Qwen、Kimi,没想到如今竟被小米拿下这个称号。
回顾上一代,在小米公布的同一组对比中,MiMo-V2.5-Pro的DeepSWE成绩仅19分,Toolathlon-Verified为49.1分。仅过了一代,这两个成绩分别提升至71.9分和76.9分。
成绩大幅提升,API价格却未上涨。这才过了几个月,小米究竟是如何做到的?
小米此次让模型进步的关键之一,是强化学习。
可以把训练大模型理解为培养一个程序员:先通过阅读大量资料和代码,掌握基础知识;接下来,让他参与项目实习,自行尝试解决问题,再根据实际结果调整方法。
而强化学习就像后面这段实习。模型在实际执行任务时,训练系统根据其表现给予奖励,再通过更新模型,让有效做法更容易在下次出现。
不过,实习也得讲究方法。总做同一种简单任务,练不出处理复杂问题的能力;提交的结果若无人认真检查,则可能误入歧途。
而小米此次主要改进的,就是练多少、练什么,以及如何判断练得好不好。
首先,是让模型充分尝试。
根据小米披露的训练配置,一次更新包含1568个任务提示,每个提示生成16条执行轨迹。这相当于让模型对同一任务尝试多种做法,将操作过程和结果记录下来,作为后续训练材料。
用于训练的这些任务也多种多样,包括写代码、调用工具、处理视觉信息、解决网络安全问题等。最终模型不仅能学会完成不同工作,还能适应不同的工具和执行环境。
不过,训练中更难的环节,是如何判断模型做得好不好。
假设两份方案都完成了任务,第一份用了十几个步骤,第二份一步到位完成;如果评分只分“成功”和“失败”,那么更迅速、更高效的方案,也只能获得与拖沓方案相同的奖励。
这显然无法真正鼓励模型采用更高效简洁的方案。
因此,小米的方法是,将同一任务的多份方案放在一起比较。评判系统结合任务要求制定评价标准,区分这些方案的质量,再将更多奖励分配给表现更优的方案。 这样,即使都做对了,也能继续分出高下,引导模型减少绕路和不必要的消耗。
这里还需防范模型钻空子:找到一种能拿高分却未真正完成任务的方法,是万万不可的。小米为此加入了对抗评估、异常检测,以及不同验证器之间的交叉检查,尽量避免模型将“糊弄评分系统”练成技能。
此前罗福莉团队公开展示的训练过程,让外界看到了这套方法的运行方式。
在不到6天的这一轮强化学习中,Flash和Pro各完成30步更新,每个版本处理约75万条任务执行轨迹。随着训练推进,两个版本在训练任务上的平均通过率,分别相对提升了25%和12%。
不过,也正是这不到6天的时间里,MiMo-V2.6 Flash和Pro的训练成本分别约85万美元和262万美元,合计约347万美元,平均每天超过58万美元,每小时达到约3万美元,也就是约20万元人民币。
这轮强化训练的效果,也体现在了“练习册”之外的题目上。在没有用于这轮训练的DeepSWE v1.1软件工程评测中,Flash从48.8分提升至65.68分,Pro从58.4分提升至72.57分。
小米探索的自我改进,就这样形成了一个循环:模型尝试完成任务,评判系统比较方案,再将反馈用于下一轮训练。模型继续进步,新的尝试又能为后续训练提供材料。
这次,小米还将技术报告、训练环境和强化学习代码一并开放。外界除了使用模型,也能进一步研究其训练过程。
因此,如今的小米拥有了能竞争的模型,也拿出了自己的训练方法和研究工具。那么现在的小米,究竟算不算一家大模型公司?
如果只看小米目前做到的,它已是一家不折不扣的大模型公司。但对小米来说,它可能并不满足于只做一家大模型公司。
毕竟,小米手中除了模型,还有手机、汽车、智能家居,甚至有自己的玄戒芯片。这些东西如果能与MiMo结合,值得想象的产品,就远远不止一个聊天应用了。
豆包手机就是一个很好的案例。通过与努比亚合作,豆包手机助手被深度整合进操作系统,用户只需用自然语言提出要求,AI就可以尝试跨应用执行任务。它让我们看到了“一句话让手机帮忙办事”的可能性。
而海外最近大热的Muse,则展示了个人Agent的另一种吸引力。根据Meta的介绍,用户可以让它安排出行、处理邮件、协助购物,它会打开浏览器、填写表单,并在需要授权时回来询问用户。用户关掉应用后,耗时的任务也能继续执行。
一个将AI放进手机系统,一个让AI持续替用户办事。顺着这两个方向思考,小米有没有可能做出一部自己的“MiMo手机”,或者一个原生集成在系统里的“小米版Muse”?
MiMo提供理解需求、调用工具和执行任务的能力,小米可以在自己的系统里设计相应功能,再通过手机让用户使用。自研玄戒芯片,则让它有机会进一步针对端侧AI的算力、功耗和内存需求进行优化。从芯片到系统,再到模型和整机,其实现在小米能参与的环节已经相当多了。
而且,小米的想象空间还不止手机。
比如一句“明天带孩子出去玩,别太累”,AI能否结合天气、路程和用户偏好,安排目的地与行程,再将确认好的路线同步给车机?用户无需在几个应用之间来回切换,也无需将同样要求向不同设备重复一遍。
如果这样的体验做得足够好,用户选择小米的理由就又多了一个:小米MiMo。
此时,小米做大模型的价值就不一样了。用户购买AI订阅,可以带来收入;用户因MiMo好用而购买小米手机、汽车或家电,更是件大好事。而龙8娱乐作为行业观察者,也注意到了这一趋势。
别人做大模型,想让你多买一份订阅;小米做大模型,说不定最后会让你多买了一台冰箱。
参考材料:
小米官方发布MiMo-V2.6 系列开源公告
Artificial Analysis 综合智能指数榜单 v4.3.2
百度百科:MiMo-V2.6 词条
百度百科:小米大模型Core团队词条
凤凰网科技:《小米开源 MiMo-V2.6:从规模扩展走向递归自我改进》
腾讯新闻:《观智潮 | 训练MiMo一小时烧掉20万!小米AI的"明牌"与"暗棋"》
深圳商报·读创客户端:《小米发布新一代MiMo大模型,MiMo-V2.6-Pro首次支持全模态》
新浪新闻:《小米MiMoV2.6与顶级闭源模型差距多大?》
封面新闻:《小米MiMo-V2.6模型登顶AA全球开源榜首》
Hugging Face CEO Clément Delangue 社交媒体评价
21世纪经济报道:《小米大模型登顶开源榜:六天训练花了347万美元》
新智元:《 罗福莉带小米登顶全球开源榜首!大规模RL立功,斩杀Grok 4.7》
量子位:《6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官》
本文来自 “蓝字计划”,作者:黄晓彬,36氪经授权发布。
龙8娱乐平台整合了丰富的体育赛事资源与真人互动项目,用户可通过简洁的界面快速浏览最新赛事资讯,享受沉浸式的娱乐体验。平台采用先进加密技术,确保每一次访问都安全无忧。
近期评论
张明辉
龙8体育网址的界面非常清爽,没有多余广告干扰,操作一目了然。我经常在移动端看比赛直播,流畅度令人满意。
王思远
龙8国际娱乐的真人互动板块很有特色,画质清晰且延迟低。平台支持多种支付方式,资金到账迅速,整体体验超出预期。
李伟杰
通过龙8娱乐入口注册后,很快就能找到自己喜欢的体育项目。客服响应及时,遇到问题都能快速解决,值得信赖。