小米MiMo V2.6的新功能让我刮目相看

热点资讯

6160

在过去,我使用小米的模型主要是为了价格便宜,执行一些固定的批量任务,比如定时处理邮箱内容和分类新信息。然而在19号的小米MiMo-V2.6-Pro和Flash的RL训练直播中,我感到非常兴奋,未曾料到五天后就发布了三款模型,分别是Pro、Flash和Pro-UltraSpeed,UltraSpeed的速度竟能达到Pro的20倍。我第一个查看的就是价格,和我之前使用时相似。Pro的缓存命中费用为每百万0.025元,而Flash是0.02元,输出端费用则为Pro6元,Flash2元。如果不急于得到结果,非实时的批量推理还能享受五折优惠。与同类海外模型相比,价格差距可达1/20至1/60。

我突然想到一个新使用场景:将jev、deepseek和mimo结合,执行长期的批量任务。因此我查看了分数,在Artificial Analysis中,MiMo-V2.6-Pro的得分为46.32,排名开源和国产第一,和Grok 4.7持平。相比之下,V2.5仅为26分,短短一次迭代就提升了20分,真是令人惊艳。这个分数是基于十项评测综合得出的,包括Terminal-Bench 4.0、CritPT等。我略过厂商提供的benchmark,挑选了一些我关心的指标来看,一个是Terminal-Bench 4.0,MiMo-V2.6在开源模型中排名第三,仅次于GLM-5.3和Qwen 3.8 Max。再一个是CritPT,在物理推理方面,它的排名仅次于GPT和Claude。此外,我关注的DeepSWE v1.1的分数也有显著提升,Pro的得分从58.4涨至72.57,Flash则从48.8涨至65.68。值得注意的是,尽管分数有所提高,但模型的基础没有更换,仍然是V2.5版本,参数量为1.02T,提升主要归功于后训练。

在同一天,Grok 4.7也发布了,虽然AA上同样是46分,但价格却贵了20倍。而且这一代的生成速度下降,从60降至38.8,生成的token数量从94M增至240M,每个任务成本也从1.86美元升至3.74美元。这让小米在开源和API价格上显得尤为优势。 龙8头号玩家

接下来是实测环节。我选择的第一个案例是网站复刻,这个案例来自我们的goodcase。通常测试模型前端能力的流程很固定,我会提供提示词或几张截图,因为大多数模型只支持图像,无法处理视频。而MiMo-V2.6具备全模态能力,可以直接处理视频。我将录屏内容直接上传,添加一句话指令:“复刻一个一模一样的网站。”结果让我大感惊叹,复刻页面的滚动感和动效节奏都完全符合录屏,呈现出了一种电影般的连贯效果。

接下来进行了一个有趣的挑战:鹈鹕骑自行车。这是一个常见的测试题目,因为它集中了模型生成图像的所有难点。我让MiMo-V2.6生成一个“鹈鹕骑自行车”的SVG动画,结果超出了我的预期。除了基本的转动轮子外,它竟然还让脚踏板转动,腿部运动自然,膝盖摆动符合逻辑,甚至还有了倍速调节,速度变化也与轮子的转动同步,非常有趣。

最后,我想做一份PPT。这次还有配套的桌面端直接使用MiMo V2.6。这个Agent的功能与其他产品相似,基本都有。我决定进行一个高难度的任务,搜索关于阿尔忒弥斯II绕月的材料,整理WAV中的要点和PDF中的任务优先级,合成清晰结论。原本对排版没有太高期望,最终交付的结果却超出了我的想象,呈现出条理清晰的故事流,涵盖了从发射到月球飞越的整个过程。 龙8头号玩家

提供篮球教练的专业培训课程和认证服务,帮助提升教练员的训练水平。...

提供篮球教练的专业培训课程和认证服务,帮助提升教练员的训练水平。...