(野生)DeepSeek火了 速:度碾压官方、版 权重开源

2025-07-23 06:24:12      来源:豆丁网

机器之心报道

没等来DeepSeek官方的R2,却迎来了一个速度更快、性能不弱于R1的「野生」变体!

这两天,一个名为「DeepSeekR1T2」的模型火了!

这个模型的速度比R1-0528快200%,比R1快20%。除了速度上的显著优势,它在GPQADiamond(专家级推理能力问答基准)和AIME24(数学推理基准)上的表现均优于R1,但未达到R1-0528的水平。

在技术层面,采用了专家组合(AssemblyofExperts,AoE)技术开发,并融合了DeepSeek官方的V3、R1和R1-0528三大模型。

当然,这个模型也是开源的,遵循MIT协议,并在HuggingFace上开放了权重。

HuggingFace地址:https://huggingface.co/tngtech/DeepSeek-TNG-R1T2-Chimera

经过进一步了解,我们发现:DeepSeekR1T2是德国一家AI咨询公司「TNG」推出的,模型全称为「DeepSeek-TNGR1T2Chimera」(以下简称R1T2)。

该模型除了前文提到的在智力水平和输出效率之间实现完美平衡之外,相较于这家公司的初代模型「R1TChimera」,智力大幅跃升,并实现了突破性的think-token一致性。

不仅如此,即使在没有任何系统提示的情况下,该模型也能表现稳定,提供自然的对话交互体验。

在评论区,有人误以为这个模型出自DeepSeek官方,并且认为他们是不是也在走相同的路线:给模型起各种名称,就是不用主系列下一代版本号?

更多的人认可该模型「找到了智能与输出token长度之间的最佳平衡点,并且提升了速度」,并对该模型在现实世界的表现充满了期待。

模型细节概览

从HuggingFace主页来看,R1T2是一个基于DeepSeekR1-0528、R1以及V3-0324模型构建的AoEChimera模型。

该模型是一个采用DeepSeek-MoETransformer架构的大语言模型,参数规模为671B。

R1T2是该公司4月26日发布的初代模型「R1TChimera」的首个迭代版本。相较于利用双基模型(V3-0324+R1)的初代架构,本次升级到了三心智(Tri-Mind)融合架构,新增基模型R1-0528。

该模型采用AoE技术构建,过程中利用较高精度的直接脑区编辑(directbrainedits)实现。这种精密融合不仅带来全方位提升,更彻底解决了初代R1T的token一致性缺陷。

团队表示,R1T2对比其他模型具备如下优劣:

与DeepSeekR1对比:R1T2有望成为R1的理想替代品,两者几乎可以通用,并且R1T2性能更佳,可直接替换。

与R1-0528对比:如果不需要达到0528级别的最高智能,R1T2相比之下更加经济。

与R1T对比:通常更建议使用R1T2,除非R1T的特定人格是最佳选择、思考token问题不重要,或者极度需求速度。

与DeepSeekV3-0324对比:V3速度更快,如果不太关注智能可以选择V3;但是,如果需要推理能力,R1T2是首选。

此外,R1T2的几点局限性表现在:

R1-0528虽推理耗时更长,但在高难度基准测试中仍优于R1T2;

经SpeechMap.ai(由xlr8harder提供)测评,R1T2应答克制度(reserved)显著高于R1T,但低于R1-0528;

暂不支持函数调用:受R1基模型影响,现阶段不推荐函数调用密集型场景(后续版本可能修复);

基准测试变更说明:开发版由AIME24+MT-Bench变更为AIME24/25+GPQA-Diamond测评体系,新体系下R1与初代R1T的分差较早期公布数据更大。

最后,关于R1T2中重要的AoE技术,可以参考以下论文。

论文标题:AssemblyofExperts:Linear-timeconstructionoftheChimeraLLMvariantswithemergentandadaptablebehaviors

  近些年我们也能看到这些举措,中国推出大规模减税降费政策,有不少是长期执行的制度性政策。比如为消除重复征税,营业税改为增值税;增值税基本税率从17%降至13%;个人所得税也通过扩大税率级距、增加专项附加扣除、提高起征点,实际降低了税负;城镇职工基本养老保险单位缴费比例降至16%等。

责编:甯国华编辑

唐僧都开始卖房了

  参与运营北京奥林匹克森林公园西畔的国家网球中心两片红土网球场地的维宁体育创始人、CEO纪宁8日告诉《环球时报》记者:“本就稀缺的网球场馆在郑钦文夺冠后变得更加炙手可热,现在根本都约不上。”

王欣瑜比战胜萨姆索诺娃

  美国财政部本周早些时候也公布了新的反俄制裁方案,涉及俄罗斯以及中国等其他国家的300多家公司、银行和数十名个人。中国外交部发言人林剑13日表示,美国在全球范围内滥施单边制裁贻害无穷,严重损害他国主权安全,造成人道惨剧,破坏产供链稳定。乌克兰危机升级后,美方制裁更是变本加厉。而这种乱舞制裁大棒的做法,不仅无助于问题的解决,反而成为世界一个主要的风险源头。

李沐宸因家庭变故至今还在还债

  “实际上就是‘打样’。”李瀚明认为,国泰开航证明了乌鲁木齐机场具备保障顶级航司的能力,会产生示范效应。国泰飞得好,其他国际顶级航司,以及东亚、东南亚的航司都会考虑跟进。除了证明机场的保障能力,也是新疆以此为契机,对外释放开放活力的强烈信号。

歌手补位

  陈玉祥严重违反党的组织纪律、廉洁纪律、工作纪律和生活纪律,构成严重职务违法并涉嫌受贿犯罪,且在党的十八大后不收敛、不收手,性质严重,影响恶劣,应予严肃处理。依据《中国共产党纪律处分条例》《中华人民共和国监察法》《中华人民共和国公职人员政务处分法》等有关规定,经中央纪委常委会会议研究并报中共中央批准,决定给予陈玉祥开除党籍处分;由国家监委给予其开除公职处分;收缴其违纪违法所得;将其涉嫌犯罪问题移送检察机关依法审查起诉,所涉财物一并移送。

苏超常州比南京

  国泰航空之前已在内地开通19个航点,但这次格外用心,为乌鲁木齐航线专门投放了配备可全平躺商务舱座椅的A330-300宽体机,在机载娱乐系统加入了《我的阿勒泰》,商务舱酒单上还出现了新疆产的红酒。

习近平主席中亚之行高光时刻

  第一,台内务问题难解。近期“在野”党主导的台立法机构改革行动,造成“朝野”关系紧张、立法机构议事冲突频传;台行政机构提复议案让行政和立法冲突浮上台面,政党纷纷走上街头诉诸群众,政局动荡、人心不安。/p>

韩沐伯结婚

  国家体育总局体育文化与体育宣传发展战略研究中心高端智库骨干专家、广州体育学院教授曾文莉告诉《环球时报》记者,体育具有较强的杠杆效应,以体育赛事表演为杠杆,能撬动城市基建、旅游、文化等,激活体育消费热情,推动体育产业能级提升,而这个杠杆的原动力主要是运动员尤其是明星运动员。/p>

霍震霆曝儿子霍启仁已结婚

  去哪儿数据显示,消息发布后,去哪儿平台“澳大利亚”机票搜索量环比增长四成以上。在去哪儿平台上,飞往澳大利亚的航线覆盖多个城市。悉尼可直飞北京、上海、广州、深圳、成都、杭州、重庆、南京、厦门、天津、济南、西安、海口、郑州、太原等多个城市,暑期从郑州、重庆、天津往返悉尼更便宜,价格在2500元左右。此外,墨尔本可直飞北京、上海、广州、成都、杭州、南京、厦门、青岛、海口等城市,上海、广州也有直飞布里斯班的航班在售。从旅游订单来看,大堡礁、悉尼歌剧院、出海观海豚受到旅客欢迎,8-12日团预订更多。在澳大利亚,旅客可以出海观鲸、看企鹅归巢,体验特色风情。