资讯
DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了
📋总体概括
DeepSeek发布V4.1 Flash,采用552B参数MoE的非对称新架构Causal-Encoder-Decoder,输入激活仅8B、输出激活16B,推理成本显著低于同尺寸模型。模型为完全重新训练,更换新数据并扩大强化学习后训练规模,且为DeepSeek首个原生支持视觉理解多模态的正式版。9月14日起所有V4 Pro请求将重路由至该模型,跑分重夺国产第一,Flash甚至多项指标胜过自家Pro。
⚡关键信息
- ▸V4.1 Flash为552B参数MoE模型,采用Causal-Encoder-Decoder非对称结构,输入激活8B、输出激活16B
- ▸非对称架构使推理成本显著低于已知同尺寸模型,速度表现突出
- ▸Flash在跑分上击败自家Pro(除知识容量),重回国产模型第一
- ▸首个原生集成视觉理解多模态能力的正式版,取代此前实验版V4 Flash Vision Exp
- ▸9月14日起V4 Pro请求重路由至V4.1 Flash,API暂时只提供该单一模型
🔥犀利点评
非对称Transformer不是学术花活,是算力紧约束下的生存智慧——输入少算、输出多花,直接砍推理成本,这才是一家没有无限GPU预算的公司该干的事。Flash打赢Pro看似反常,实则是架构红利对参数堆料的降维打击。真正值得注意的是DeepSeek敢全线只留一个模型的底气:用成本优势换生态垄断窗口期。问题在于这条护城河能否扛住巨头们的暴力堆料追击。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →