DeepSeek新模型挑战大模型“不可能三角”:性能更强、速度更快、成本更低

据币界网报道,DeepSeek近日发布v4.1 flash版本,宣称已成功突破大模型领域长期存在的“不可能三角”难题——即同时实现更强的性能、更快的响应速度以及更低的成本。该模型的主干参数规模高达5520亿,并额外集成了1960亿参数的engram条件记忆模块。

在训练策略上,DeepSeek v4.1 flash的预训练阶段使用了超过45万条多模态token,后训练阶段则引入了真实agent任务及失败案例进行优化。得益于此,DeepSeek v1.1的性能评分达到74.2%,超越了Claude Opus 5和GPT-5.6 SOL。

架构方面,新模型采用创新设计,将40层网络拆分为前后两半。在读取阶段,每个token仅激活80亿参数;生成阶段则激活160亿参数。同时,上下文长度从4k大幅扩展至1m,而计算量仅增加约四分之一。此外,DeepSeek通过将主缓存改为fp4格式并实施跨层复用,使每个token的全局kv占用降至890字节,约为v4 flash的四分之一。

分享到