架构和参数量没变,Agent 为什么还能变强?拆解 DeepSeek V4-Flash-0731 的后训练逻辑
DeepSeek-V4-Flash-0731 没有扩大架构和参数规模,却交出更高的 Agent 测试成绩。关键不是参数“没变”,而是参数量没变、权重经过了新的后训练。本文拆解后训练如何重塑长链路决策,也说明厂商成绩里 Harness 与推理预算的影响。
AI AgentDeepSeekDeepSeek-V4-Flash
Writing topic
围绕这个关键词继续探索。
DeepSeek-V4-Flash-0731 没有扩大架构和参数规模,却交出更高的 Agent 测试成绩。关键不是参数“没变”,而是参数量没变、权重经过了新的后训练。本文拆解后训练如何重塑长链路决策,也说明厂商成绩里 Harness 与推理预算的影响。
DeepSeek的推理为什么比别人便宜一个数量级?——MLA、MoE、MTP技术拆解 如果你最近调过各家大模型的API,你一定注意到一件事。 GPT-4o 的价格大概是输入 $2.5/1M token,输出 $10/1M token。Claude Opus 4 更贵一些。但 DeepSeek V3…