GPT-5.6全量上线是本周最重要的模型事件,但故事比跑分复杂。官方宣称Terminal-Bench、DeepSWE全面领先,单任务成本约为Fable 5一半。但第三方Artificial Analysis显示Sol智能指数59分仅贴近Fable 5的60分,且Codex+Sol才以80分登顶编程榜——说明OpenAI自己也需要多模型组合才能胜出。更关键的是作者实测深度项目协作,GPT-5.6显得死板,一小时未完成Fable 5十分钟搞定的任务,额度消耗极快。跑分≠真实能力,这个裂缝正在扩大。
Databricks 3000+工程师实测提供了另一个视角:同一模型换执行框架成本差近2倍。GLM 5.2质量与Opus 4.8基本持平但成本$1.28 vs $1.94。这意味着模型选择正在从「谁的跑分高」转向「谁的性价比高」——当天花板效应显现,框架效率和成本控制比模型能力更重要。
No Priors播客中Noam Brown关于test-time compute的讨论与GPT-5.6的困境呼应:推理时动态分配算力比静态训练更高效。GPT-5.6跑分领先但深度协作逊色,可能正是因为它优化的是静态benchmark而非动态推理效率。