Scaling Law论文的bug不只是技术问题,是整个行业方法论的原罪。它意味着过去5年间,所有基于「大力出奇迹「逻辑的算力投资,都建立在一个有缺陷的实验设计上。
更严重的是,这个bug的修复成本极高——历史上按错误配置训练的模型无法回炉重练,已固化在各家机构的技术债里。Chinchilla虽然指出了方向,但工程惯性让大家继续沿着旧路走了好几年。
对中国AI从业者的含义:DeepSeek等中国团队从一开始就处于算力受限状态,被迫做效率优化,反而绕过了这个陷阱。"算力不够效率补"的逼迫式创新,无意中走在了正确路径上。
Scaling Law bug事件、华为韬定律V2、HBM之父的「GPU利用率10%」三条信息同时出现,指向同一结论:大模型时代的基础假设正在被修正。下一代AI基础设施竞争的核心是存储-计算协同效率,而非单纯堆砌算力。这一认知转变的速度将决定各国AI产业的长期竞争格局。