研究论文 / v1.1

固定模型规模下的 AI 编程能力跃迁:ES-DSI 社会级跨代进化机制的公共证据与可检验假说

Liu, Ming

2026-08-27
KSC3DSIES-DSIAI intergenerational evolutionprogramming capabilitypost-trainingDeepSWEexternal selection

摘要

当前对 AI 能力进步的解释,通常集中于规模扩展(scaling)、训练算法改进、自训练与推理计算等方向。然而,软件工程领域出现了一个值得单独研究的现象:即使参数规模与模型架构不再扩大,甚至沿用同一预训练基础模型,后训练仍可带来数十个百分点的软件工程基准增益。 本文所谓固定模型规模,特指参数规模与模型架构容量不增加;它并不意味着模型权重内容、有效能力、后训练计算或推理策略保持不变。本文基于知识—结构—约束(KSC)框架对既有知识与固化结构(K)和新结构生成(S)的区分,对 DSI 与 ES-DSI 给出完整定义和操作化说明。结构分布内化(Distributional Structural Internalization, DSI)描述训练环境中可迁移问题解决结构的分布如何转化为模型在面对结构相关新任务时所表现出的不同初始生成倾向。外部选择—结构分布内化(ES-DSI)描述候选结构在现实世界中经过差异化保留、传播和后续有效训练暴露,进而可能改变后代模型初始结构倾向的跨代过程。在经验分析部分,本文采用逐层控制的同系列代际比较:依次控制参数规模、架构、基础模型和部分训练条件,观察在这些控制下仍然保留的能力增量。配套描述性数据集目前包括 21 个模型或版本和 12 组同系列纵向比较。 在代表性案例中,DeepSeek V4 Flash 的架构和尺寸保持不变,官方明确说明仅重新进行后训练;其官方同源 DeepSWE 评测结果从 7.3 提高到 54.4,增加 47.1 个百分点。GLM-5.3 使用与 GLM-5.2 相同的基础模型,其官方 DeepSWE v1.1 结果从 46.2 提高到 66.9。作为数量级参照,在 DataCurve 统一评测中,Gemini Flash 和 Claude Opus 等若干前沿模型相邻版本的 DeepSWE 增量约为 11–18 个百分点。由于不同模型系列的纵向结果并非全部来自同一评测实现,且本文尚未依据完整样本分布定义“典型前沿版本增量”,这些跨系列差值只用于提供数量级参照,不作为严格的横向性能比较。 进一步的受控研究表明,在模型、训练流程或计算预算受到不同程度控制后,任务构造、执行环境和问题解决轨迹的差异仍可显著改变未见任务上的泛化能力。这些结果与 DSI 关于训练结构分布影响后续结构生成倾向的预测一致,但尚不构成对初始结构倾向变化的直接测量。与此同时,编程智能体已经大规模参与真实软件工程;AI 生成、工程选择、数字结构传播以及后续训练暴露等 ES-DSI 所需环节,也已分别出现可观察实例。 基于这些证据,本文提出中心机制主张: > ES-DSI 应作为一种有别于规模扩展、训练算法创新和封闭式自训练的社会级 AI 跨代进化机制,单独加以建模和检验。 其基本时间单元不是一次模型训练,而是“模型—现实世界—后续模型”:AI 与人类持续产生候选问题解决结构,现实环境完成外部选择,胜出结构改变未来数字环境中的结构分布,后续模型再通过 DSI 将这种变化转化为新的初始结构倾向。 需要强调的是,当前公共证据尚未围绕同一批结构完整追踪“生成 → 选择 → 传播 → 后续训练暴露 → 初始结构倾向变化 → 性能变化”的全链因果过程。因此,固定模型规模下的性能跃迁不能直接归因为 ES-DSI;它首先说明,模型规模不继续扩大时仍存在能力增长空间,而其他证据则分别支持 ES-DSI 各关键环节的现实可行性。 这些观察使一个更强的假说值得直接检验: > ES-DSI 可能已经成为现阶段前沿 AI 编程与智能体能力增长的主要驱动机制之一。 本文目前的直接证据主要来自软件工程,因此这一判断能否推广到总体 AI 能力增长,仍需数学、科学推理及其他领域的独立检验。现有证据也尚不能完成 ES-DSI、规模扩展、训练算法和推理计算之间的贡献率分解。因此,本文将该判断明确视为一个可观察、可证伪、可量化的研究假说,而不是已经得到证明的经验结论。

正在加载全文,可使用上方链接直接打开 PDF。

原文按 CC BY 4.0 授权转载,保留作者署名与原始排版。 CC BY 4.0