研究论文 / v1.0

MRAC Bench:基于多轮审计收敛的软件工程评测方法与基础设施

刘, 明

2026-09-16

摘要

软件工程评测需要持续获得贴近真实开发、具有区分度且制作成本可承受的任务。本文提出 MRAC Bench,一种基于多轮审计收敛(Multi-Round Audit Convergence,MRAC)的评测方法与基础设施。其核心思路是:以审计修复轨迹作为条件性信号,观察 AI 系统能否在给定任务与资源约束下,对相关搜索空间形成稳定有效覆盖,即持续识别并协调影响交付的关键约束、依赖和验证要求。被测系统围绕固定目标执行、接受独立审计并反复修复,评测结合预算内收敛情况、过程轨迹和资源消耗。审计可以面向需求与方案规范,也可以面向代码变更等执行结果。 候选任务从真实仓库和变更需求生成,再通过运行筛选、校准难度与适用能力范围。构造过程不要求逐题预先制作完整参考实现或专用验收器,有望大幅降低任务制作门槛。通过调整变更范围、跨模块影响和约束组合,还可以持续构造能力边界附近的任务。只要真实工程仍能提供更复杂且可有效审计的任务,评测机制就有望随模型进步持续扩展。 为控制规模化复现的成本,本文采用规范审计开展先导实验,现有记录呈现三档模型在持续未收敛、逐步趋稳和快速稳定方面的轨迹差异。这些观察尚不能直接证明覆盖程度或普遍的能力排序。审计漏检与模型间审计偏好可能影响信号含义,跨模型可比性、重复性、成本优势和难度扩展仍需系统检验。本文进一步讨论行业影响,并设计针对信号方向、难度上限和必要制作成本的三类反例。

正在加载全文,可使用上方链接直接打开 PDF。

原文按 CC BY 4.0 授权转载,保留作者署名与原始排版。 CC BY 4.0