ESC
AI 1 分钟阅读

编程智能体Harness设计实证研究:上下文管理、规划与动作空间如何影响性能

arXiv新论文通过固定执行循环、变化规划、动作空间与上下文管理三个组件的轻量级编程harness,在SWE-Bench Verified与Terminal-Bench 2.1上对4个模型开展176组匹配实验。结果显示:上下文窗口越紧,上下文管理价值越高;先规则删减再LLM摘要效率最佳;规划对强模型主要省成本;bash能力强的模型仅需bash接口即可大幅降低成本。

来源:Hacker News

计算机科学 > 人工智能

提交日期:2026年9月17日

标题:编程智能体Harness设计的实证研究(An Empirical Study of Harness Design for Coding Agents)

作者:Run-Ze Fan、Zihao Zhang、Simin Ma、Yebowen Hu、Shouju Wang、Kaiqiang Song、Fei Liu、Hamed Zamani、Xiaoyang Wang

查看该论文PDF:An Empirical Study of Harness Design for Coding Agents,作者为 Run-Ze Fan 及其他8位作者

查看PDF | HTML(实验性版本)

摘要:编程harness(coding harness)决定了自主编程智能体如何将模型能力转化为长程软件工程性能,然而现有工作通常将harness作为整体系统进行评估,导致各组件的有效性尚不明确。为实现组件级比较,我们通过一个轻量级编程harness来研究这一问题:其执行循环保持固定,同时变化三个组件——规划、动作空间和上下文管理。我们在SWE-Bench Verified和Terminal-Bench 2.1上评估了4个模型,共涵盖176个匹配设置,包括5种上下文管理策略、4种上下文窗口预算,以及针对规划和动作空间的定向消融实验。我们发现:(1) 随着上下文窗口预算收紧,上下文管理的价值不断提升,其收益主要来自防止上下文溢出导致的失败。(2) 在基于LLM的摘要之前先执行基于规则的删减(elision),在所有上下文管理策略中提供了最佳的整体效率;而让被删减内容可恢复所增加的机制,模型很少使用,且未带来准确率提升。(3) 规划的角色从弱模型的准确率脚手架转变为强模型的成本节约手段,准确率变化很小。(4) 预定义工具能提升bash能力较弱模型的性能,而具备bash能力的模型仅凭bash接口也能高效运作,并实现显著更低的成本,尤其是在以命令行为中心的任务上。轨迹层面的分析解释了这些效应:上下文管理在不显著改变智能体行为的情况下延长了执行轨迹,规划改变了轨迹停止的位置,而动作空间改变了代码编写的粒度。这些发现为面向模型和预算感知的harness设计提供了参考,并为评估未来harness组件提供了模块化框架。

评论:(无)

学科分类:人工智能(cs.AI);计算与语言(cs.CL);机器学习(cs.LG);软件工程(cs.SE)

引用方式:arXiv:2609.20804 [cs.AI]

(或使用本版本的 arXiv:2609.20804v1)

https://doi.org/10.48550/arXiv.2609.20804

arXiv通过DataCite签发的DOI(待注册)

提交历史

来自:Run-Ze Fan(查看邮箱) [v1] 2026年9月17日 星期四 17:58:07 UTC(6,713 KB)

全文链接:

访问论文:

  • 查看PDF
  • HTML(实验性版本)
  • TeX源码

查看许可证

当前浏览上下文:

cs.AI

[新论文] | [近期论文] | [2026年9月]

可通过 cs.CL、cs.LG、cs.SE 切换浏览学科。

参考文献与引用

  • NASA ADS
  • Google Scholar
  • Semantic Scholar

BibTeX格式引用

数据提供方:

文献与引用工具

Bibliographic Explorer(文献浏览器)、Connected Papers、Litmaps、scite.ai

与本文相关的代码、数据与媒体

alphaXiv、CatalyzeX Code Finder for Papers、DagsHub、GotitPub、Hugging Face、ScienceCast

演示

Replicate、Hugging Face Spaces、TXYZ.AI

相关论文

推荐与检索工具:Influence Flower、CORE Recommender(可按作者、会议、机构、主题检索)

arXivLabs:与社区合作者的实验性项目

arXivLabs是一个框架,使合作者能够在arXiv网站上开发并分享新功能。个人和组织均认可arXiv的开放、社区、卓越以及用户数据隐私的价值观。arXiv致力于这些价值观,并仅与遵守这些原则的伙伴合作。

对为arXiv社区增值有想法?了解更多。

查看哪些作者是该论文的背书人 | 禁用MathJax