计算机科学 > 人工智能
提交日期:2026年9月17日
标题:编程智能体Harness设计的实证研究(An Empirical Study of Harness Design for Coding Agents)
作者:Run-Ze Fan、Zihao Zhang、Simin Ma、Yebowen Hu、Shouju Wang、Kaiqiang Song、Fei Liu、Hamed Zamani、Xiaoyang Wang
查看该论文PDF:An Empirical Study of Harness Design for Coding Agents,作者为 Run-Ze Fan 及其他8位作者
查看PDF | HTML(实验性版本)
摘要:编程harness(coding harness)决定了自主编程智能体如何将模型能力转化为长程软件工程性能,然而现有工作通常将harness作为整体系统进行评估,导致各组件的有效性尚不明确。为实现组件级比较,我们通过一个轻量级编程harness来研究这一问题:其执行循环保持固定,同时变化三个组件——规划、动作空间和上下文管理。我们在SWE-Bench Verified和Terminal-Bench 2.1上评估了4个模型,共涵盖176个匹配设置,包括5种上下文管理策略、4种上下文窗口预算,以及针对规划和动作空间的定向消融实验。我们发现:(1) 随着上下文窗口预算收紧,上下文管理的价值不断提升,其收益主要来自防止上下文溢出导致的失败。(2) 在基于LLM的摘要之前先执行基于规则的删减(elision),在所有上下文管理策略中提供了最佳的整体效率;而让被删减内容可恢复所增加的机制,模型很少使用,且未带来准确率提升。(3) 规划的角色从弱模型的准确率脚手架转变为强模型的成本节约手段,准确率变化很小。(4) 预定义工具能提升bash能力较弱模型的性能,而具备bash能力的模型仅凭bash接口也能高效运作,并实现显著更低的成本,尤其是在以命令行为中心的任务上。轨迹层面的分析解释了这些效应:上下文管理在不显著改变智能体行为的情况下延长了执行轨迹,规划改变了轨迹停止的位置,而动作空间改变了代码编写的粒度。这些发现为面向模型和预算感知的harness设计提供了参考,并为评估未来harness组件提供了模块化框架。
评论:(无)
学科分类:人工智能(cs.AI);计算与语言(cs.CL);机器学习(cs.LG);软件工程(cs.SE)
引用方式:arXiv:2609.20804 [cs.AI]
(或使用本版本的 arXiv:2609.20804v1)
https://doi.org/10.48550/arXiv.2609.20804
arXiv通过DataCite签发的DOI(待注册)
提交历史
来自:Run-Ze Fan(查看邮箱) [v1] 2026年9月17日 星期四 17:58:07 UTC(6,713 KB)
全文链接:
访问论文:
- 查看PDF
- HTML(实验性版本)
- TeX源码
查看许可证
当前浏览上下文:
cs.AI
[新论文] | [近期论文] | [2026年9月]
可通过 cs.CL、cs.LG、cs.SE 切换浏览学科。
参考文献与引用
- NASA ADS
- Google Scholar
- Semantic Scholar
BibTeX格式引用
数据提供方:
文献与引用工具
Bibliographic Explorer(文献浏览器)、Connected Papers、Litmaps、scite.ai
与本文相关的代码、数据与媒体
alphaXiv、CatalyzeX Code Finder for Papers、DagsHub、GotitPub、Hugging Face、ScienceCast
演示
Replicate、Hugging Face Spaces、TXYZ.AI
相关论文
推荐与检索工具:Influence Flower、CORE Recommender(可按作者、会议、机构、主题检索)
arXivLabs:与社区合作者的实验性项目
arXivLabs是一个框架,使合作者能够在arXiv网站上开发并分享新功能。个人和组织均认可arXiv的开放、社区、卓越以及用户数据隐私的价值观。arXiv致力于这些价值观,并仅与遵守这些原则的伙伴合作。
对为arXiv社区增值有想法?了解更多。
查看哪些作者是该论文的背书人 | 禁用MathJax