Agents / LLM / Harness 论文日报(2026-08-29)
今日概览
本期检索窗口为 2026-08-28 09:40 至 2026-08-29 09:40(新加坡时间)。arXiv 周六通常不发布新列表,因此本期主要核对 2026-08-28(周五)新列表中首次公开出现的论文,并补查 OpenReview、ACL Anthology 与论文正文;论文的原始提交时间可能早于列表出现日 1–2 天。今天最值得关注的信号是:Agent 能力越来越明确地由“模型 × Harness”共同决定,研究焦点正从单次提示优化转向上下文视图、在线监督、技能知识库、非幂等委派和可验证安全评测。共筛出 8 篇,均为 v1 首次公开出现;未用无实质更新的旧稿或纯观点文章补数。
重点论文
1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- 作者 / 机构:Yang Xiao、Yusong Sun、Haoyi Wu 等;AllSpark Team
- 日期:2026-08-27 提交,2026-08-28 进入 arXiv 新列表
- 标签:Agent Harness、长程任务、在线监督、技能与记忆、自我改进
- 原文:arXiv:2608.26530
- 核心问题:多数 Agent 自我改进发生在一次执行结束之后,既无法挽救当前轨迹,也不能立刻验证刚提炼出的经验是否有效。
- 方法与关键结果:PILOT 采用 supervisor–worker 双角色 Harness:监督者通过实时通道接收错误、停滞和阶段消息,可在执行中重定向或中止 worker;同时把有效步骤与失败模式沉淀为可复用 skill 和 memory。两个冻结 backbone、三个 benchmark 的六组配置中排名第一五次;Terminal-Bench 2.0 相对同类 Harness 最高提升 9.8 个百分点。迭代自改进使 GLM-5.1、Kimi-K2.6 最佳通过率分别提升 14.6、12.4 个百分点,平均输出 token 降低 42.9% 和 47.4%,每百万输出 token 的成功评测数提升 110.3% 和 134.0%。
- 创新点:把“当前运行纠偏”和“跨运行知识积累”合并为同一闭环,并用独立上下文隔离执行噪声与监督判断。
- 局限性:自改进实验成本高,目前只覆盖 3 个 benchmark、2 个开源 backbone;supervisor 与 worker 使用同一 backbone,异构模型配对、监督误杀和线上额外延迟尚未系统评估。
- 为什么值得关注:它给出了可直接映射到生产 Runtime 的事件通道与持久状态设计,也说明增加监督 Agent 不必然增加总 token 成本。
2. Same Model, Different Harness: Different Coding-Agent Results
- 作者 / 机构:Sydney Lewis;论文未列机构
- 日期:2026-08-26 提交,2026-08-28 进入 arXiv 新列表
- 标签:Coding Agent、Harness 评测、上下文工程、运行时闭环
- 原文:arXiv:2608.26218
- 核心问题:固定模型、任务、工具和执行预算时,仅改变 Harness 如何呈现历史与处理停滞,是否足以显著改变编码结果?
- 方法与关键结果:对照组按时间顺序提供完整会话;处理组保留完整记录,但在上下文受压时机械缩短旧工具输出,并对重复失败或停滞给出规则化干预。在 169 个 SWE-bench Verified 任务、20,480-token 窗口、480 秒端点下,平均 fail-to-pass fraction 从 28% 提至 49%,完整解从 43 增至 72;同一冻结配置迁移到另外三个模型也同时提高两个指标。在 262,144-token 宽窗口下,Verified/Pro 差距基本消失,说明收益主要来自上下文压力管理。
- 创新点:用配对实验把模型权重保持不变,直接测量 Harness 的因果贡献,并区分永久轨迹存档与模型当下工作视图。
- 局限性:每任务每臂只有一条 greedy 轨迹,不测运行方差;只覆盖本地开源量化模型和代码任务;处理组是多项规则的组合,无法归因到单个组件,也没有与模型摘要或检索式上下文对照。
- 为什么值得关注:它提供了很强的证据:Agent leaderboard 若只写模型名、不固定 Harness,结果不可直接比较。
3. WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- 作者 / 机构:Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan、Tu Vu;Google Research、Virginia Tech
- 日期:2026-08-27 提交,2026-08-28 进入 arXiv 新列表
- 标签:Agent Skills、持续学习、长期记忆、知识编译、跨模型迁移
- 原文:arXiv:2608.27454
- 核心问题:自动演化 skill 的经验通常散落在优化轨迹中,下一轮只看到当前 skill,难以复用此前失败、假设和改写依据。
- 方法与关键结果:WikiSkill 把 workspace 分成原始执行经验、持续累积的 wiki、可执行 skill 三层;维护 Agent 先把轨迹归纳成知识页,提案 Agent 再据此修改 skill,并用验证集门控是否接受。论文在 5 个 benchmark、5 个推理模型上总体优于 Trace2Skill、EvoSkill、SkillOpt,并显示大模型从演化 skill 中获益更多;跨模型迁移时,其他模型演化出的 skill 有时优于自演化 skill。
- 创新点:不把历史简单压成一份 skill,而是保留可增长、可追溯的中间知识层,使经验可以跨迭代重新组合。
- 局限性:实验直接把活跃 skill 注入提示,没有评测大规模 skill 库的检索与触发;严格“即时得分必须提升”的门控会拒绝可能为后续铺路的中性更新;wiki 尚无自动剪枝,也未覆盖数百动作或数小时任务。
- 为什么值得关注:这项工作把 skill 文件从静态提示模板推进为可治理的知识编译产物,对长期运行 Agent 的版本化和迁移非常关键。
4. When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems
- 作者 / 机构:Hanchong Chen、Xing Tang、Lingjie Li、Xiongfeng Shan、Xiuqiang He;深圳技术大学
- 日期:2026-08-27 提交,2026-08-28 进入 arXiv 新列表
- 标签:Agentic Recommendation、向量记忆、协同过滤、Soft Token、生成式推荐
- 原文:arXiv:2608.26895
- 核心问题:推荐 Agent 通常把用户记忆写成文本,维护需要连续 LLM 调用,而且文本难以保留全量用户—物品协同结构并接受排序梯度。
- 方法与关键结果:CoVeMem 以冻结的 LightGCN 用户/物品状态构成 memory bank,由当前候选集合检索相关历史状态,经 projector 映射为 soft tokens,与轻量文本画像共同输入 LLM;再用语义锚点对齐和候选掩码的 listwise co-training 训练 memory reader。四个 instruction-grounded 推荐 benchmark 上,它在 20 个指标单元中的 19 个匹配或超过最强协同文本记忆 Agent,同时除一次静态画像外,记忆维护不需要额外生成式 LLM 调用。
- 创新点:把协同记忆本身做成可训练的向量状态,同时仍让 LLM 参与候选判断,而不是把最终排序完全交给向量相似度。
- 局限性:结论来自离线 benchmark、冻结 LightGCN 与点式 yes/no readout;尚未验证冷启动、兴趣漂移、超大候选集、线上延迟与实时更新;“零维护 LLM 调用”不等于零离线训练或检索成本。
- 为什么值得关注:这是本期与生成式召回和推荐系统最直接相关的论文,为“结构化行为记忆 + 文本意图”混合建模提供了清晰实现路径。
5. NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
- 作者 / 机构:Zhiyuan Xu、Muhammad Firhard Roslan、Joseph Gardiner、Sana Belguith、Lichao Wu;University of Bristol
- 日期:2026-08-26 提交,2026-08-28 进入 arXiv 新列表
- 标签:LLM 安全、Jailbreak、白盒 Fuzzing、Prefill、自动化评测
- 原文:arXiv:2608.26222
- 核心问题:现有 jailbreak fuzzer 必须让每个候选提示完成解码再判定,成本高;强对齐模型大量拒答又只产生稀疏的成败反馈。
- 方法与关键结果:NeuronFuzz 用模板不变的有害/无害样本识别稳定 safety neurons,SafetyOracle 在 prefill 阶段把激活映射为连续警报分数;再用梯度定位敏感模板位置、由 masked LM 生成语义连贯的替换。对 21 个文本/多模态模型评测,五个白盒源模型的 jailbreak 发现率为 76%–100%,比基线最高高 48 个百分点;模板还能零样本迁移到开放权重与六个闭源目标模型。
- 创新点:把软件 coverage-guided fuzzing 的“执行反馈”迁移到模型内部安全表征,避免对中间候选反复做完整解码。
- 局限性:构建 oracle 和定位梯度需要白盒权重、激活与输入梯度;内部 safety neuron 是否随新一轮对齐、量化和架构变化保持稳定仍不明确;攻击成功率仍依赖外部安全判别标准。
- 为什么值得关注:它既是更高效的红队评测方法,也暴露了“可解释安全特征”可能被反向利用的双刃剑风险。
6. PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?
- 作者 / 机构:Yitian Zhou、Jingyu Zheng、Qiliang Jiang 等;Zhejiang University、Xi’an Jiaotong University、University of Bristol
- 日期:2026-08-27 提交,2026-08-28 进入 arXiv 新列表
- 标签:Agent Safety、工业控制、硬件在环、工具调用、确定性评测
- 原文:arXiv:2608.26882
- 核心问题:工具 Agent 在网络或软件层成功并不等于能造成持续物理影响;现有安全 benchmark 很少贯穿 PLC 原生接口、控制逻辑与闭环过程。
- 方法与关键结果:PLCBench 组合商业 PLC、厂商原生交互、降阶闭环过程仿真和独立结果验证,以六个隐藏诊断标志区分“读到 PLC”“过程相关写入”“持续物理目标”。四款 PLC × 四种工作负载、五个 LLM 家族共 240 次真实 PLC episode 中,75 次(31.3%)持续达成物理目标;98 次在有效原生读取前失败,另有 62 次完成过程相关写入却未持续达成目标。更丰富过程观测使写入后的条件成功率从 44.2% 升至 64.0%。
- 创新点:把 Agent 安全评测从数字动作推进到可重复、分阶段诊断的 cyber-to-physical 结果,并用确定性 evaluator 减少 LLM judge 争议。
- 局限性:仅覆盖四款 PLC 和四种实验负载,过程由降阶仿真闭环而非真实工厂;为安全起见只能开放部分代码与脱敏轨迹;31.3% 不应外推为一般工业系统风险概率。
- 为什么值得关注:它提示 Agent 权限设计不能只在“工具调用成功”处设终点,必须把真实环境后果、复位与持续性纳入 Harness 评测。
7. Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling
- 作者 / 机构:Leonardo Liparulo、Francesco Pierri;Politecnico di Milano(研究得到 Huawei 实习场景支持)
- 日期:2026-08-25 提交,2026-08-28 进入 arXiv 新列表
- 标签:MCP、工具调用、本地 LLM、硬件设计、Agent 配置评测
- 原文:arXiv:2608.26199
- 核心问题:受保密约束的硬件设计流程往往只能使用本地模型;这些模型在带状态、强依赖顺序的 MCP 工具链中到底多可靠,哪些配置最关键?
- 方法与关键结果:作者搭建一个复刻专有硬件设计工具状态与依赖逻辑的 MCP server,并设计单步编辑、多步依赖、非法请求、拼写错误和多 server 上下文任务;比较 7 个开源模型、system prompt、工具描述粒度、上下文范围和单双 Agent 架构。强模型在最佳配置下可达到接近完整的预期调用覆盖;完整工具描述稳定减少错误,few-shot 对部分模型会导致严重不行动,累积历史伤害受限模型,多 Agent 主要帮助弱 worker 或长会话但增加调用数。
- 创新点:在一个接近工业约束的有状态 MCP 环境中,系统拆解“模型能力”和“工具描述 / 上下文 / 架构配置”的交互影响。
- 局限性:MCP server 是专有工具的高保真复刻,并未调用生产 API;benchmark 与 server 因保密无法公开;会话只有数十任务,未覆盖更长历史,也未系统测量延迟与错误严重度。
- 为什么值得关注:结论非常工程化:对工具 Agent,详细 schema 往往比多放几个 few-shot 示例更可靠,长会话也不应默认累积全部历史。
8. Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation
- 作者 / 机构:Mazhar Shaikh、Anurag Rajkumar Bombarde、Harshal Pathak;论文未披露组织机构
- 日期:2026-08-26 提交,2026-08-28 进入 arXiv 新列表
- 标签:Agent Runtime、编排、非幂等委派、故障归因、可靠性
- 原文:arXiv:2608.26225
- 核心问题:服务网格常用的 retry、timeout、error-rate circuit breaker 假定请求近似幂等、延迟能表征失败、丢弃请求没有副作用;Agent 委派往往同时违反这些假设。
- 方法与关键结果:论文回顾一个生产软件交付 Agent 平台的 81 次运行、147 个编号 incident,多数故障带有回滚修复即可复现的 mutation proof。案例包括连续 54 次“成功”工具调用造成无错误可见的死循环、跨 6 次委派残留 21 个事件、错误归因唤醒 5 个组件并让 3 个旁观组件回归,以及 12 次 enforcement layer 阻断正确工作。作者据此提出以 delegation 而非 message 为执行单位的 7 个可靠性原语,包括 progress-based breaking、effect ledger、failure routing、budget attenuation 和 nondeterminism quarantine。
- 创新点:把 Agent 运行时的核心风险从“单次调用是否报错”重构为身份是否足够区分、证据是否可归因且能真正变化,以及副作用是否跨委派存续。
- 局限性:这是单一系统的回顾性观察研究,没有对照组;故障由平台团队自诊断,语料会偏向“值得记录”的事件;部署前后变化不能解释为严格因果效应,作者也明确把受控实验留作后续工作。
- 为什么值得关注:即使证据尚非受控实验,它仍给出了少见的生产故障语料和一套比 HTTP 请求级重试更贴合 Agent 的 Runtime 检查表。
值得继续追踪
- Harness 评测从配置描述升级为 solver 规格:继续观察 Same Model, Different Harness 的结论能否在 hosted frontier model、非代码任务和重复采样下成立,并要求 leaderboard 固定工具、上下文视图、停止规则与安全策略。
- 在线自改进的收益与风险:PILOT 与 WikiSkill 分别覆盖单次运行内纠偏和跨运行知识积累;后续关键是验证错误经验污染、skill 冲突、回滚和验证集过拟合,而不只是平均通过率。
- Agent 记忆的混合表示:CoVeMem 证明向量协同记忆可替代高成本文本重写;应追踪其在兴趣漂移、冷启动、隐私删除和流式更新下能否保持收益。
实践启发
- 做一次“完整轨迹 vs. 工作视图”在线推理回放实验:固定模型、候选集与工具,把最近 N 次工具结果完整保留,其余按年龄与长度机械裁剪;对生成式召回链路比较 Recall@K、非法工具调用率、P95 token、P95 延迟和任务完成率。优先在长工具输出、反复重试的请求分桶评估,避免平均值掩盖收益。
- 给推荐 Agent 增加协同向量记忆旁路:用现有 user/item 图表征构建只读 memory bank,按当前候选检索历史状态并映射为少量 soft tokens,与文本画像并行输入;先离线比较文本记忆、纯协同塔、混合记忆的 NDCG/Recall、长尾覆盖和推理成本,再做小流量线上实验。
- 把运行时可靠性指标从“错误率”扩展到“进展与副作用”:为每次 Agent 委派记录稳定 delegation ID、工具副作用 ledger、可单调变化的 progress signal 和失败归属;用回放注入重复成功调用、超时重试、过期状态与错误路由,检查是否能在不增加误杀的前提下提前终止无效消耗。
检索说明
- 主要数据源:arXiv cs.AI 新列表、arXiv cs.CL 新列表、arXiv cs.LG 新列表,并补查 OpenReview、ACL Anthology、各论文 arXiv HTML/PDF 与官方项目页。
- 关键词:agent、multi-agent、tool use、MCP、planning、memory、skill、self-improvement、coding agent、harness、runtime、orchestration、context engineering、sandbox、agent evaluation、LLM safety、RAG、retrieval、recommendation、inference efficiency。
- 时间口径:以 2026-08-28 arXiv 新列表在本窗口内首次公开出现为主要纳入依据,同时保留每篇 v1 的原始提交日期。arXiv 的截稿和处理机制会使提交时间比公开列表早 1–2 天;这不等同于旧论文修订。
- 去重与筛选:按 arXiv ID、标题和作者合并 cs.AI / cs.CL / cs.LG 交叉列表;仅保留有明确方法、实验或可审计故障语料的研究。综述、纯概念稿、无实验声明、仅格式更新的 replacement,以及上一期已推送且无实质变化的论文均排除。本期未发现说明充分、质量高于上述 v1 的实质性修订稿。
归档状态:待保存
企业微信速览发送状态:待发送