Agents / LLM / Harness 论文日报(2026-08-30)
今日概览
本期检索窗口为 2026-08-29 09:10 至 2026-08-30 09:10(新加坡时间)。经核对 arXiv、OpenReview、ACL Anthology 及相关官方页面,今日无值得推荐的新论文:arXiv 的 cs.AI、cs.CL、cs.LG、cs.SE、cs.IR 最新列表仍停留在 2026-08-28(周五),没有进入本窗口的新 submission 或 replacement。OpenReview 虽出现旧投稿页面的修改时间变化,ACL Anthology 也在 8 月 29 日重新构建站点,但未找到足以证明论文方法、实验或结论发生实质更新的一手变更说明,因此不重复推送旧内容。
重点论文
今日无值得推荐的新论文。
本期没有收录以下两类“表面更新”:
- OpenReview 的旧论文 CollabSim 页面显示近期修改活动,但该工作原始版本可追溯至 2026 年 6 月,当前公开页面未明确披露新增方法、实验或结论,故不将页面元数据变化视作实质修订。原始论文:CollabSim(arXiv:2606.06399)。
- ACL Anthology 在 2026-08-29 有站点构建记录,但新构建不等于论文新发布或内容修订;检索到的相关 Agent 论文均为此前已经发表的会议论文,不纳入本期。
值得继续追踪
- 下一个 arXiv 工作日批次:重点检查周末积压稿件中是否出现 Harness 原生推理、在线自改进、Agent memory 或工具协议的新实验;周一批次可能集中释放。
- OpenReview 修订透明度:继续观察 ACL ARR 2026 August 投稿是否发布可核验的 revision note、补充实验或新版 PDF;只有内容变化得到明确说明时才按“实质修订”纳入。
- 前期 Harness 结论的独立复现:继续追踪上下文裁剪、在线 supervisor 和 skill 演化是否出现跨任务、跨模型的独立验证,而非重复收录原论文。
实践启发
本窗口没有产生足够新的研究证据,不额外提出基于旧论文包装的新实验建议。现有生成式召回、推荐系统和在线推理实验可继续执行上一期已列出的 Harness 上下文裁剪、协同向量记忆与委派副作用监控方案,待出现新的对照实验或复现结果后再调整优先级。
检索说明
- 主要数据源:arXiv cs.AI 新列表、arXiv cs.CL 新列表、arXiv cs.LG 新列表、arXiv cs.SE 新列表、arXiv cs.IR 新列表、OpenReview、ACL Anthology,以及论文和研究机构官方页面。
- 关键词:agent、multi-agent、tool use、planning、memory、reasoning、computer use、harness、runtime、orchestration、scaffolding、context engineering、MCP、sandbox、RAG、long context、post-training、inference、evaluation、safety、alignment。
- 去重口径:按 arXiv ID、标题、作者和版本号合并交叉列表;昨天已推送且版本未变化的论文全部排除。仅网站重新抓取、页面修改时间、会议元数据更新、标题措辞调整或无 revision note 的旧稿,不计为实质修订。
- 筛选结论:过去 24 小时内未发现同时满足“时间窗口、主题相关、具有明确技术贡献或实验、且不是重复内容”的高质量研究,因此本期按宁缺毋滥原则不列重点论文。