deepresearch-arms-lab

Deep Research Agent 文献精读笔记(Training-Free 视角)

调研日期:2026-07-02。共精读 10 篇 2026 年论文,全部拉取 arXiv 全文。 团队约束:无训练资源,方向锁定推理时架构(test-time / harness 层)+ 严谨评测。

总览表

# 论文 机构 方向 是否 training-free 每题成本 核心增益
1 FineVerify (2606.00660) NUS 推理时验证/选择 ✅ 完全免训练,代码开源 <$0.8 4样本 +8.2 分;12样本让 GPT-5-mini 超 GPT-5
2 Argus (2605.16217) MiroMind 并行证据组装 ❌ Navigator 需 SFT+GRPO(64×H200) 极高(K=64 时 25.6M token) K=64 时 BrowseComp 55→86.2;架构思想可 prompt 复现
3 ScaffoldAgent (2606.20122) 北大 动态大纲优化 ✅ 完全免训练 26.3k token / 117s RACE +2.24,比 WebWeaver 省 29% token
4 VeriTrace (2605.26081) Cambridge 认知图/心智模型 ✅ 完全免训练 $0.6–2,40–65 min 同基座 +1.49~+4.22 pp,DeepConsult 胜率 81.1%
5 AgentDisCo (2605.11732) 小红书 探索/利用解耦 ✅ 完全免训练 未报告 RACE 51.44 超 Gemini-DR;引用准确率 +10.7
6 Don’t Stop Early / EDR (2604.24978) Salesforce 信息流控制+终止判据 ✅ 完全免训练 未报token,DAG 使耗时 222→47 min 终止判据单项 +8.4 HAA
7 Self-Optimizing MAS (2604.02988) Zeta Alpha prompt 自动优化 ✅ 免梯度(GEPA 优化 prompt) 每轮优化 ~$50 极简 prompt 0.513→0.705,超专家 prompt 0.667
8 SearchSwarm (2606.09730) 清华/北大/蚂蚁 委派智能 ⚠️ 最终模型需 SFT;harness 部分免训练 +10 分 高(未报) 30B 模型 BrowseComp 68.1(追平 671B DeepSeek)
9 Search-Time Contamination (2606.05241) NTU/阿里 评测污染 ✅(检测流水线免训练) judge ~$221/6800题 EAL 污染使准确率 7.7%→89.7%;Gemini-DR 泄漏率 60%
10 LiveBrowseComp (2605.28721) 哈工大/小红书 评测方法论 ✅(诊断实验纯 API) 证据屏蔽后全员 26.1→6.2;静态榜闭卷能拿近半分

方向一:推理时扩展与验证

arXiv 2606.00660,NUS。代码:github.com/XuZhao0/fineverify

2. Argus: Evidence Assembly for Scalable Deep Research Agents

arXiv 2605.16217,MiroMind AI。注意:需要训练(Searcher SFT ~1万条轨迹;Navigator SFT 热身 + GRPO,64×H200 跑 1.5 天)。


方向二:中间表示 / 大纲的显式管理

3. ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research

arXiv 2606.20122,北大。✅ training-free。三个系统里最便宜(26k token/题)

4. VeriTrace: Evolving Mental Models for Deep Research Agents

arXiv 2605.26081,Cambridge。✅ training-free($0.6–2/题,200+ LLM 调用,40–65 min)。

5. AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents

arXiv 2605.11732,小红书。✅ training-free。


方向三:信息流控制与多 agent 编排

6. Don’t Stop Early: Scalable Enterprise Deep Research (EDR)

arXiv 2604.24978,Salesforce。✅ training-free(LangGraph 实现)。消融证据全 10 篇中最扎实。

7. Self-Optimizing Multi-Agent Systems for Deep Research

arXiv 2604.02988,Zeta Alpha。✅ 免梯度(prompt 层优化)。

8. SearchSwarm: Towards Delegation Intelligence in Agentic LLMs

arXiv 2606.09730,清华/北大/蚂蚁/人大。⚠️ 最终模型需 SFT,但 harness 部分 training-free 且贡献 +10 分


方向四:评测与可信性

9. Search-Time Contamination in Deep Research Agents (STC)

arXiv 2606.05241,NTU + 阿里通义。检测流水线免训练可直接抄(附录含完整 prompt 和 URL 匹配表)。

10. LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

arXiv 2605.28721,哈工大 + 小红书。诊断实验纯 API 可复现。


综合分析

领域收敛出的共识设计(多篇独立收敛)

  1. 显式中间表示 + 显式完成判据:AgentDisCo 的 blueprint ≈ EDR 的大纲子问题+终止判据 ≈ ScaffoldAgent 的大纲树 ≈ VeriTrace 的认知图——都在把”研究状态”从 LLM 隐式上下文中拿出来结构化管理。
  2. 验证比生成容易:FineVerify(事后选择器)与 Argus(在环调度器)都押注此点;FineVerify 实证”生成弱 ≠ 验证弱”。
  3. 委派 + 上下文隔离:SearchSwarm 的 call_sub_agent 与 EDR 的 DAG 依赖门控都是”每个工作单元只见必要信息”。
  4. prompt 层自动优化替代人工调参:Self-Optimizing MAS 的 GEPA 与 AgentDisCo 的 Claude-Code harness 殊途同归。

Training-free 的可行性证据链(报告核心论点素材)

推荐组合路线(按预算从低到高)

  1. 起步:ScaffoldAgent 的 utility-UCB 骨架(26k token/题)+ EDR 的预声明终止判据 + 先大纲后检索
  2. 验证层:FineVerify 的分解-三值核查-规则聚合;改进方向是把 not_found/contradicted 缺口反馈给下一轮搜索(借 Argus 缺口派发思想,prompt 复现)
  3. 委派层:SearchSwarm 开源 harness prompt(详尽 brief + 引用锚定 + 主 agent 保留判断)
  4. 自动调优:GEPA 优化整套 harness 的主/子 prompt(几十条 rubric query + $50/轮)
  5. 增强插件:VeriTrace 偏差路由(VERIFY/PIVOT 策略选择)+ 机械证据溯源;AgentDisCo document bank

评测协议(三道防线)

  1. 防外部泄漏:STC 三级检测(BML 正则 → QCL 归一化 LCS → EAL LLM-judge),BML 正则同时当运行时 URL 过滤器
  2. 防内部泄漏:闭卷基线 + 证据屏蔽消融 + query 溯源统计(LiveBrowseComp 三诊断)
  3. 过程指标:证据使用率、model-originated query 率、工具调用次数(早停行为证据)、Search Coverage 类中间指标
    • benchmark 选择:DeepResearch Bench(RACE+FACT,报告类)+ BrowseComp-Plus(受控索引,可做证据屏蔽)+ 可选自建 50 题 live 集

公开的可复用资产


增补(2026-07-07 扫描):agent 式 DR 的方向图谱与 6 月新论文

背景:实证阶段确认 agentic loop 为默认基座后,回扫 arXiv 6 月新工作 (API 限流,改抓 arxiv.org/search 页面),归入六个方向。

方向图谱(含对我们工作的映射)

  1. 上下文工程:委派隔离(SearchSwarm)、外置记忆(Argus 证据图、DualGraph 知识图/大纲图分离)、压缩策略(工程实践领先论文)。→ Hybrid 的下一层空间, “上下文策略 × 报告质量”对照实验是文献空白,我们有三 harness 真实 trace。
  2. 编排拓扑:并行+验证聚合(Argus)、角色分工(AgentDisCo/VeriTrace)、 动态拓扑。→ 我们证明裸单 agent 已很强,多 agent 增量需严格对照。
  3. test-time scaling:验证选择(FineVerify N选1)、终止判据=何时停止 scaling (EDR)。→ 我们的风险门控是成本侧贡献(自适应决定花多少)。
  4. 训练 agent 模型(排除但追踪):MetaResearcher(对抗环境 RL)、QUEST(合成 任务)、S1-DeepResearch(长程真实任务)、DEEPRUBRIC(证据树 rubric 监督—— 监督信号结构可 training-free 借用作验证器评分结构)、SlimSearcher(效率 reward)。
  5. 评测与可信性(持续加厚):Time to REFLECT(先评裁判)、TELBench(span 级 轨迹错误定位)、”Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?”(2026-06-29,直接支撑我们的裁判噪声发现)、Multi-Turn process-level 评测、跨语言 BrowseComp-Plus、SciConBench(原子事实分解)。
  6. 垂直域爆发(6 月最密集信号):DEEPMED Search(医疗,introspective verification 内化验证,与我们 Hybrid 验证器同构,值得精读)、Physical Sciences DR、ICBCBench(金融)、MASS(社科)、VideoSearcher(视频多模态)。 通用架构收敛后竞争转向垂直适配+域评测;可信性要求抬高验证器地位。

另:harness 工程本身开始成为研究对象——SkillHone(持久决策历史上的技能进化)、 CLI-Universe(终端 agent 任务合成)、SwarmX(agentic 调度)。我们的 F 系外挂 实验有同行了。

对我们的三个直接行动项

增补(2026-07-21 循环扫描):核验器 FPR 论点

增补(2026-07-27):Grok Build /deep-research(07-26 发布)

一手来源:cryptobriefing 发布报道 + docs.x.ai(grok-4.20-multi-agent 模型页、 Citations API 文档)。架构四件套:

  1. 多 agent 并行+独立核验:专用模型 grok-4.20-multi-agent(1M 上下文, $1.25/M 输入),多 agent 并行拆解问题,”aggregate verified claims, cross-reference evidence, independently validate”——聚合的是已核验论断;
  2. 缺口披露为产品特性:报告自带”a list of what it couldn’t find”;
  3. 检索用 Exa(与本 lab deep-research skill 同源);
  4. 平台层引用绑定(API 层非模型自觉):All Citations(检索接触的全部 URL 无条件返回,含未引用的——完整 provenance)+ Inline Citations([N] +结构化位置元数据 annotations)。

与本 lab F115 的四点独立收敛:核验聚合↔后置核修;缺口清单↔”未获来源 子话题”披露;All Citations↔search_calls.jsonl;平台引用↔[Sn] 机械渲染 (路径 C 的 training-free 近似)。唯一分野=多 agent 并行(强基座可负担 orchestrator-worker;弱基座不自发委派,故我们走串行三阶段)。 关键旁证:xAI 文档明言 inline citations “model decides when and where” 不保证每句引——最强基座上生成时引用仍靠模型自觉,G-Cite 不可靠结论的 行业级印证。可操作:Grok API OpenAI 兼容,可接入评测框架作强基座对照臂。