deepresearch-arms-lab

更好的 Deep Research:方法、实验与阶段结论

日期:2026-07-07 约束:无模型训练资源(不做 RL/SFT),全部方法为推理时(prompt / 架构 / 编排) 产物:代码与评测框架 ~/deepresearch-lab/(git);文献综述 ~/deepresearch-report.md;实验明细 ~/deepresearch-lab/EXPERIMENTS.md


1. 问题与方法

目标:在长报告生成场景(对齐 OpenAI/Gemini Deep Research 产品形态)下,找到无训练条件下质量最好、成本可控的系统架构。

方法分两步

  1. 文献先行:精读 2026 年 10 篇代表论文,把 training-free 方法归纳为四类路线(并行验证 / 显式状态管理 / 委派隔离 / prompt 自动优化),初始选型为”自建显式状态管理编排”(ScaffoldAgent 骨架 + EDR 终止判据 + VeriTrace 证据库)。
  2. 实证迭代:自建评测框架,把三类候选架构做成可对照的系统,用”失分归因 → 单变量修改 → 冻结旧版 → 同预算重跑”的纪律持续迭代。实证结果修正了文献选型(见 §4)。

三类候选架构:

体系 思路 实现
Pipeline 固定流水线(大纲→检索→写作),无循环无判据 自研,workflow 下界
Workflow-v1…v4 显式编排:大纲+节级完成判据、独立搜索工人、机械证据库、缺口驱动循环;v2-v4 为三轮单变量迭代 自研,机制来自论文选型
Agent-* 通用 agentic harness 无头模式,模型自主决定检索与写作节奏 Claude Code / opencode / codex
Hybrid-v1…v4 agent 基座 + workflow 机制外挂:研究协议 prompt + 输出端验证器 + 修订回路;v3 加引用核验/风险门控/原子论断,v4 加内省验证/统一 rubric 自研外挂 + Claude Code 基座

2. 实验设计

3. 目前结果

3.1 终表(典型 3 题 × MiMo-2.5-pro,统一盲评,2026-07-07)

方案 overall 深度 指令遵循 均耗时
Hybrid-v4(内省验证+统一 rubric) 8.96 8.5 9.5 ~700s
Agent-ClaudeCode(裸) 8.88 8.33 9.33 284s
Agent-ClaudeCode+委派 8.88 8.33 9.33 ~640s
Hybrid-v2 / v3 / v1 8.84 / 8.83 / 8.83     ~630-1170s
Workflow-v4 8.46 8.17 8.83 ~2160s
Agent-OpenCode(裸) 8.13 7.67 8.17 299s
Workflow-v3 / v2 7.83 / 7.5     ~1900s
Pipeline 6.86 6.33 6.67 326s

全量 10 题终局:Hybrid-v6 8.85 > 裸 agent 8.76(胜6平3负1;均差 +0.09 的 bootstrap 95% CI 跨 0,未达显著)。外挂价值 在托底:F6 集中于 8.8±0.15,裸 agent 三题掉 8.5-8.6——可预测性是结构性优势。

3.2 五个核心发现

  1. Agent 范式一致胜出,且跨模型/跨 harness 成立。两个模型上 agent 系均压过自建编排初版;opencode 与 Claude Code 表现接近,说明是范式优势而非产品优势。机制解释:换弱模型的跌幅梯度 Pipeline(−2.7) ≫ Workflow(−1.2) > Agent(−0.9)——编排越死板对模型能力越敏感,agent loop 每步看真实产出可自我纠偏。
  2. Workflow 的差距大部分可修,且增益可分解。三轮单变量迭代:v2→v3 判据硬核对(点名实体子串匹配、数量要求”LLM 抽取+代码数数”)+0.33;v3→v4 写作强制”深度四要素” +0.63。最终 Workflow-v4 距裸 agent 仅 0.42,在最难的评估型题 q09 上(8.62)反超 opencode。
  3. 两条高回报设计原则(可复用到任何同类系统):“LLM 做抽取、代码做判断”——判据/验证类决策交给机械核对,消除 LLM 自评乐观;“深度要素显式化”——数据点/多方对比/机制解释/批判性评估四要素写进写作指令,depth 单项 +1.0。
  4. Hybrid(agent 基座 + 机制外挂)是当前最优架构。v1-v3 与裸 agent 打平,v4(内省验证:验证器作为工具交 agent 自检 + 统一 rubric:研究目标与验收标准同源)首次超越裸 agent(8.96 > 8.88,指令遵循 9.5);耗时为 Workflow 系 1/3 且随质量自适应(自检通过则零修订直接交卷)。附带负结果:放开子 agent 委派与裸 agent 完全同分——长报告瓶颈在综合与验收,不在检索吞吐(单题搜索×5 分数不动)。
  5. fail-silent 风险与裁判盲区(来自一次搜索配额耗尽的意外压力测试):检索断供时,证据门控的 Workflow 系诚实报告”证据不足”,agent 系静默切换到参数化知识编造报告,且 LLM 裁判识不破。工程对策已实装(搜索降级链 + fail-loud 保险丝 + 工具级反编造提示 + 输出端验证器);方法论对策:评测必须依赖同批次盲评 + 过程 trace + 引用抽查,绝对分数不可跨批次比较(裁判提示微调即引起 ±0.3-0.6 漂移)。

3.3 对文献选型的修正

实证推翻了”从自建编排起步”的原始选型:通用 agentic harness 是被文献系统性低估的强基线,应作为默认基座;文献中的 training-free 机制(终止判据、证据核对、验证选择)价值成立,但正确宿主是”基座上的外挂”而非独立编排系统。

4. 未来方向

近期(低成本、高确定性)

  1. 全量 10 题固化结论——当前终表基于典型 3 题,Hybrid vs 裸 agent 的差距(0.04)在裁判噪声内,需 10 题 + 双裁判(加 gemini 系交叉)确认;
  2. 引用抽查内化验证器预评分——已在 Hybrid-v3/v4 完成(引用支撑抽查、风险门控、内省自检);
  3. 过程指标常态化——ev_used_ratio(引用∩真实检索)审计已上线,纳入正式评分协议。

中期(研究性)

  1. 深度天花板——depth 是所有系统的共同短板(最高 8.5)。候选:SciConBench 式”原子论断分解”写作、DualGraph 式知识图缺口检测(把”缺什么”从大纲级降到实体关系级);
  2. 评测可信度——用 TELBench 的 span 级错误定位方法系统化我们的 trace 归因;建设”过程指标”评分(真实检索行为、证据利用率),对冲 LLM 裁判盲区;
  3. 弱模型适配——Workflow 的模型敏感性问题反过来是机会:给弱/小模型配硬核对外挂,可能以低成本逼近强模型裸 agent 的质量(本实验中 MiMo + Workflow-v4 已接近 sonnet-5 裸 agent 区间)。

长期(方向性)

  1. 自动化迭代闭环——本项目”失分归因→单变量修改→重跑”的循环目前由人执行,原则上可由 agent 驱动(AgentDisCo 的外层优化器思路),把机制迭代本身自动化。

附:迭代轨迹一览

Workflow-v1  7.89 (R1) → 失分归因:预算垄断/截断/重复/结论饿死
Workflow-v2  7.5        → 五项修复;负结果:硬上限误伤证据量(教训:预算≠调度器)
Workflow-v3  7.83       → 判据硬核对("LLM抽取+代码判断") +0.33
Workflow-v4  8.46       → 深度四要素写作 +0.63,q09 超 opencode
Hybrid-v1    8.83       → 同批机制换宿主:agent基座+外挂,深度全场最高
Hybrid-v2    8.84       → 信源多样性/修订分诊/会话续跑,指令遵循顶格
Hybrid-v3    8.83       → 引用核验内化+风险门控+原子论断(q01/q05 双 9.0)
Hybrid-v4    8.96       → 内省验证+统一rubric,首次超裸agent(指令遵循 9.5)
(委派对照   8.88       → B+Task 与裸 B 完全同分:委派在长报告场景零增量)
Hybrid-v6    8.85@10题  → 3正确性修复(actions验收/自检同源/引用真实性门控);终局版
Hybrid-v7    ≈v6        → 任务类型条件化:质量获裁判认可(q09 depth 9.0),分数平台期

每步单变量、旧版冻结、同预算,全部产物(报告/trace/评分)可溯。