deepresearch-lab · 实验全景

目标:在弱基座(MiMo)上做出比裸 claude code agent 效果更好的 deep research · 中文题 ×24 · 2026-07-17 → 07-29

F115 · 报告质量(judge)
7.77
↓ −0.08 vs 裸 agent 7.85
n=24 · 加入"硬"题后差距与 n=19 基本持平(见下方个案)
F115 · 引用忠实度(子句级)
0.66
↑ +0.24 vs 裸 agent 0.42
n=4177 子句 · 4K 尺同口径
可信性极点 F11 · 忠实度
0.68
= 裸 agent 的 1.62×
judge 7.59(n=24)· ↓ −0.26 vs 裸 agent,无免费午餐
尝试总数(arm 变体)
14
其中 6 个负结果同样入档 · 已知"双优"不再是准确表述
评测配置 · 三个模型互相解耦,避免自评闭环
被测系统MiMo 2.5 Pro(xiaomi/mimo-v2.5-pro)· 全部 arm 统一执行器,消除模型差异干扰 · 执行器网关(Anthropic 协议桥接)
质量裁判Claude Opus 4.8(claude-opus-4-8)· 盲评 ×3 取中位 · 独立评测网关(与执行器解耦)
引用/事实核验Claude Sonnet 5(claude-sonnet-5)· fact-v2 子句级抓页核查 · 同经独立评测网关

质量–可信性版图

每个点是一个 arm(横轴 judge 报告质量,纵轴子句级引用忠实度)。右上 = 双优。空心小点为 n=3 小样本。

交付方案 基线 / 外部系统 探索尝试(含负结果)

各 arm 对比

同一评测体系(judge=opus-4-8 盲评 ×3;fact=子句级支持率,4K 尺全臂同口径)。

报告质量 judge(0–10)
引用忠实度 · 子句级支持率(0–1)

实验历程

十天时间线:每一步做了什么、判决是什么。负结果与正结果同权入档。

  • 07-17基线mimo_smoke 基线批:B/B3/F91 三臂 ×10 题;provenance 双黑洞修复(meta 落 model+gateway,网关活体探针确认真 MiMo) · F9.1 生成时台账协议证伪:弱基座守不住重协议(句级支撑 0.55)
  • 07-20调研主流方案调研(35 条证据,FACT 回查 23/24):行业无人走"模型写作时自觉遵守引用协议"路——训练派 reward 内化,编排派管线化 · P0 = 引用后置化 + 采集侧预引用
  • 07-20跷跷板F10 / F10.1(引用后置):精度赢但覆盖塌;补检索纪律后核对吞吐成为新瓶颈 · 教训:替换 B 的引用职责总在跷跷板上
  • 07-20阶段胜F10.2 = B + 后置核修:十题零故障;十对配对证明核修净代价 −0.15(噪声内),引用覆盖 +56%、矛盾减 2/3 · 同时发现 B 的 run 间 judge 方差 ~1.0 → 同 run 配对成为标准口径
  • 07-20完败arm G = GPT-Researcher + MiMo:judge 5.75 / 严格率 0——榜单强者迁移不过"中文+弱基座+自有检索源";唯一亮点 150s/题 · 接入踩了配额/timeout/英文 embedding 滤空中文三层洋葱
  • 07-21修尺子评测体系加固:FPR 审计(超写告警误报率 0.50,根因=抓页 4K 截断丢尾部证据)→ 24K 旁路重跑全量 → 臂间排序双尺一致,结论对尺子鲁棒 · fact-v2 另经 DEER-VERI(ICML26)独立校准
  • 07-21突破F11 采集侧预引用:read 页 harness 发 [Sn] 编号,写作只填标号——错位/矛盾被结构性消灭,协议遵守 100% · n=10 定版:忠实度 0.75(裸 agent 1.53×),judge 8.12
  • 07-21
    –23
    三连负F11.1 / F11.2 / F11.3(加广度 / 双通道解禁 / 原子句):三次写作侧扰动全部劣化忠实度 · 铁律:F11 的"没读过不得写"本身就是机制,单 pass 上加任何东西都打破弱基座的脆弱平衡
  • 07-24诊断partial 聚合诊断:配对级严格率被 worst-of 聚合系统性低估(一句打包 5.1 子句、错 1 个全句判负)→ 评测主口径切子句级 · 曝光/核对行为两个 verify 侧杠杆同期证伪
  • 07-24双优出现F11.4-split 研究/写作分离:广度纪律放专职研究阶段,写作无网(工具级隔离)只从预编号笔记抄标号——judge 8.83 + 忠实度 0.68,标号从紧凑笔记抄使错位减半
  • 07-24
    –25
    最终交付F115 全栈合成= 预引用研究 → 无网写作 → 后置核修:n=10 judge 8.84 + 忠实度 0.69,双轴同超裸 agent,30 阶段零故障 · 行业三结论合体:研究写作分离(LangChain)+ 预引用(Perplexity/GPT-R)+ 后置核修(Anthropic CitationAgent)
  • 07-27情报Grok Build /deep-research 发布(07-26):多 agent 并行核验、缺口披露、平台层引用绑定——与 F115 四点独立收敛;xAI 自认 inline citations 不保证每句引 = G-Cite 不可靠的最强基座旁证
  • 07-28扩容重验题库 10→15 题(借自 DeepResearch Bench,已注明出处):B/F102/F11/F115 优势普遍收窄——F115 judge 优势 +0.66→+0.12(8.84→8.21);根因 e15(地铁碳滑板供应商份额,检索资料稀缺)F115 诚实交白卷被裁判重罚至 2.62,B 靠参数化知识垫分拿 7.12 · 与既有认知一致:可信性收益的代价是检索覆盖不足会被直接暴露,题目分布越难越吃这个亏——结论方向不变(F115 仍双优于 B),但幅度对题库鲁棒性弱于此前认为
  • 07-29转折点题库 15→19 题(新增 4 道信源偏薄的软性话题:低代码利弊/AI教育/市政机制改革;电影票房题因 F11 两次复现 60 轮硬顶+F115 表现亦不佳,已从题库移除并归档):F102/F11/F115 三个方案 judge 全部转负(vs B:−0.30/−0.20/−0.06),忠实度优势维持(+0.10~+0.25) · e15 不是异常值,是一整类"信源稀薄软题"上的系统性效应,去掉最差一题后依然复现——"双优"叙事撤回,改为"质量-忠实度权衡"的准确表述;四臂统一 n=19,不再有 F11 单独的 n 差异
  • 07-29反向验证题库 19→24 题(专门挑"硬"题反向验证:黄金走势/非接触感知算法/Streamable HTTP/珠宝趋势/正畸医美市场,避开会议性问题):judge 差距未收窄(F115 −0.06→−0.08,F11 −0.20→−0.26),说明"质量代价"不只是软题的产物 · 副产物:e22(非接触感知)B/F102 引用走学术论文格式(Author/Venue/Year 无 URL),fact-v2 抓不到网页核验,0 对——F11/F115 的预引用结构性禁止编造 URL,同题也逼出了 5-18 对可核验网页引用,暴露一个尺子局限(学术格式题目对 B/F102 的核验样本量天然偏低)

核心认知(负结果的价值)

引用是管线问题,不是模型自觉问题行业(含 Grok 4.20)都不把引用押在模型写作自觉上。弱基座上唯一有效的路径:harness 发编号、模型填空、程序渲染 URL、独立 pass 核修。
单 pass 认知预算是硬约束三次失败(广度/双通道/原子句)共因相同:往写作 pass 加任何职责都挤掉原有纪律。解法是分阶段付账——研究广度、写作纪律、引用修复各占一个 pass。
测量和被测系统一样需要审计FPR 审计发现超写告警一半是冤枉的(尺子抓页截断);配对口径消掉 B 的 ~1.0 run 间方差;子句级口径去掉聚合低估。三次修尺都改变了结论的读法。
成熟系统救不了弱基座GPT-Researcher(CMU 评测引用忠实第一)接上 MiMo+中文全面崩盘;真正有效的是在强 harness(claude code)上做轻量前/后处理,而非更换编排。
没有免费午餐,且不只是软题的问题n=15 时 e15 一题的崩溃像是异常值;加了软题后 n=19 上三个方案 judge 全部转负;专门挑"硬"题反向验证到 n=24,差距没有收窄(F115 −0.06→−0.08)——诚实披露检索局限被裁判扣分这件事,不靠软题撑场,硬题上一样发生。可信性收益是真实的(忠实度 +0.12~+0.26),但不再是"双优","质量→忠实度"的显式权衡才是准确表述。

数据表(全部 arm)

点击任意一行的 arm 名,查看该组测试的逐题问题原文、报告全文与评分明细。

数据来源:results/mimo_smoke 产物实时聚合(judge=opus-4-8 盲评 ×3 中位;fact=fact-v2,4K 尺全臂同口径)。 B/F102/F11/F115 统一为 n=24;题库 = q01-10 自建 + e11-19、e21-25 借自 DeepResearch Bench(Apache-2.0 已注明出处; 跳过 e20 编号,该题已移除归档到 results/mimo_smoke_archive/)。e22 题(非接触感知算法)B/F102 的引用走学术论文格式 无 URL,fact-v2 抓不到 0 对可核验——F11/F115 的预引用结构禁止编 URL,同题反而逼出网页引用,这是已知的尺子局限。 其余 10 个探索性 arm 仍为 n=3,受 run 间方差(~1.0 judge)影响大,仅作方向参考。完整实验台账见 EXPERIMENTS.md。生成于 2026-07-29。
GitHub 仓库 · 更多项目