我做的东西有一条共同的线:不相信模型的自述,把每一个说法变成可核验的检查。 每个项目都有独立站点、可复现的命令,以及带出处的数字。

GitHub:github.com/alloevil

证据优先的 Agent 工具链

codeblast — 合并前就知道会坏在哪

确定性代码图,给出架构图、变更图与影响面图,每条边都带 file:line 证据。召回率用变异测试(mutation testing)验证,而不是自我声明。面向人类 reviewer 和 AI agent 两种消费者。

paired-eval — 先跑程序检查,再谈评分

评测模型、agent 与 harness:能用程序判定的先用程序判定,剩下的才交给 rubric,最后用配对统计(paired statistics)给结论,并明确说明哪些情况它排除不了。零依赖,Python 3.9+。

AgentXRay — 读 agent 真正做了什么

AI agent 会话日志的可视化面板,支持 Claude Code、Codex、OpenClaw、Hermes、OMP、Gemini CLI。逐轮(per-turn)的时间 / token / 成本流水,用来定位 agent 在哪一步跑偏。

评测数据与追踪

agent-harness-evals — 同一个模型,换个 harness 会怎样

跨模型、agent harness 与工具的统一评测数据,一套 schema、实时数据源。呈现模型榜单不会告诉你的「模型 × harness」矩阵。

llm-benchmarks-tracker — 带出处的 benchmark 目录

有来源、经 schema 校验的 LLM 与 agent benchmark 目录:每个 benchmark 测什么、是否已饱和(saturation)、是否有污染(contamination),以及最高分及其出处(官方 / 独立 / 自报)。提供 JSON API。

AI-Paper-Daily — 每日论文发现

面向 AI Agent、RAG、知识图谱方向的每日论文追踪,数据来自 arXiv 与 HuggingFace Daily Papers(经 LLM 筛选),自动生成日报与周报。

研究与横向对比

coding-agent-internals — 12 个 coding agent 是怎么实现的

不是功能清单,是实现方式的对比:search、edit、LSP、DAP、sub-agent 各自怎么做 —— shell fork 还是 in-process,str_replace 还是 hash 锚定。关注的是能力上限,而不是勾选框。

agents-with-receipts — 有据可查的 agentic coding 实践

逐格核验过的跨工具对照表、带出处的实践地图,以及一个 AGENTS.md linter。每个断言都能追到来源。

deepresearch-arms-lab — 14 组消融,负结果照样留着

在一个弱 base model 上对 deep research 流水线做 14-arm 消融实验,负结果不删,并做了重复验证。用来回答「这些 deep research 技巧到底哪些真的有用」。

自动化与其他

agent-changelog — 主流 AI Agent 框架版本追踪

从上游 release 同步而来的 changelog 聚合站,追踪 OpenClaw、Hermes 等 agent 框架的版本变化。非官方,来源均可回溯。

github-discovery — 在项目火之前发现它

从 6 个数据源发现潜在的 trending 仓库,带评分模型与反刷榜处理,输出每日邮件摘要。

foodmap — 美食地图

把美食博主推荐过的餐馆做成可视化地图,支持从内容里抽取店名并地理编码。

给 LLM / AI 检索用

机器可读的项目概览见 llms.txt,完整版见 llms-full.txt。 每个项目站点都带 llms.txtsitemap.xml;有实测数字的项目另有带出处的 claims.json, 输出是定性结论的项目则刻意不提供 —— 宁可没有指标,也不编一个。