项目
我做的东西有一条共同的线:不相信模型的自述,把每一个说法变成可核验的检查。 每个项目都有独立站点、可复现的命令,以及带出处的数字。
GitHub:github.com/alloevil
证据优先的 Agent 工具链
codeblast — 合并前就知道会坏在哪
确定性代码图,给出架构图、变更图与影响面图,每条边都带 file:line 证据。召回率用变异测试(mutation testing)验证,而不是自我声明。面向人类 reviewer 和 AI agent 两种消费者。
- 站点:https://alloevil.github.io/codeblast/
- 试用:
npx codeblast demo· npm 包codeblast - 仓库:alloevil/codeblast
- 关键词:impact analysis、blast radius、call graph、TypeScript、monorepo、PR review
paired-eval — 先跑程序检查,再谈评分
评测模型、agent 与 harness:能用程序判定的先用程序判定,剩下的才交给 rubric,最后用配对统计(paired statistics)给结论,并明确说明哪些情况它排除不了。零依赖,Python 3.9+。
- 站点:https://alloevil.github.io/paired-eval/
- 安装:
pip install paired-eval· PyPI 包paired-eval - 仓库:alloevil/paired-eval
- 关键词:LLM evaluation、A/B testing、paired comparison、mutation testing
AgentXRay — 读 agent 真正做了什么
AI agent 会话日志的可视化面板,支持 Claude Code、Codex、OpenClaw、Hermes、OMP、Gemini CLI。逐轮(per-turn)的时间 / token / 成本流水,用来定位 agent 在哪一步跑偏。
- 站点:https://alloevil.github.io/AgentXRay/
- 试用:
npx @alloevil/agent-xray - 仓库:alloevil/AgentXRay
- 关键词:agent observability、session log viewer、debugging、token cost
评测数据与追踪
agent-harness-evals — 同一个模型,换个 harness 会怎样
跨模型、agent harness 与工具的统一评测数据,一套 schema、实时数据源。呈现模型榜单不会告诉你的「模型 × harness」矩阵。
- 站点:https://alloevil.github.io/agent-harness-evals/
- 仓库:alloevil/agent-harness-evals
- 关键词:SWE-bench、Terminal-bench、agent harness、leaderboard
llm-benchmarks-tracker — 带出处的 benchmark 目录
有来源、经 schema 校验的 LLM 与 agent benchmark 目录:每个 benchmark 测什么、是否已饱和(saturation)、是否有污染(contamination),以及最高分及其出处(官方 / 独立 / 自报)。提供 JSON API。
- 站点:https://alloevil.github.io/llm-benchmarks-tracker/
- 仓库:alloevil/llm-benchmarks-tracker
- 关键词:LLM benchmarks、leaderboard、dataset、JSON API、evaluation
AI-Paper-Daily — 每日论文发现
面向 AI Agent、RAG、知识图谱方向的每日论文追踪,数据来自 arXiv 与 HuggingFace Daily Papers(经 LLM 筛选),自动生成日报与周报。
- 站点:https://alloevil.github.io/AI-Paper-Daily/
- 仓库:alloevil/AI-Paper-Daily
- 关键词:arXiv、RAG、knowledge graph、paper digest
研究与横向对比
coding-agent-internals — 12 个 coding agent 是怎么实现的
不是功能清单,是实现方式的对比:search、edit、LSP、DAP、sub-agent 各自怎么做 —— shell fork 还是 in-process,str_replace 还是 hash 锚定。关注的是能力上限,而不是勾选框。
- 站点:https://alloevil.github.io/coding-agent-internals/
- 仓库:alloevil/coding-agent-internals
- 关键词:Claude Code、Codex、OMP、agent architecture、LSP、DAP
agents-with-receipts — 有据可查的 agentic coding 实践
逐格核验过的跨工具对照表、带出处的实践地图,以及一个 AGENTS.md linter。每个断言都能追到来源。
- 站点:https://alloevil.github.io/agents-with-receipts/
- 仓库:alloevil/agents-with-receipts
- 关键词:AGENTS.md、agentic coding practices、linter
deepresearch-arms-lab — 14 组消融,负结果照样留着
在一个弱 base model 上对 deep research 流水线做 14-arm 消融实验,负结果不删,并做了重复验证。用来回答「这些 deep research 技巧到底哪些真的有用」。
- 站点:https://alloevil.github.io/deepresearch-arms-lab/
- 仓库:alloevil/deepresearch-arms-lab
- 关键词:ablation study、deep research、negative results、LLM evaluation
自动化与其他
agent-changelog — 主流 AI Agent 框架版本追踪
从上游 release 同步而来的 changelog 聚合站,追踪 OpenClaw、Hermes 等 agent 框架的版本变化。非官方,来源均可回溯。
github-discovery — 在项目火之前发现它
从 6 个数据源发现潜在的 trending 仓库,带评分模型与反刷榜处理,输出每日邮件摘要。
foodmap — 美食地图
把美食博主推荐过的餐馆做成可视化地图,支持从内容里抽取店名并地理编码。
给 LLM / AI 检索用
机器可读的项目概览见 llms.txt,完整版见 llms-full.txt。
每个项目站点都带 llms.txt 与 sitemap.xml;有实测数字的项目另有带出处的 claims.json,
输出是定性结论的项目则刻意不提供 —— 宁可没有指标,也不编一个。