← 返回项目

LLM Agents · 研究工具 · 2026

Paper Distiller — arXiv 论文蒸馏对话 agent

角色
设计 · 实现
技术
Python · LLM · RAG · SQLite / FTS5
场景
开源 · PyPI / MIT
年份
2026
  • ~1.7M 篇 arXiv
    本地镜像
  • 7 个
    LLM 工具
  • ~¥0.04 / 篇
    深度蒸馏成本
  • 436
    tests

对话式研究 agent:搜索 → 深度蒸馏 → 交叉引用证明,把 arXiv 论文变成可检索、可互链的 markdown 知识库(Obsidian 兼容),内置约 170 万篇的本地镜像。

背景

读论文最耗时的,是把一篇真正"吃透"并和已读过的内容连起来。我想要一个对话式研究助手:用自然语言告诉它要什么,它自己决定调哪个工具,把论文蒸馏成可检索、可互链的知识库。

方法

把"读—蒸—链—查"做成 7 个可被 LLM 调用的工具,本地起一个 ~1.7M 篇的 arXiv 镜像做检索底座,SQLite + FTS5 跑毫秒级查询。每篇产出 12 段式深度蒸馏 + 定理 / 技术的 proof sidecar。

  • 搜索 —— 关键词 + 语义混合检索,在 ~1.7M 篇本地镜像里跑
  • 深度蒸馏 —— 12 段式固定结构,产出便于跨论文复用
  • Proof sidecar —— 定理 / 技术单独挑出来,蒸馏时自动检索相关既有定理喂给模型
  • 问答 —— 在已蒸馏的论文上做精准 QA
  • 长程研究 —— 跨论文跨主题的批量综合

关键设计

让全库的记号和命名慢慢收敛,是这个工具最得意的复利效应。

  • 后蒸馏自动拉前文 —— 每篇蒸馏时检索相关的既有定理 / 技术喂给模型,记号自然对齐
  • Obsidian 兼容输出 —— 蒸馏卡是 markdown + 双链,直接进 vault
  • 对话式入口 —— 不用记 CLI 参数,自然语言告诉它要什么
  • 成本可控 —— 深度蒸馏一篇约 ¥0.04,跑全库才有意义

复盘

研究工具最容易掉进"功能很多但谁都不会用"的坑。这一项的取舍。

  • 入口收到对话 —— 让 LLM 决定调哪个工具,而不是用户记参数
  • 蒸馏格式锁死 12 段 —— 看似限制,实际让跨论文复用变可能
  • 本地镜像不可省 —— 实时调 arXiv API 会慢且不稳

现状

已发布到 PyPI(MIT),436 测试;支持多家 LLM provider;成本可控——深度蒸馏约 ¥0.04 / 篇。