- ~1.7M 篇 arXiv本地镜像
- 7 个LLM 工具
- ~¥0.04 / 篇深度蒸馏成本
- 436tests
对话式研究 agent:搜索 → 深度蒸馏 → 交叉引用证明,把 arXiv 论文变成可检索、可互链的 markdown 知识库(Obsidian 兼容),内置约 170 万篇的本地镜像。
背景
读论文最耗时的,是把一篇真正"吃透"并和已读过的内容连起来。我想要一个对话式研究助手:用自然语言告诉它要什么,它自己决定调哪个工具,把论文蒸馏成可检索、可互链的知识库。
方法
把"读—蒸—链—查"做成 7 个可被 LLM 调用的工具,本地起一个 ~1.7M 篇的 arXiv 镜像做检索底座,SQLite + FTS5 跑毫秒级查询。每篇产出 12 段式深度蒸馏 + 定理 / 技术的 proof sidecar。
- 搜索 —— 关键词 + 语义混合检索,在 ~1.7M 篇本地镜像里跑
- 深度蒸馏 —— 12 段式固定结构,产出便于跨论文复用
- Proof sidecar —— 定理 / 技术单独挑出来,蒸馏时自动检索相关既有定理喂给模型
- 问答 —— 在已蒸馏的论文上做精准 QA
- 长程研究 —— 跨论文跨主题的批量综合
关键设计
让全库的记号和命名慢慢收敛,是这个工具最得意的复利效应。
- 后蒸馏自动拉前文 —— 每篇蒸馏时检索相关的既有定理 / 技术喂给模型,记号自然对齐
- Obsidian 兼容输出 —— 蒸馏卡是 markdown + 双链,直接进 vault
- 对话式入口 —— 不用记 CLI 参数,自然语言告诉它要什么
- 成本可控 —— 深度蒸馏一篇约 ¥0.04,跑全库才有意义
复盘
研究工具最容易掉进"功能很多但谁都不会用"的坑。这一项的取舍。
- 入口收到对话 —— 让 LLM 决定调哪个工具,而不是用户记参数
- 蒸馏格式锁死 12 段 —— 看似限制,实际让跨论文复用变可能
- 本地镜像不可省 —— 实时调 arXiv API 会慢且不稳
现状
已发布到 PyPI(MIT),436 测试;支持多家 LLM provider;成本可控——深度蒸馏约 ¥0.04 / 篇。