Skip to main content
Glama
def-a-name

learn-corpus-retrieval

by def-a-name

Learn Corpus

让 AI 从积累的会话、笔记和文章中找到依据,带着证据回答问题。

Learn Corpus 将分散的个人资料整理成可检索的语料库。用户可以用自然语言让 AI 导入指定资料,也可以追问过去的讨论、比较不同来源,或查找某个决定的背景。检索与来源读取由本项目提供,回答由所使用的 AI 完成。

主要用途

  • 找回讨论背景。 从历史会话、笔记和保存的文章中找回相关上下文,重新理解过去的方案、决定和变化。

  • 围绕问题追查证据。 AI 搜索候选、读取正文,并针对证据缺口继续查找,用于跨会话、跨资料的核对与比较。

  • 核对来源与依据。 区分用户陈述、助手建议和外部资料,根据实际读到的正文回答,保留出处、条件和未确认之处。

  • 查看检索过程。 按需查看检索范围、调用记录、已读来源与停止原因,了解回答依据和检索的局限。

目前支持 Claude Code/Codex 会话记录,Markdown 形式的 ChatGPT/DeepSeek 网页会话、笔记和外部文章。来源处理与检索由项目 skill 组织,资料范围和检索目标由用户指定。

Related MCP server: local-docs-mcp

工作流程

flowchart LR
    A["会话、笔记、文章"] --> B["导入与标准化"]
    B --> C["可追溯的来源库"]
    C --> D["离线构建检索索引"]
    D --> E["检索与上下文读取"]
    E --> F["AI 根据证据回答"]

资料经过整理后构建检索索引。AI 通过 MCP 搜索并读取相关正文,再根据证据回答;服务也提供 REST 接口。本机可使用 stdio 或 HTTP MCP,跨机可使用 HTTP MCP。本机 stdio 由客户端启动服务子进程;网络部署按实际环境配置 HTTPS 入口,Nginx 与 systemd 模板是可选示例,见配置与部署。

资料导入与索引构建可以在其他环境完成。分机部署时,检索服务从索引读取正文与上下文,部署机无需克隆整个仓库或保存原始资料、sources/ 来源文件;所需代码与运行文件见部署代码说明。

开始使用

按使用指南准备环境、导入第一份资料并连接检索服务;也可先运行公开示例完成一次隔离演示,然后向 AI 描述问题,例如:

使用 learn-corpus-retrieval 回答:<问题>。

AI 做出回答之后,可以向它索要检索过程。检索过程有 2 档详细程度:

  • 提问: 围绕具体问题检索资料,给出有来源的回答。

  • 展示检索摘要: 概括检索范围、关键证据、异常或缺口、停止原因,并给出核心来源定位。

  • 展示完整检索过程: 在检索摘要基础上,进一步展开调用记录和已读检索单元的明细;受响应限制省略的部分会明确说明。

使用时需要支持 MCP 的 AI 客户端,并加载来源导入 skill和检索 skill。

使用须知

  1. 运行环境: 要求 Python 3.10 或更新版本,以及启用 FTS5 的 SQLite。本机 stdio 支持 Linux/WSL,Windows 原生和 SSH 跨机 stdio 未纳入初版支持范围。

  2. 资料准备与更新: 首次使用需要先导入有效资料并构建索引,资料更新后也需要依照 skill 指示更新索引。标准化来源、登记与日志、索引和执行账本由程序维护,用户与 AI agent 不应直接修改,具体范围与修改入口见产物维护边界。运行中的服务固定索引版本,发布新索引后需重启 HTTP 服务或重连 stdio 客户端,不支持热更新。

  3. 检索方式: 当前采用 SQLite FTS5 词法查询,召回效果受资料覆盖和实际用词影响,不保证每个问题都能完整召回。

  4. 回答依据: 搜索摘要用于发现候选,回答依据来自进一步读取的正文。检索不到不能证明相关事情没有发生;资料不足时应保留结论边界。答案由外部 AI 组织,仍可能漏读、误判或引用不准确,服务端不验证答案正确性。

  5. 功能范围: 初版提供来源导入和只读检索,不包含 Memory 提取、Wiki 生成或整理、向量或语义检索、服务端模型回答、人工审核 Web 界面、来源或知识写回接口及公网 OAuth。

  6. 来源范围: 标准化来源经过选择和清洗,不是原始会话的无损归档;遗漏资料和被省略的事件不会自动补齐。派生问答的重复内容与循环佐证尚未专门治理,导入清洗和扫描也不保证内容完全脱敏。

  7. 执行限制: MCP 任务有调用次数和证据预算限制,接口有响应大小、处理时限和并发限制,可能留下部分正文、截断明细或未解决项;具体约束以实际任务限制和配置说明为准。

  8. 任务恢复: 执行账本保存调用记录和来源定位,不保存证据正文;初版不提供跨会话、上下文压缩后的证据恢复或工具结果重放。

  9. 故障与维护: 来源导入没有整批磁盘事务或通用自动恢复,写入中断需核对现场。账本清理、归档、轮换和旧索引回收需要人工维护,操作边界见使用指南和运维检查清单。

  10. 接口兼容: MCP 仅实现声明的协议子集,客户端需支持结构化结果,不能假定任意客户端都兼容。旧接口字段、索引及账本格式不提供兼容层或自动迁移,升级需按配置与部署处理。

文档与帮助

内容

阅读位置

首次使用、日常更新和常见问题

使用指南

数据流、模块边界及关键设计

架构说明

本机连接、HTTP 配置、部署和运行排查

配置与部署

导入或检索问题见使用指南的常见问题。反馈时说明预期行为、实际结果和错误阶段,去除凭据、私人路径与来源内容。

开发者可从源码说明查找模块与命令入口,开发约定见 AGENTS.md。

参考项目与资料

项目开发参考了以下开源仓库的代码与设计:

全文检索与迭代检索的参考资料:

本项目采用 MIT License。演示文章的来源与授权说明单独记录,不由项目许可证重新授权。

公开提交历史由实际开发历史过滤整理,省略个人资料、开发记录和评测部分,并按保留的代码变更调整提交说明。当前版本支持上述使用流程,历史中间节点不保证具备最终版本的完整流程。

Related MCP Connectors

Related MCP Servers

  • F
    license
    Not graded
    quality
    D
    maintenance
    Enables semantic search and conversational querying across a personal research library of PDFs, DOCX, and other documents using a vector database. It provides tools for document summarization, finding related papers, and high-accuracy retrieval for AI clients like Claude Desktop.
    -
  • A
    license
    Not graded
    quality
    D
    maintenance
    Enables AI assistants to perform semantic, hybrid, and filtered search on indexed local documentation with RAG capabilities.
    2
    MIT
  • F
    license
    Not graded
    quality
    B
    maintenance
    Provides read-only access to a personal RAG knowledge base, enabling hybrid search, evidence-grounded retrieval with citations, and knowledge gap tracking for LLM agents.
    -