learn-corpus-retrieval
Click on "Deploy Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@learn-corpus-retrieval从我的会话和笔记里找出关于检索索引的决定,并附上来源"
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
Learn Corpus
让 AI 从积累的会话、笔记和文章中找到依据,带着证据回答问题。
Learn Corpus 将分散的个人资料整理成可检索的语料库。用户可以用自然语言让 AI 导入指定资料,也可以追问过去的讨论、比较不同来源,或查找某个决定的背景。检索与来源读取由本项目提供,回答由所使用的 AI 完成。
主要用途
找回讨论背景。 从历史会话、笔记和保存的文章中找回相关上下文,重新理解过去的方案、决定和变化。
围绕问题追查证据。 AI 搜索候选、读取正文,并针对证据缺口继续查找,用于跨会话、跨资料的核对与比较。
核对来源与依据。 区分用户陈述、助手建议和外部资料,根据实际读到的正文回答,保留出处、条件和未确认之处。
查看检索过程。 按需查看检索范围、调用记录、已读来源与停止原因,了解回答依据和检索的局限。
目前支持 Claude Code/Codex 会话记录,Markdown 形式的 ChatGPT/DeepSeek 网页会话、笔记和外部文章。来源处理与检索由项目 skill 组织,资料范围和检索目标由用户指定。
Related MCP server: local-docs-mcp
工作流程
flowchart LR
A["会话、笔记、文章"] --> B["导入与标准化"]
B --> C["可追溯的来源库"]
C --> D["离线构建检索索引"]
D --> E["检索与上下文读取"]
E --> F["AI 根据证据回答"]资料经过整理后构建检索索引。AI 通过 MCP 搜索并读取相关正文,再根据证据回答;服务也提供 REST 接口。本机可使用 stdio 或 HTTP MCP,跨机可使用 HTTP MCP。本机 stdio 由客户端启动服务子进程;网络部署按实际环境配置 HTTPS 入口,Nginx 与 systemd 模板是可选示例,见配置与部署。
资料导入与索引构建可以在其他环境完成。分机部署时,检索服务从索引读取正文与上下文,部署机无需克隆整个仓库或保存原始资料、sources/ 来源文件;所需代码与运行文件见部署代码说明。
开始使用
按使用指南准备环境、导入第一份资料并连接检索服务;也可先运行公开示例完成一次隔离演示,然后向 AI 描述问题,例如:
使用 learn-corpus-retrieval 回答:<问题>。AI 做出回答之后,可以向它索要检索过程。检索过程有 2 档详细程度:
提问: 围绕具体问题检索资料,给出有来源的回答。
展示检索摘要: 概括检索范围、关键证据、异常或缺口、停止原因,并给出核心来源定位。
展示完整检索过程: 在检索摘要基础上,进一步展开调用记录和已读检索单元的明细;受响应限制省略的部分会明确说明。
使用时需要支持 MCP 的 AI 客户端,并加载来源导入 skill和检索 skill。
使用须知
运行环境: 要求 Python 3.10 或更新版本,以及启用 FTS5 的 SQLite。本机 stdio 支持 Linux/WSL,Windows 原生和 SSH 跨机 stdio 未纳入初版支持范围。
资料准备与更新: 首次使用需要先导入有效资料并构建索引,资料更新后也需要依照 skill 指示更新索引。标准化来源、登记与日志、索引和执行账本由程序维护,用户与 AI agent 不应直接修改,具体范围与修改入口见产物维护边界。运行中的服务固定索引版本,发布新索引后需重启 HTTP 服务或重连 stdio 客户端,不支持热更新。
检索方式: 当前采用 SQLite FTS5 词法查询,召回效果受资料覆盖和实际用词影响,不保证每个问题都能完整召回。
回答依据: 搜索摘要用于发现候选,回答依据来自进一步读取的正文。检索不到不能证明相关事情没有发生;资料不足时应保留结论边界。答案由外部 AI 组织,仍可能漏读、误判或引用不准确,服务端不验证答案正确性。
功能范围: 初版提供来源导入和只读检索,不包含 Memory 提取、Wiki 生成或整理、向量或语义检索、服务端模型回答、人工审核 Web 界面、来源或知识写回接口及公网 OAuth。
来源范围: 标准化来源经过选择和清洗,不是原始会话的无损归档;遗漏资料和被省略的事件不会自动补齐。派生问答的重复内容与循环佐证尚未专门治理,导入清洗和扫描也不保证内容完全脱敏。
执行限制: MCP 任务有调用次数和证据预算限制,接口有响应大小、处理时限和并发限制,可能留下部分正文、截断明细或未解决项;具体约束以实际任务限制和配置说明为准。
任务恢复: 执行账本保存调用记录和来源定位,不保存证据正文;初版不提供跨会话、上下文压缩后的证据恢复或工具结果重放。
故障与维护: 来源导入没有整批磁盘事务或通用自动恢复,写入中断需核对现场。账本清理、归档、轮换和旧索引回收需要人工维护,操作边界见使用指南和运维检查清单。
接口兼容: MCP 仅实现声明的协议子集,客户端需支持结构化结果,不能假定任意客户端都兼容。旧接口字段、索引及账本格式不提供兼容层或自动迁移,升级需按配置与部署处理。
文档与帮助
导入或检索问题见使用指南的常见问题。反馈时说明预期行为、实际结果和错误阶段,去除凭据、私人路径与来源内容。
开发者可从源码说明查找模块与命令入口,开发约定见 AGENTS.md。
参考项目与资料
项目开发参考了以下开源仓库的代码与设计:
全文检索与迭代检索的参考资料:
本项目采用 MIT License。演示文章的来源与授权说明单独记录,不由项目许可证重新授权。
公开提交历史由实际开发历史过滤整理,省略个人资料、开发记录和评测部分,并按保留的代码变更调整提交说明。当前版本支持上述使用流程,历史中间节点不保证具备最终版本的完整流程。
This server cannot be deployed
Maintenance
Related MCP Connectors
Personal context for every AI: search, read, and write back to your private Markdown library.
- AmberOAuthcom.ambermem
Long-term memory for AI assistants. Hybrid retrieval, query expansion, auto-topics.
Ingest, manage, and retrieve documents for RAG-powered AI applications
Search your knowledge bases from any AI assistant using hybrid RAG.
Related MCP Servers
- FlicenseNot gradedqualityDmaintenanceEnables semantic search and conversational querying across a personal research library of PDFs, DOCX, and other documents using a vector database. It provides tools for document summarization, finding related papers, and high-accuracy retrieval for AI clients like Claude Desktop.-
- AlicenseNot gradedqualityDmaintenanceEnables AI assistants to perform semantic, hybrid, and filtered search on indexed local documentation with RAG capabilities.2MIT
- FlicenseNot gradedqualityDmaintenanceEnables AI agents to index, search, and retrieve architectural documentation and store self-learning notes from codebases.1-
- FlicenseNot gradedqualityBmaintenanceProvides read-only access to a personal RAG knowledge base, enabling hybrid search, evidence-grounded retrieval with citations, and knowledge gap tracking for LLM agents.-