Skip to main content
Glama
README.md
# Simple RAG MCP

Memória persistente para chat: salva conversas e busca as mais relevantes por similaridade (SQLite + FAISS).

## Como funciona

- `memory_store.py` — salva cada turno em SQLite e indexa embeddings no FAISS (embeddings vêm de um servidor llama.cpp).
- `server_mcp.py` — servidor MCP que expõe as ferramentas:
  - `store_memory` — salva um turno (input do usuário + output do assistente)
  - `remember_memory` — busca memórias semanticamente parecidas com o contexto
  - `remember_memory_date` — busca todas as memórias de um dia (`YYYY-MM-DD`)

## Requisitos

- Python 3
- Um servidor llama.cpp rodando com endpoint de embeddings (padrão: `http://127.0.0.1:8001`)

```bash
pip install -r requirements.txt
```

## Uso

```bash
python server_mcp.py
```

Variáveis de ambiente opcionais:

| Variável          | Padrão                   |
| ----------------- | ------------------------ |
| `LLAMA_SERVER_URL`| `http://127.0.0.1:8001`  |
| `EMBED_DIM`       | `1024`                   |

Os dados ficam salvos em `./.llama_memhistory/` (banco SQLite + índice FAISS).

## Licença

MIT