timps_rag_evaluator
Evaluate RAG pipelines using RAGAS-style metrics for context precision, recall, faithfulness, answer relevance, MRR, and NDCG. Outputs a runnable evaluation harness and an improvement plan.
Instructions
Run a RAGAS-style evaluation of a RAG pipeline: context precision/recall, faithfulness, answer relevance, MRR/NDCG, with a runnable eval harness and an improvement plan.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| request | No | Plain-English task or context for the agent. | |
| language | No | Primary programming language (default: python). | python |