Skip to main content
Glama

Faultline

Faultline — это MCP-нативная AI-система реагирования на инциденты, предназначенная для расследования инцидентов в продакшене, сбора доказательств из операционных систем, выявления вероятных корневых причин, рекомендации мер по устранению и проверки восстановления.

Обзор

Современные инциденты в продакшене часто требуют от инженеров сопоставления сигналов из логов, метрик, деплоев, исходного кода и эксплуатационной документации. Faultline исследует, как AI-агент может проводить такое расследование с помощью стандартизированных MCP-инструментов, оставаясь наблюдаемым, тестируемым и безопасным в эксплуатации.

Проект разработан как local-first система, которая может работать без платных AI API и облачной инфраструктуры, сохраняя при этом четкий путь к масштабируемому развертыванию.

Related MCP server: AIOps MCP

Основные цели

  • Расследование инцидентов, приближенных к продакшену, с помощью автономного AI-агента.

  • Использование Model Context Protocol (MCP) для предоставления операционных возможностей в виде структурированных инструментов.

  • Сбор и сопоставление доказательств из логов, метрик, изменений исходного кода, деплоев и runbook.

  • Формирование подкрепленных доказательствами гипотез о корневой причине вместо необоснованных ответов.

  • Поддержка контролируемого устранения инцидентов с валидацией и одобрением человеком разрушительных действий.

  • Оценка качества агента с помощью автоматизированных оценок и регрессионных тестов.

  • Обеспечение наблюдаемости за решениями агента, использованием инструментов, задержками, сбоями и результатами.

  • Поддержание бесплатного пути локальной разработки и оценки со сменными компонентами инфраструктуры.

Планируемые возможности

Расследование инцидентов

  • Прием и нормализация инцидентов

  • Сбор доказательств из операционных источников

  • Формирование гипотез о корневой причине

  • Диагностика на основе доказательств

  • Проверка восстановления

MCP-инструменты

  • Просмотр метрик

  • Поиск и анализ логов

  • Просмотр истории Git и деплоев

  • Получение runbook

  • Управление состоянием инцидента

  • Контролируемые действия по устранению инцидента

Оценка AI

Faultline будет включать специальный фреймворк для оценки:

  • Точность определения корневой причины

  • Корректность доказательств

  • Качество выбора инструментов

  • Эффективность использования инструментов

  • Полнота диагностики

  • Точность устранения инцидента

  • Качество траектории агента

Результаты оценки будут использоваться для регрессионного тестирования промптов, моделей, стратегий поиска и изменений агента.

Надежность и безопасность

  • Структурированные входы и выходы инструментов

  • Таймауты и повторные попытки

  • Обработка сбоев и резервные механизмы

  • Аутентификация и авторизация

  • Журналирование аудита

  • Одобрение человеком (human-in-the-loop) действий с высоким риском

  • Ограничение частоты запросов и контролируемое выполнение

Направление архитектуры

Incident
   |
   v
AI Agent
   |
   v
MCP Tool Layer
   |
   +----------------+----------------+----------------+
   |                |                |
   v                v                v
Metrics           Logs           Git / Deployments
   |                |                |
   +----------------+----------------+
                    |
                    v
             Evidence Engine
                    |
                    v
              Root Cause
                    |
                    v
            Remediation Plan
                    |
             Human Approval
                    |
                    v
            Recovery Verification
                    |
                    v
                  Evals

Local-First дизайн

Первоначальная реализация предназначена для локального запуска с использованием компонентов с открытым исходным кодом, таких как:

  • Python

  • MCP SDK

  • Ollama и локально размещенная открытая модель

  • FastAPI

  • SQLite или PostgreSQL

  • Prometheus

  • Loki

  • Docker

Система сохранит модель, хранилище и компоненты инфраструктуры взаимозаменяемыми, чтобы та же архитектура в дальнейшем могла поддерживать размещенные модели, распределенные воркеры, управляемые базы данных и облачные платформы наблюдаемости.

Статус проекта

Faultline находится на начальном этапе архитектуры и реализации. Первая веха — полный вертикальный срез: воспроизводимый инцидент, приближенный к продакшену, сбор доказательств на основе MCP, диагностика агентом и автоматическая оценка результата.

Лицензия

Лицензия будет добавлена.

F
license - not found
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    B
    quality
    D
    maintenance
    MCP server for AI-assisted trading operations, enabling agents to diagnose and resolve FIX, OMS, and venue incidents through controlled tools and human approval.
    38
    MIT
  • A
    license
    Not graded
    quality
    B
    maintenance
    Enables autonomous SRE incident investigation by allowing users to describe incidents in natural language. The agent follows a governed state machine to gather read-only evidence and produce grounded conclusions.
    MIT

View all related MCP servers

Related MCP Connectors

  • AI agent run monitoring with incident replay and SLA receipts.

  • Remote MCP for A2A failure replay MCP, structured receipts, audit logs, and reviewer-ready evidence.

  • An AI concierge that turns static forms into adaptive AI conversations. From any MCP client.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/aawhan0/Faultline'

If you have feedback or need assistance with the MCP directory API, please join our Discord server