detect_prompt_injection
Analyze text for prompt injection attempts, including instruction overrides and data exfiltration, with context-aware risk scoring to protect AI agent workflows.
Instructions
Analyze text for prompt injection attempts. Detects instruction overrides, identity manipulation, system prompt extraction, data exfiltration, delimiter attacks, encoded injections, and privilege escalation. Context-aware risk scoring.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| text | Yes | The text to analyze for prompt injection patterns | |
| context | Yes | Where this text originates — affects risk scoring (user_input is highest risk) |