Security Layer

LLM Firewall: защита AI-контура

LLM Firewall защищает именно модельный контур: prompt, output, multimodal input, tool intent и системные инструкции. Сетевой перехват, proxy/ICAP и контроль внешнего AI вынесены в отдельный AI Security Gateway.


SEC

Почему обычного WAF недостаточно?

Классический WAF не понимает семантику промптов. Он может поймать SQL-инъекцию, но не распознает просьбу “игнорируй системные инструкции” или скрытую попытку заставить модель вызвать запрещенный tool. LLM Firewall анализирует смысл входа и выхода, права пользователя, класс данных и допустимые действия.

Проверки входящего запроса

  • Prompt injection и jailbreak-паттерны
  • PII-redaction: имена, телефоны, паспорта, ИНН
  • Запрещенные темы и категории контента
  • Размер запроса и rate limiting по ролям

Проверки ответа модели

  • Sensitive data в ответе (DLP)
  • Галлюцинации и неуверенные утверждения
  • Compliance с корпоративными политиками
  • Детекция вредоносного кода в output

Инструменты и реализации

Prompt Guard

API-сервис для детекции prompt injection и jailbreak

NeMo Guardrails

NVIDIA open-source фреймворк для guardrails и dialogue flow

DLP Scanner

Локальный open-source сканер + кастомный Python middleware

Policy Middleware

Собственный промежуточный сервис на Python/FastAPI

Защита всех модельных входов и выходов

Guardrails работают после сетевого контроля и до исполнения model/tool request. Политика учитывает семантику, роль, источник контекста и допустимые действия.

IN

Input & Prompt Injection

Jailbreak, indirect prompt injection, role escalation, hidden instructions и poisoned context.

OUT

Output Guardrails

System prompt leakage, unsafe content, policy violations, sensitive data и structured-output validation.

VIS

Vision & Image Security

Скрытый текст, QR/visual injection, неподдерживаемый контент и multimodal policy checks.

DOC

Document Security

Indirect instructions в документах, provenance, trust boundaries и отделение данных от команд.

POL

Policies

Разные правила по tenant, роли, модели, knowledge source, tool и классу данных.

GRD

Guardrails

Детерминированные правила, classifiers, policy models и human escalation в одном pipeline.


Связанные технические разделы

Продолжите по соседнему слою архитектуры или вернитесь к полной карте технических материалов.

Вернуться в технический раздел →

Разобрать ваш AI-контур

Можно начать с короткой архитектурной сессии: выбрать первый сценарий, определить данные, модельный маршрут, требования к железу, риски и пилотные метрики.

Открыть каталог схем Форма откроет подготовленное письмо, чтобы не отправлять данные через сторонний сервис.