Inference Infrastructure

Model Runtime

Inference backend загружает модели, управляет GPU/CPU-ресурсами, batching, cache и streaming. Runtime скрывается за AI Gateway, чтобы приложения не зависели от конкретного движка.

НазначениеВыполнение inference
МестоBackend за AI Gateway
SLOLatency · Throughput · Availability

Модельный маршрут без привязки к backend

OpenAI-compatible контракт упрощает замену движка, но capacity, tokenizer, context limits и feature support проверяются отдельно.


Варианты реализации

Движки показаны как реализации разных эксплуатационных профилей, а не как обязательный стек.

CPP

llama.cpp

Локальный и edge inference, quantized models, CPU/GPU и простой server mode.

VLLM

vLLM

Высокопроизводительный serving, continuous batching и GPU-пулы.

TGI

TGI

Production serving для transformer-моделей с distributed inference.

OLL

Ollama

Быстрый локальный запуск, управление моделями и удобный developer workflow.

TRT

TensorRT-LLM

Оптимизированный NVIDIA inference для максимальной производительности.

SGL

SGLang

Serving сложных generation workloads, structured output и agentic patterns.


Типичные ошибки

Чаще всего runtime-слой ломается не на выборе движка, а на отсутствии capacity-планирования и проверки контрактов.

01

Один движок на все задачи

Профили нагрузки разные: llama.cpp не заменяет vLLM под high-load, а vLLM избыточен для edge и локальных прототипов.

02

Нет capacity-планирования

Длинный контекст, batch и KV-cache съедают VRAM быстрее ожиданий; пиковая нагрузка проверяется до production, а не на пользователях.

03

Замена движка без проверки контракта

OpenAI-compatible ≠ идентичный: tokenizer, context limits, streaming и function calling отличаются между backends.

04

Runtime доступен напрямую

Приложения, минующие AI Gateway, теряют квоты, fallback, cost-учёт и audit trail — и ломаются при замене backend.


Связанные технические разделы

Продолжите по соседнему слою архитектуры или вернитесь к полной карте технических материалов.

Вернуться в технический раздел →

Разобрать ваш AI-контур

Можно начать с короткой архитектурной сессии: выбрать первый сценарий, определить данные, модельный маршрут, требования к железу, риски и пилотные метрики.

Открыть каталог схем Форма откроет подготовленное письмо, чтобы не отправлять данные через сторонний сервис.