Tracing
Полный путь запроса, latency по этапам, model route, retrieval и tool calls.
Наблюдаемость связывает request trace, model usage, retrieval quality, tool calls, инфраструктурные метрики и audit events в один диагностический контекст.
Trace проходит через gateway, security, model runtime, RAG и tools; чувствительное содержимое не попадает в telemetry без редактирования.
Место компонента в общей архитектуре корпоративной AI-платформы.
Внутренние компоненты, границы ответственности и основные связи.
Путь пользовательского запроса через контрольные точки компонента.
Движение данных, контекста и результатов внутри системы.
Инфраструктурные метрики без AI-контекста недостаточны; prompt/response quality без SLO также не даёт эксплуатационной картины.
Полный путь запроса, latency по этапам, model route, retrieval и tool calls.
TTFT, tokens/sec, queue depth, GPU utilization, error rate и saturation.
Retrieval relevance, groundedness, citation coverage, task success и human feedback.
Токены, модель, tenant, проект, cache hit rate и стоимость успешной задачи.
Политики, tool decisions, approvals, admin changes и security events.
Алерты по SLO, security anomalies, budget thresholds и деградации retrieval.
Компоненты взаимодополняют друг друга: стандарт сбора, хранилище метрик, визуализация и AI-native trace/evaluation.
Единая модель traces, metrics и logs с vendor-neutral collectors.
Эксплуатационные SLO, capacity и инфраструктурные сигналы.
Prompt/model traces, datasets, evaluation и анализ качества AI-вызовов.
Наблюдаемость чаще всего добавляют после первого инцидента — и именно поэтому первый инцидент разбирают вслепую.
Без сквозного correlation ID путь запроса через gateway, security, RAG, runtime и tools невозможно восстановить.
Prompt и response попадают в трейсы без редактирования — и мониторинг сам становится каналом утечки.
GPU utilization и error rate ничего не говорят о качестве ответов: без eval-метрик деградация retrieval незаметна.
Cost атрибуцируется по tenant, проекту и задаче в реальном времени, а не обнаруживается в счёте провайдера в конце месяца.
Продолжите по соседнему слою архитектуры или вернитесь к полной карте технических материалов.
Можно начать с короткой архитектурной сессии: выбрать первый сценарий, определить данные, модельный маршрут, требования к железу, риски и пилотные метрики.