Синтетический эксперимент с TTFT и динамическими границами ОНФ
Продолжая развивать концепцию Области Нормального
Функционирования (ОНФ), я ищу новые типы систем, к которым этот подход может
быть применим.
Искусственный интеллект — особенно сервисы на основе больших
языковых моделей (LLM) — представляет в этом смысле очень интересный пример.
Система ИИ — это всё-таки система, выполняющая работу. Она
получает нагрузку, использует вычислительные ресурсы, формирует результат и
имеет измеримые характеристики производительности. Отсюда естественно возникает
вопрос:
Можно ли определить Область Нормального Функционирования для сервиса
ИИ?
Я думаю, что можно.
Измерение производительности LLM
Рассмотрим пользователя, который отправляет запрос большой
языковой модели. Одной из полезных характеристик производительности является
Time to First Token (TTFT) — время между отправкой запроса и появлением первого
токена ответа.
Для запроса i это можно записать так:
TTFTᵢ = t(first token) −
t(request)
На TTFT влияют многие факторы: нагрузка, размер промпта,
число параллельных запросов, особенности модели и доступные вычислительные
ресурсы. Поэтому ожидать, что TTFT будет постоянным, было бы неправильно.
Вместо вопроса «находится ли TTFT ниже фиксированного
порога?» ОНФ предлагает другой вопрос: какой диапазон значений TTFT
соответствует нормальному функционированию именно этой системы ИИ при её
текущих условиях работы?
Синтетический эксперимент
Чтобы проверить эту идею, я сгенерировал синтетический набор
данных, представляющий 600 последовательных запросов к LLM-сервису. В модели
нагрузки присутствуют:
·
число токенов в промпте и в ответе;
·
изменяющийся уровень параллельных запросов;
·
начальный стабильный режим работы;
·
постепенный рост нагрузки;
·
временный период перегрузки;
·
восстановление с переходом к несколько иному
рабочему режиму.
Концептуально TTFT моделировался следующим образом:
TTFTᵢ = f(Pᵢ, Cᵢ) + εᵢ
где Pᵢ — размер промпта, Cᵢ — параллельная нагрузка, а εᵢ —
обычная случайная вариабельность.
Цель не состояла в имитации какой-либо конкретной
коммерческой системы ИИ. Данные намеренно сделаны синтетическими, чтобы
поведение системы было известно и можно было наглядно показать саму концепцию
ОНФ.
Построение Области Нормального Функционирования ИИ
Для первого эксперимента я использовал скользящие
процентили, описывающие текущую рабочую область. Для окна последних наблюдений
центральная линия определяется как:
CL(t) = P₅₀(TTFT)
Нижняя и верхняя границы:
LCL(t) = P₀₅(TTFT)
UCL(t) = P₉₅(TTFT)
Таким образом, Область Нормального Функционирования задаётся
интервалом:
ANF(t) = [P₀₅(t), P₉₅(t)]
Ключевой момент состоит в том, что эти границы не являются
фиксированными. Они перемещаются по мере изменения поведения системы.
| Рисунок 1. Синтетический TTFT LLM-сервиса с динамической Областью Нормального Функционирования (P05–P95). |
На графике фактический ряд представляет TTFT; P50 показывает
центр нормального функционирования; P05 и P95 образуют нижнюю и верхнюю границы
ОНФ; закрашенная область между ними и есть текущая Область Нормального
Функционирования.
По смыслу это близко к IT-Control Charts, которые я много
лет использовал для анализа производительности компьютерных систем, но в данном
случае объектом наблюдения является сервис искусственного интеллекта.
Что происходит при изменении режима работы
В первой части эксперимента TTFT колеблется вокруг
относительно стабильного уровня. Затем, по мере роста нагрузки, начинают
увеличиваться и сам TTFT, и соответствующая ему ОНФ. В конце концов
синтетический сервис входит в режим перегрузки. TTFT заметно возрастает, но
после накопления достаточного числа наблюдений сама ОНФ адаптируется к новому
режиму.
Отдельное наблюдение, вышедшее выше текущей верхней границы,
можно представить как:
TTFTₜ > UCL(t)
Такое наблюдение может быть исключением. Однако устойчивое
перемещение всей ОНФ означает уже не единичное отклонение, а возможное
изменение состояния самой системы.
Исключение → Тренд
→ Точка изменения →
Новая ОНФ
От обнаружения к прогнозированию
Идея становится ещё интереснее, если добавить анализ тренда.
Предположим, что текущий тренд TTFT локально аппроксимируется линейной моделью:
TTFT̂(t) = a + bt
где b > 0 означает рост задержки ответа.
Если текущая верхняя граница ОНФ равна UCL, то ожидаемый
момент пересечения можно оценить как:
t(cross) = (UCL − a) / b
А оставшееся время до прогнозируемого выхода за границу ОНФ:
TimeToANF = t(cross) − t(now)
Тем самым вопрос меняется с ретроспективного «стала ли
производительность ИИ аномальной?» на более полезный проактивный вопрос:
«сколько времени осталось до того, как производительность ИИ, согласно текущему
тренду, выйдет из своей Области Нормального Функционирования?»
Это напрямую связывает концепцию ОНФ с проактивным
управлением производительностью и мощностью.
За пределами TTFT
TTFT — только первый пример. У сервиса ИИ существует
множество характеристик производительности. Концептуально многомерную ОНФ можно
представить как:
ANF(AI) = f(TTFT, TPOT,
Tokens/sec, QueueTime, TokenCount, Errors, ResourceUsage, …)
То есть в более общем случае система ИИ может иметь не
одномерный интервал, а многомерную Область Нормального Функционирования.
Ещё важнее то, что эти параметры взаимосвязаны. Значение
TTFT, необычное для короткого промпта, может быть совершенно нормальным для
значительно более крупного запроса или при высокой параллельной нагрузке.
Поэтому более строгая формулировка может быть условной:
ANF = P(Performance | Workload,
Model, Configuration)
Иными словами: что является нормальной производительностью
данной системы ИИ при данной нагрузке, данной модели и данной конфигурации? Это
существенно более интересный вопрос, чем простое сравнение каждого запроса с
одним фиксированным порогом.
Почему это мне интересно
Концепция ОНФ возникла в моей более ранней работе с
техническими системами. Сейчас я исследую, может ли та же фундаментальная идея
описывать нормальное функционирование, адаптацию и изменения в системах самых
разных типов.
ИИ создаёт здесь особенно интересный мост. С одной стороны,
это явно техническая вычислительная система, поэтому она естественно относится
к задачам классической инженерии производительности. С другой стороны,
современные системы ИИ всё чаще взаимодействуют с людьми и становятся частью
более крупных гибридных человеко-технических систем.
Пока этот эксперимент намеренно прост: одна характеристика
производительности ИИ, синтетические данные и одномерный анализ ОНФ.
Следующий логичный шаг — повторить эксперимент уже на
реальных измерениях LLM-сервиса. Если подход подтвердится, ОНФ сможет дать
единый язык не только для определения того, функционирует ли система ИИ
нормально, но и для описания того, как меняется её нормальное состояние — и
когда система приближается к выходу за его границы.
Примечание. В этом примере используются синтетические
данные как proof of concept. В будущей академической версии метод следует
проверить на реальной телеметрии LLM-сервиса и сравнить ОНФ (ANF)-подход с
фиксированными SLO и другими адаптивными базовыми моделями.
No comments:
Post a Comment