Перейти к содержимому
Инвойсбокс
Инвойсбокс
Login iconВойти

Окно контекста и токены — почему ответ инструмента должен быть коротким

Окно контекста — ограниченная память разговора ассистента, которую наполняют описания инструментов и их ответы. Она измеряется в токенах, и платит за неё владелец диалога.

3 минИнвойсбокс
Окно контекста и токены — почему ответ инструмента должен быть коротким
Ассистент работает с ограниченной памятью разговора — её называют контекстным окном. В окно помещается всё: вопрос человека, ответы модели и каждый символ, который прислали внешние инструменты. Объём измеряют в токенах: токен — это несколько символов текста, и тарифы моделей считаются именно в токенах.

Кто платит за длинный ответ

MCP-сервер живёт внутри чужого окна и сам его наполняет: описания инструментов модель получает до первого вопроса, а ответы — после каждого действия. Платит за это владелец диалога, которого разработчик сервера никогда не увидит, и заплатит он независимо от того, пригодился ему текст или нет. Один неудачный ответ — например, подробная ошибка валидации по корзине из ста позиций — способен выесть окно целиком и обнулить разговор.

Сколько это в цифрах

  • Список инструментов сервера Инвойсбокс: около 1 136 токенов для набора чтения (4 инструмента), 3 177 для набора записи (7) и 3 970 для полного набора с возвратами (8).
  • Чтение 20 заказов: около 1 160 токенов в кратком виде и 2 899 в подробном.
  • Для сравнения: определения инструментов одного из популярных MCP-серверов оцениваются примерно в 17 600 токенов — до первого вопроса.
  • Два случая до и после ограничений: отказ по схеме на корзине из ста позиций — 26 572 символа стало 280; подробный поиск отгрузок 50 × 100 позиций — 862 036 символов стало 39 376.

Как это держат под контролем

Размер описаний и ответов закреплён тестом наравне с поведением: тест на бюджет падает от разросшегося описания так же, как от сломанной арифметики, и все числа в документации снимает он же. Метрика намеренно грубая — оценка в токенах равна числу символов, делённому на 3,3. Для русского текста реальное соотношение ближе к 2–2,5 символа на токен, то есть настоящий расход выше, и порог работает с запасом. Замеры и способы сократить расход собраны в справке по расходу контекста.

Интересные факты

  • Отказ — основной жанр разговора с ненадёжным вызывающим, поэтому его проектируют отдельно: он должен объяснить проблему, не соврать и не съесть окно контекста.
  • Тело ответа внешнего API сервер ограничивает 4 МБ и по заявленной, и по фактической длине.
  • В наборе MCP-Bench число вызовов и токены оказались важнее процента успеха: именно они показывают, что инструменты плохо скомпонованы.
  • Разбор расхода контекста как инженерного требования — в статье «Наименование компании как приказ».

Коротко

  • Окно контекста — ограниченная память разговора; измеряется в токенах и стоит денег владельцу диалога.
  • Сервер наполняет чужое окно описаниями и ответами — коротко значит дёшево.
  • Бюджет токенов закрепляют тестом, как и правильность суммы.
  • Один неудачный ответ способен обнулить весь разговор.

Полезно

AI-инвойсинг: счета через ассистента — подробнее →

#MCP#ИИ-агенты#интеграции