В тарифе или документации написано «миллион токенов контекста» и «цена за миллион входных токенов». Возникает естественный вопрос: сколько это страниц, сообщений или слов?

Точного универсального пересчёта нет. Разные семейства используют разные токенизаторы, а русский, английский, код, числа и эмодзи делятся по-разному. Поэтому токен — не слово и не символ, а элемент словаря конкретной модели.

Как текст превращается в токены

Токенизатор ищет знакомые части текста. Частое слово может стать одним токеном, редкое — несколькими. Пробел или знак препинания иногда входит в соседний токен, иногда выделяется отдельно.

Условный пример:

Токенизация нейросеть → нейро + сеть

Это иллюстрация, а не результат конкретного токенизатора. Другая модель может разделить то же слово иначе. Код, длинные идентификаторы, URL, случайные строки и смешение языков часто расходуют больше токенов, чем гладкий обычный текст той же визуальной длины.

Что именно считается

В запрос входит гораздо больше последней фразы пользователя.

  • системные инструкции;
  • история переписки;
  • ваш новый текст;
  • содержимое файлов и изображений в представлении модели;
  • описания доступных инструментов;
  • результаты поиска и вызовов функций;
  • ответ модели;
  • иногда отдельные токены рассуждения;
  • служебные элементы формата сообщений.

Поэтому короткое «продолжай» в длинном чате может быть дорогим: приложение снова передаёт модели значительную часть истории.

Категория Что входит Как контролировать
Input Инструкции, сообщения, файлы, инструменты Сокращать шум и дубли
Output Финальный ответ Задать нужную длину и формат
Reasoning Внутреннее вычислительное рассуждение, если режим его использует Выбирать effort по сложности задачи
Cached Повторно используемый префикс запроса Стабилизировать общие инструкции
Tool use Схемы инструментов и результаты вызовов Передавать только нужные инструменты и данные
Точные категории, подсчёт и тарификация зависят от API и модели.

Токены и контекстное окно

Контекстное окно ограничивает общий объём, с которым модель работает в текущем ходе. В него входят входные данные и место для генерации. Если почти весь лимит занял документ, длинному ответу может не хватить пространства.

Большое окно позволяет передать больше, но не делает каждый фрагмент одинаково заметным. Лишние страницы создают шум и могут ухудшить поиск детали. Поэтому задача — не заполнить контекст до максимума, а поместить в него наиболее полезную информацию.

Подробнее управление длинными чатами разобрано в статье «Контекстное окно: почему ИИ забывает».

Как токены превращаются в стоимость

В API обычно отдельно тарифицируются вход и выход. Выход часто дороже, потому что генерируется последовательно. Thinking/reasoning и инструменты могут учитываться по особым правилам.

Упрощённая формула:

Стоимость input × ставка входа + output × ставка выхода + инструменты

В пользовательском приложении вы можете не видеть цену каждого токена: сервис продаёт подписку, пакет запросов или собственные единицы. Но механика всё равно влияет на ограничения и выбор модели.

Почему нельзя считать по страницам

Страница договора с мелким шрифтом и страница презентации с одним заголовком отличаются в десятки раз. PDF может содержать:

  • извлекаемый текст;
  • изображения страниц;
  • таблицы;
  • повторяющиеся колонтитулы;
  • скрытый OCR-слой;
  • комментарии и метаданные.

Разные сервисы обрабатывают их по-разному. Надёжный способ узнать размер — использовать встроенный token counter конкретной модели или посмотреть поле usage после запроса.

Официальная документация Google приводит грубый ориентир для английского текста — около четырёх символов на токен, но переносить эту цифру на русский, код и другие модели нельзя.

Пять способов расходовать меньше

1. Удаляйте повторения, а не смысл

Сократите дубли писем, старые версии и длинные логи. Оставьте определения, исключения, цифры и данные, необходимые для проверки.

2. Начинайте новый чат с резюме

Если история разрослась, составьте актуальный бриф: цель, решения, ограничения, открытые вопросы и ссылки на финальные материалы. Проверьте резюме и перенесите его в новый разговор.

3. Не просите длинный ответ «на всякий случай»

Укажите формат: пять пунктов, таблица из четырёх колонок, письмо до 150 слов. Ограничение должно соответствовать задаче, а не просто быть минимальным.

4. Используйте поиск по документам

Для большой библиотеки RAG может подставлять только релевантные фрагменты вместо всей папки. Это снижает шум и объём, но требует качественного поиска и ссылок на источники.

5. Маршрутизируйте задачи

Сильная reasoning-модель нужна не для каждой классификации. Простые операции отдавайте быстрой версии, сложные — более сильной. Экономия достигается выбором режима, а не только сокращением текста.

Когда экономить опасно

Сжатие ухудшает результат, если вы удалили:

  • исключения из правила;
  • отрицательные примеры;
  • точные определения полей;
  • единицы измерения;
  • требования к безопасности;
  • источник, подтверждающий факт;
  • редкий случай, ради которого выполняется анализ.

Не просите модель сама «сократить контекст», а затем без проверки принимать решение по её резюме. Ошибка суммаризации станет невидимой для следующих ходов.

Как оценить запрос до отправки

Чек-лист контекста
Перед длинным запросом проверь:

1. Есть ли дубли и отменённые версии?
2. Можно ли заменить историю проверенным резюме?
3. Нужен весь файл или несколько разделов?
4. Достаточно ли места для требуемого ответа?
5. Нужен ли дорогой reasoning-режим?
6. Можно ли найти фрагменты через поиск?
7. Сохранились ли источники и исключения?

Если вы работаете через API, используйте token-count endpoint выбранной модели. Один и тот же текст может иметь разный размер после смены семейства или поколения токенизатора.

Главное

Токены — техническая единица, связывающая текст, контекст и стоимость. Считать каждый знак вручную не нужно. Важно понимать три вещи:

  1. В запрос входит история и служебный контекст, а не только последнее сообщение.
  2. Больше контекста не всегда означает лучше.
  3. Точный размер нужно измерять токенизатором конкретной модели.

Оптимизируйте не самую короткую формулировку, а минимальный достаточный контекст — тот, в котором есть всё для правильного и проверяемого ответа, но нет устаревшего шума.

Поделиться материалом
Telegram