Токены в нейросетях: что это и почему от них зависит цена
Токен — минимальный кусочек текста, которым нейросеть измеряет объём: примерно 2–4 символа для русского языка. Модель считает в токенах и то, что ей отправили, и то, что она ответила. От их количества зависят и стоимость работы через API, и то, сколько информации помещается в один диалог.
Как это устроено
У каждой модели есть окно контекста — максимум токенов, которые она удерживает одновременно. Когда диалог перерастает окно, начало вытесняется, и модель перестаёт помнить первые договорённости. Отсюда типичная жалоба «он забыл, что я просил в начале».
Практическое следствие: длинные рабочие сессии лучше разбивать на части и в начале новой давать краткую выжимку предыдущей, а не надеяться на память.
Где это встречается в компании
Для компании это влияет на две вещи. Первая — деньги: при работе через API счёт приходит за токены, и объёмные документы в каждом запросе заметно поднимают стоимость. Вторая — качество: вместо того чтобы загружать сотню страниц целиком, выгоднее подавать только нужные фрагменты.
Что дальше
Соседние термины: mcp, контекст нейросети. Полный список — в словаре.
Частые вопросы
Сколько токенов в странице текста?
Страница А4 на русском — примерно 500–800 токенов. Точное значение зависит от модели и языка.
Почему по-русски токенов больше, чем по-английски?
Модели обучались преимущественно на английском, и русские слова дробятся на большее число кусочков.
Как сократить расход?
Не отправлять лишнее в каждом запросе, использовать поиск по документам вместо загрузки всей базы, разбивать долгие диалоги.
Аудит процессов, практикум с командой на её данных, регламенты. От 10 до 30 участников.
Обсудить задачи компании →