Что такое токены: как модели ИИ на самом деле «читают» ваш текст
17 сентября 2026 г.
Ценообразование, размер контекстного окна и даже некоторые странности в поведении любой большой языковой модели, связанные с правописанием или математикой, сводятся к одному понятию — токену. Токены — это не слова, не символы и даже не совсем слоги: это специфичная для конкретной модели схема сжатия, и понимание того, как она работает, объясняет удивительно много поведения ИИ, которое иначе выглядит произвольным.
Что такое токен на самом деле, если не слово?
Токен — это фрагмент текста: иногда целое распространённое слово, иногда часть слова, иногда отдельный символ, — определяемый токенизатором, обученным представлять наиболее частые фрагменты текста в своих обучающих данных максимально эффективно. Распространённые английские слова вроде «the» или «cat» обычно составляют один токен; менее распространённые или составные слова часто разбиваются на два-три (например, «tokenization» может стать «token» + «ization»). В качестве грубого ориентира для английского языка один токен обычно оценивается примерно в 4 символа, или около ¾ слова, но это зависит от модели и всегда остаётся лишь приближением.
Почему цены на API ИИ указывают за токен, а не за слово или за запрос?
Потому что именно токены, а не слова, буквально являются той единицей, которую модель обрабатывает внутри себя, — каждый поданный на вход и сгенерированный на выходе токен потребляет вычисления, поэтому это самая прямая и справедливая единица для тарификации. Оплата за токен также позволяет провайдерам устанавливать разную цену за входные и выходные токены (генерация обычно требует больше вычислений, чем чтение), поэтому в большинстве прайс-листов API ИИ указана отдельная ставка за входной токен и отдельная за выходной, а не единая цена за запрос.
Почему некоторые языки обходятся заметно дороже за предложение, чем английский?
Поскольку большинство основных токенизаторов обучены на наборах данных, где преобладает английский текст, английские слова непропорционально часто укладываются в один эффективный токен. Языки с другой письменностью или морфологией — многие языки Восточной Азии или языки с активным словосложением — часто токенизируются менее эффективно, иногда требуя два, три или больше токенов для того же объёма смысла, который в английском уместился бы в один токен. Практический эффект: одно и то же предложение в переводе может обходиться заметно дороже в токенах (а значит и в цене API) на одном языке, чем на другом, — исключительно как артефакт того, на чём обучался токенизатор, а не из-за реальной сложности содержания.
Что на самом деле ограничивает «контекстное окно» модели?
Контекстное окно — это максимальное количество токенов, которое модель может учитывать одновременно, включая ваш ввод (системный промпт, историю диалога, любые предоставленные документы) плюс сгенерированный ею ответ. Это не лимит на «сколько можно спросить» само по себе — это общий бюджет на всё, что модели приходится прочитать, и всё, что она производит в рамках одного обмена репликами. Длинная история диалога или крупный вставленный документ может израсходовать бо́льшую часть контекстного окна ещё до того, как модель сгенерирует хоть слово ответа, — именно поэтому в очень длинных разговорах модель иногда теряет из виду детали из начала беседы: они просто выпали за пределы токенового бюджета.
