Рано или поздно вопрос возникает у всех: почему один диалог упирается в лимит через час, а другой живёт неделю, и почему счёт за API растёт не от количества страниц. Ответ один и тот же: Claude меряет всё не словами и не символами, а токенами. Разберёмся, что это такое, — заодно станет понятно, почему модель иногда спотыкается на, казалось бы, элементарных вещах вроде подсчёта букв в слове.
Что такое токен
Текст, который вы отправляете, не доходит до модели в виде букв. Он разбивается на куски — токены, — и каждый кусок заменяется числом из словаря, который модель выучила при обучении. Кусок это не буква и не слово: чаще всего это слово целиком, часть слова или знак препинания. «Токенизатор» может разложиться на «токен» и «изатор», а обычное «дом» останется одним токеном.
Почему не по буквам и не по словам? По буквам дорого: короткое предложение стоило бы два десятка токенов. По словам словарь пришлось бы раздувать до бесконечности, чтобы вместить все редкие слова, имена и опечатки. Куски-подслова — золотая середина.
Почему один текст дороже другого при той же длине
Отсюда вытекает практика. Обычная фраза на английском состоит из частых кусков, и токенов в ней немного. А вот длинная ссылка, идентификатор заказа, случайный набор символов или строка кода дробятся почти посимвольно: тот же объём знаков обойдётся в разы дороже. Русский текст в среднем тоже дробится мельче английского.
Это же объясняет фокус с буквами. Модель видит не «с-т-р-о-к-а», а один-два числовых куска, поэтому вопросы вида «сколько тут букв О» для неё неудобны по своей природе: буквы до неё просто не доходят.
Практический вывод для тех, кто следит за лимитами: выкидывайте из запроса то, что не несёт смысла. Простыни служебных логов и выгрузки «на всякий случай» оплачиваются и вдобавок разбавляют внимание модели. Приложите нужный фрагмент, а не весь файл.
Как из токенов получается смысл
Номер в словаре сам по себе ничего не значит: токены с соседними номерами не связаны по смыслу, это просто соседи по списку. Чтобы модель понимала, что «кот» и «котёнок» близки, каждому токену сопоставляется набор координат — эмбеддинг. Представьте, что вы оцениваете слова по двум шкалам: «милое — страшное» и «маленькое — большое». Котёнок и щенок окажутся рядом, тигр — далеко.
У настоящих моделей таких шкал не две, а тысячи, и они не подписаны: модель нащупала их при обучении сама. Но идея та же — близкие по смыслу вещи оказываются рядом. Вот и вся цепочка: текст → токены → эмбеддинги → ответ.
Совет
Проверять интуицию проще всего на самом Claude. Попросите: «Собери интерактивный артефакт про токенизацию: я ввожу текст, а он показывает разбиение на куски и их количество и сравнивает обычное предложение с длинной ссылкой той же длины». За пять минут выйдет нагляднее любой статьи — как это устроено, мы разбирали в материале про артефакты.
Где купить Claude
Из России подписка Anthropic картой не оплачивается. У нас в каталоге Claude Pro (2 090 ₽/мес), Max 5x (11 010 ₽/мес), Max 20x (22 010 ₽/мес) и пополнение API от $20: оплата картой РФ или СБП, поддержка на русском.
Обсуждение
0 комментариев