Корзина Войти
Каталог

Токены и эмбеддинги: почему один текст обходится дороже другого — в Claude

Обучение Claude Как работает ИИ Что происходит внутри модели 3 из 5

Рано или поздно вопрос возникает у всех: почему один диалог упирается в лимит через час, а другой живёт неделю, и почему счёт за API растёт не от количества страниц. Ответ один и тот же: Claude меряет всё не словами и не символами, а токенами. Разберёмся, что это такое, — заодно станет понятно, почему модель иногда спотыкается на, казалось бы, элементарных вещах вроде подсчёта букв в слове.

Что такое токен

Текст, который вы отправляете, не доходит до модели в виде букв. Он разбивается на куски — токены, — и каждый кусок заменяется числом из словаря, который модель выучила при обучении. Кусок это не буква и не слово: чаще всего это слово целиком, часть слова или знак препинания. «Токенизатор» может разложиться на «токен» и «изатор», а обычное «дом» останется одним токеном.

Почему не по буквам и не по словам? По буквам дорого: короткое предложение стоило бы два десятка токенов. По словам словарь пришлось бы раздувать до бесконечности, чтобы вместить все редкие слова, имена и опечатки. Куски-подслова — золотая середина.

Почему один текст дороже другого при той же длине

Отсюда вытекает практика. Обычная фраза на английском состоит из частых кусков, и токенов в ней немного. А вот длинная ссылка, идентификатор заказа, случайный набор символов или строка кода дробятся почти посимвольно: тот же объём знаков обойдётся в разы дороже. Русский текст в среднем тоже дробится мельче английского.

Это же объясняет фокус с буквами. Модель видит не «с-т-р-о-к-а», а один-два числовых куска, поэтому вопросы вида «сколько тут букв О» для неё неудобны по своей природе: буквы до неё просто не доходят.

Практический вывод для тех, кто следит за лимитами: выкидывайте из запроса то, что не несёт смысла. Простыни служебных логов и выгрузки «на всякий случай» оплачиваются и вдобавок разбавляют внимание модели. Приложите нужный фрагмент, а не весь файл.

Как из токенов получается смысл

Номер в словаре сам по себе ничего не значит: токены с соседними номерами не связаны по смыслу, это просто соседи по списку. Чтобы модель понимала, что «кот» и «котёнок» близки, каждому токену сопоставляется набор координат — эмбеддинг. Представьте, что вы оцениваете слова по двум шкалам: «милое — страшное» и «маленькое — большое». Котёнок и щенок окажутся рядом, тигр — далеко.

У настоящих моделей таких шкал не две, а тысячи, и они не подписаны: модель нащупала их при обучении сама. Но идея та же — близкие по смыслу вещи оказываются рядом. Вот и вся цепочка: текст → токены → эмбеддинги → ответ.

Совет

Проверять интуицию проще всего на самом Claude. Попросите: «Собери интерактивный артефакт про токенизацию: я ввожу текст, а он показывает разбиение на куски и их количество и сравнивает обычное предложение с длинной ссылкой той же длины». За пять минут выйдет нагляднее любой статьи — как это устроено, мы разбирали в материале про артефакты.

Где купить Claude

Из России подписка Anthropic картой не оплачивается. У нас в каталоге Claude Pro (2 090 ₽/мес), Max 5x (11 010 ₽/мес), Max 20x (22 010 ₽/мес) и пополнение API от $20: оплата картой РФ или СБП, поддержка на русском.

Перейти в каталог

Обсуждение

0 комментариев
Чтобы оставить комментарий, войдите в аккаунт
Так мы понимаем, кто спрашивает, и отвечаем по вашим заказам.
Войти
Пока никто не написал — будьте первым.