# Токены, контекст и цены в 2026: почему ИИ столько стоит и за что ты платишь

> Токены, контекст и цены ИИ по-человечески: что считают, почему ответ дороже запроса, как контекст жжёт деньги и чем подписка отличается от API.

Источник: https://aifirstclub.ru/guides/tokeny-i-ceny · AI First Club · 2026-06-12

Подписка кончилась за три дня, хотя ты вроде ничего особенного не делал. Или прилетел счёт за API на пару тысяч, и ты сидишь, смотришь на цифры и не понимаешь, за что вообще заплатил. ИИ берёт деньги не за «магию» — а за вполне понятную работу. Сейчас разберёмся, за какую именно, чтобы ты перестал переплачивать по незнанию.

Сразу разведём два вопроса, чтобы не путаться. Как именно платить из России (карты, способы, обходы) — это [регистрация и оплата](/guides/registraciya-i-oplata-ii). А тут — про то, **за что** с тебя берут деньги: что считают, почему так дорого и от чего зависит цена. Механика, а не прайс.

## Что такое токен

ИИ считает не словами и не символами, а **токенами**. Токен — это кусочек текста: иногда целое короткое слово, иногда часть длинного, иногда просто пробел со знаком препинания.

Грубый ориентир: один токен — это примерно ¾ английского слова. С русским хуже — наш язык модель режет мельче, и одно слово обычно превращается в 2–3 токена. «Привет» — это уже пара токенов, а не один.

Зачем тебе это знать? Затем, что **вся оплата считается в токенах**. Не в сообщениях, не в запросах, не в «штуках» — в токенах. Сколько текста прошло через модель туда и обратно, столько и заплатил. Поэтому короткий точный запрос дешевле, чем простыня на три экрана, даже если по смыслу ты спросил одно и то же.

## Входящий и выходящий токен

Вот первое, что ломает интуицию. Токены бывают двух сортов, и стоят они по-разному.

- **Входящие (input)** — всё, что ты отправляешь модели. Твой промпт, история переписки, прочитанные файлы, инструкции. Это она «читает». Дёшево.
- **Выходящие (output)** — то, что модель пишет в ответ. Каждое слово, которое она сгенерировала. Дорого, обычно раз в пять дороже входа.

Почему такая разница? Дело в том, как модель работает. Входящий текст она **проглатывает за один проход** — прочитала всё разом и поняла. А ответ пишет **по одному токену за раз**: сгенерировала слово, прогнала через всю свою махину заново, сгенерировала следующее, снова прогон. И так до конца ответа. Каждое выданное слово — это отдельная тяжёлая работа, поэтому выход и дороже.

Цифры это подтверждают ровно. Возьмём флагман Claude Opus:

- **Вход** — около $5 за миллион токенов.
- **Выход** — около $25 за миллион токенов.

Ровно впятеро. Вывод простой: длинные подробные ответы стоят заметно дороже, чем длинные подробные вопросы. Если попросил «напиши мне роман на 50 страниц» — вот за эти 50 страниц и заплатишь по дорогому тарифу.

> Миллион токенов звучит как «да я столько никогда не наберу». На деле один плотный рабочий день с агентом, который читает файлы и пишет код, легко съедает сотни тысяч токенов. Большие объёмы тут — норма, а не край.

## Почему контекст — это деньги

А теперь главное, без чего счёт кажется необъяснимым. Модель **ничего не помнит между запросами**. Совсем. Каждое новое сообщение для неё — чистый лист.

Откуда же тогда она «помнит», о чём вы говорили десять реплик назад? А вот откуда: на каждое твоё сообщение программа отправляет ей **всю переписку заново** — целиком, с самого начала, плюс все прочитанные файлы. И всё это идёт как входящие токены. Каждый. Раз.

Отсюда три следствия, которые бьют по кошельку:

- **Длинный разговор дорожает с каждым шагом.** В начале чата ты платишь за пару фраз. К пятидесятому сообщению на вход уходит вся история — и каждая новая реплика тащит за собой весь предыдущий объём.
- **Большие файлы — это много input-токенов.** Скормил агенту весь проект целиком, чтобы он поправил одну строчку? Заплатил за чтение всего проекта.
- **Чистка контекста — это и про деньги.** Команды вроде `/clear` (начать с чистого листа) и `/compact` (сжать историю) экономят не только «память» агента, но и твой счёт.

Есть ещё хитрость под названием **кеширование**: если один и тот же кусок контекста повторяется из запроса в запрос, модель умеет читать его примерно в десять раз дешевле, чем в первый раз. Глубоко лезть сюда не будем — просто знай, что такой механизм есть и он работает на тебя сам.

## Сколько стоят разные модели

Цена зависит не только от объёма, но и от того, какую модель ты гоняешь. Внутри Claude их несколько (если не помнишь, чем они отличаются — это в [Claude с нуля](/guides/claude-s-nulya)). Вот цена за миллион токенов, вход / выход:

- **Haiku** — примерно $1 / $5. Быстрая и дешёвая, для простого: короткие ответы, рутина, сортировка, что-нибудь по-быстрому.
- **Sonnet** — примерно $3 / $15. Золотая середина, рабочая лошадка. Большинство задач — про неё.
- **Opus** — примерно $5 / $25. Флагман для тяжёлого: сложный код, длинные рассуждения, агенты, которые сами рулят проектом.

И это только Claude. У других провайдеров разброс ещё шире. Есть заметно более дешёвые модели — DeepSeek или лёгкие версии Gemini идут буквально по центам за миллион. Есть и более дорогие флагманы — GPT‑5.5, топовые Gemini. От самой дешёвой ходовой модели до самого дорогого флагмана разница в цене — где-то в сто раз.

Из этого растёт самый денежный вывод гайда. **Для рутины не нужен флагман.** Перевести пару абзацев, разобрать список, ответить на простой вопрос — с этим справится дешёвая модель, и заплатишь ты в разы меньше. Гонять Opus на всё подряд — это как ездить за хлебом на грузовике.

> Все цифры тут — на 2026 год, и они меняются часто. Провайдеры режут цены, выкатывают новые модели, перетасовывают тарифы чуть ли не каждый месяц. Перед тем как считать свой бюджет, загляни на сайт провайдера и сверь актуальное. Эти числа — чтобы ты понимал порядок и пропорции, а не чтобы заучивать их наизусть.

## Подписка или API — в чём разница

Платить за один и тот же ИИ можно двумя способами, и это не одно и то же.

- **Подписка** — фиксированная сумма в месяц. Платишь, скажем, $20 и пользуешься чатом в браузере или Claude Code сколько угодно, но в пределах лимитов. У Claude это Pro за $20, есть и Max — дороже и с лимитами пощедрее. Токены ты при этом не считаешь, всё уже внутри.
- **API** — платишь поштучно, за реальные токены, по тем самым ценам из списка выше. Это нужно, когда ты подключаешь ИИ к своему приложению, боту или автоматизации — туда, где работает программа, а не ты руками в окошке.

Связь простая. Твой [Claude Code](/guides/claude-code-s-nulya) живёт по подписке — поэтому ты там не думаешь про каждый токен. А вот когда соберёшь, например, своего бота для клуба, который сам отвечает людям, — там уже будет API, и каждое его сообщение начнёт капать в счёт по токенам.

## Почему подписки стоят по-разному

Глянул на тарифы и видишь: где-то бесплатно, где-то $20, а где-то $200. За что доплата? Цену тянут вверх несколько факторов, и каждый прибавляет к ценнику:

- **Какая модель доступна.** На бесплатном тарифе обычно слабая модель, на топовом — флагман. Это главное отличие.
- **Размер лимитов.** Сколько запросов в час и в день тебе дают, прежде чем скажут «приходи позже».
- **Размер контекста.** Сколько модель готова держать в голове за раз — короткий разговор или целая книга.
- **Спецфичи.** Глубокий поиск по интернету, генерация видео и картинок, голос, агенты — за продвинутое доплачиваешь.
- **Приоритет и приватность.** Очередь поменьше в часы пик, гарантия, что на твоих данных не учат модель.

Если перевести в порядок цен на рынке:

- **Бесплатно** — слабая модель и жёсткие лимиты. Попробовать и понять, надо ли оно тебе.
- **Около $20 в месяц** — стандарт. Флагман плюс нормальные лимиты. У большинства провайдеров этот тариф примерно одинаковый, тут особо не прогадаешь.
- **$100–200 в месяц** — кратно больше лимиты и самые мощные фичи. Это для тех, кто живёт в ИИ целыми днями.

## Как не переплачивать

Раз ты теперь понимаешь механику, переплачивать по глупости уже не будешь. Коротко, без фанатизма:

- **Бери модель под задачу.** Простое — на дешёвой модели, флагман доставай только под реально сложное.
- **Чисти контекст между задачами.** Не тащи за собой час неактуальной переписки — это деньги на ровном месте.
- **Не таскай в чат лишние файлы.** Покажи нужное место, а не весь проект.

Это самый верх айсберга. Полный набор приёмов — что и когда чистить, как не читать файлы целиком, как раскидывать тяжёлое по субагентам — разобран отдельно, в гайде [как экономить токены](/guides/kak-ekonomit-tokeny). Тут я не пересказываю, чтобы не дублировать: эта глава про то, **почему** дорого, а та — про то, **как** платить меньше.

Чтобы стало совсем наглядно, посмотри один и тот же запрос в дорогом и дешёвом исполнении. Сначала как делает новичок — затаскивает весь проект в чат:

Вот мой проект целиком, 40 файлов. Поправь, пожалуйста, заголовок на главной странице.
Готово, поправил. (А под капотом модель прочитала все 40 файлов как входящие токены — ты заплатил за чтение всего проекта ради одной строки.)

А теперь то же самое, но ты показал ровно один нужный файл через `@`:

@index.html — поправь заголовок на главной странице.
Готово. (Модель прочитала один файл вместо сорока — расход меньше в разы, результат тот же.)

Один и тот же итог, разница в расходе — кратная. Вся экономия растёт из этого простого понимания: платишь за то, что прошло через модель, значит не гоняй через неё лишнее.

## Чек-лист: ты понимаешь, за что платишь

- Знаешь, что такое токен и что оплата считается именно в них.
- Понимаешь, что выходящий токен дороже входящего, и почему.
- Видишь связь: контекст и файлы = входящие токены = деньги на каждом шаге.
- Выбираешь модель под задачу, а не флагман на всё подряд.
- Различаешь подписку (фикс в месяц) и API (поштучно за токены).

> Токены, лимиты и расход под контролем — отдельный урок «Токены и цены: за что ты платишь» в курсе [«Claude Code: с нуля до Pro»](/courses/claude-code-s-nulya-do-pro). Там эта механика отрабатывается прямо на твоих сессиях.

Ты платишь не за «магию», а за понятную работу: сколько текста прошло через модель, столько и стоило. Кто понимает эту механику — тот не переплачивает.

---

Механику разобрал — дальше дело за привычками. Иди в [как экономить токены](/guides/kak-ekonomit-tokeny) за конкретными приёмами, загляни в [регистрацию и оплату](/guides/registraciya-i-oplata-ii), если вопрос ещё в том, как платить из России, а про сами модели и когда что брать — [Claude с нуля](/guides/claude-s-nulya) и [Claude Code с нуля](/guides/claude-code-s-nulya). Почему длинный чат портит ответы даже при живых лимитах — разбор про [контекстное окно](/guides/kontekstnoe-okno).

## Частые вопросы

### Что такое токен?
Это кусочек текста, которым считает модель: иногда целое короткое слово, иногда часть длинного. Ориентир — один токен это примерно ¾ английского слова, а русское слово обычно режется на 2–3 токена. Вся оплата идёт именно в токенах: сколько текста прошло через модель туда и обратно, столько и заплатил.

### Почему ответ модели дороже моего запроса?
Входящий текст модель проглатывает за один проход, а ответ пишет по одному токену за раз, прогоняя каждый через всю свою махину заново. Поэтому выход стоит примерно впятеро дороже входа: у Claude Opus это около $5 против $25 за миллион токенов.

### Почему длинный чат съедает подписку быстрее?
Модель ничего не помнит между запросами: на каждое новое сообщение вся переписка и прочитанные файлы отправляются ей заново как входящие токены. К пятидесятому сообщению каждая реплика тащит за собой весь предыдущий объём. Поэтому чисти контекст командами `/clear` и `/compact` и не таскай в чат лишние файлы.

### Чем подписка отличается от API?
Подписка — фиксированная сумма в месяц: платишь, скажем, $20 за Claude Pro и пользуешься в пределах лимитов, токены не считаешь. API — оплата поштучно за реальные токены; он нужен, когда подключаешь ИИ к своему приложению, боту или автоматизации, а не работаешь руками в окошке.