И проблема часто вообще не в сложности задачи. Ты просто неправильно работаешь с кэшем. Когда Claude читает уже сохранённый контекст, это может обходиться до 20 раз дешевле, чем перечитывать тот же диалог заново.
Но сменил модель, effort, сделал compact не вовремя или вернулся к разговору после истечения TTL - и сотни тысяч токенов снова летят во вход.
У меня в одном рабочем диалоге было 586 000 токенов и 59% контекста. На таких объёмах одна ошибка - это уже не мелкая погрешность, а заметный кусок недельного лимита.
И большинство вообще не видит, где именно горят лимиты.
В новом видео разобрал на человеческом языке:
– как устроена математика prompt caching;
– чем отличается 5-минутный кэш от часового;
– какие действия заставляют Claude перечитывать весь контекст;
– как посмотреть собственные источники расхода;
– и кому эта экономия реально нужна на тарифах X1, X5 и X20.
15 минут, после которых Claude Code может работать заметно дольше на тех же лимитах.
Смотреть: youtube.com/watch?v=kFmVBWVbed8

