Я, кажется, только сейчас до конца осознал, что произошло с локальными моделями за последние пару недель.
В феврале 2026 Anthropic выпускает Claude Opus 4.6. На тот момент это натуральный frontier: одна из лучших моделей в мире, закрытая, облачная, дорогая. Хочешь юзать - покупай подписку 200$ (для работы с агентами меньше не имело смысла) или плати за каждый токен.
Opus 4.6:
Входные токены (Input): $5.00 за 1M токенов.
Выходные токены (Output): $25.00 за 1M токенов.
Проходит полгода. Китайцы выпускают QWEN 3.8.
Qwen 3.8-27B уже можно нормально крутить дома. Цены на видеокарты, конечно, взлетают на 30%.
У меня на одной 5090 она работает примерно 135 tk/s сегодня с окном контекста 256k.
Люди делятся, что запускают её даже на 16 GB VRAM, с вполне рабочей скоростью.
Сначала вокруг неё было много споров в духе «какой ещё Opus level, не смешите». Потом люди начали менять harness, кванты, inference backend, оказалось, что сама модель умеет заметно больше на домашнем железе.
Сегодня вышла Qwen 3.8 Flash-Next.
На картинке результаты Qwen. Сравнение, понятно, их собственное, поэтому воспринимаем соответственно. Тем не менее начинают приходится подтверждение из Home Lab's таких же как наши.
И в coding/agentic задачах она уже болтается примерно в том же классе, где находится Opus 4.6. Где-то выигрывает, где-то проигрывает, но не сильно.
Q4 помещают в машины со 128 GB памяти, получают 20–30+ tk/s и уже оставляют модель самостоятельно работать несколько часов через agent harness. Один из свежих тестов — почти три часа работы, 200+ tool calls, подняла PostgreSQL, написала приложение, гоняла Playwright и сама чинила тесты. И тут выходит, как бы по совпадению, M5 Ultra 256gb за 10 000$, ну как не купить?! Особенно если живешь в США. Что теперь двигатель продаж домашнему железа?!















