Привет, а какую бы ты модель использовал для локального… — Intelligent Systems Architecture — TG.ME

«Привет, а какую бы ты модель использовал для локального развёртывания, которая тулзы вызывает и хорошо понимает, что вызывать?»

Короткий ответ: никакую. И вряд ли такие появятся.

Обычно спрашивают про потолок локального железа — самое мощное, что можно развернуть на топовом десктопе: модели на 70–120B в квантовании. С инструментами они справляются нормально. Но вызывать инструменты и определять порядок их вызова, то есть работать автономно, — это разные вещи. Автономия начинается там, где надо удержать длинную цепочку рассуждений: разбить задачу, вести план на десятки шагов вперёд и переигрывать его, когда сам же ошибся несколько шагов назад.

А упирается всё в генеративную гибкость — умение собрать план под задачу, которой не было в обучении, и нащупать обходной путь, когда инструмент вернул не то. Это та сторона моделей, которую принято называть эмерджентностью — ближайший родственник креативности. И растёт она вместе с масштабом обучения — плавно, но связь прямая.

Вот здесь локальный потолок и уступает фронтиру (GPT, Claude, Gemini — сотни миллиардов, а то и триллионы параметров). Дело в том, что нужный масштаб в десктоп пока не уложить. На длинной дистанции это неизбежно проявляется как симптомы: контекст плывёт, ошибки наслаиваются одна на другую, и модель всё больше галлюцинирует.

Поэтому мой подход к таким системам — гибридные архитектуры с контролем переходов состояний, о которых писал выше.
June 11, 2026 848 7