DeepSeek выпустил экспериментальную модель V3.2-exp, сокращающую расходы на инференс вдвое
Самая важная особенность новой модели — механизм DeepSeek Sparse Attention (разреженное внимание). Вместо того чтобы обрабатывать все токены в контекстном окне, система использует «индексатор» для приоритетного выбора наиболее важных фрагментов контекста. Затем отдельный механизм отбирает специфические, ключевые токены внутри этих фрагментов для дальнейшей обработки.
Такой подход позволяет модели эффективно работать с очень длинными контекстами, сохраняя при этом сравнительно низкую нагрузку на серверы.
По предварительным результатам тестирования DeepSeek, преимущества от использования этой системы существенны: стоимость простого API-вызова в ситуациях с длинным контекстом может быть снижена до 50%.
DeepSeek, который ранее уже привлек внимание моделью R1, в очередной раз демонстрирует инновационный подход к решению проблемы высоких серверных затрат, оптимизируя фундаментальную архитектуру трансформеров.
А вы используете DeepSeek?

