Китайский ИИ атакует DeepSeek выпустил экспериментальную модель… — Битва Машин | Восстание переводчиков — TG.ME

🐳Китайский ИИ атакует

DeepSeek выпустил экспериментальную модель V3.2-exp, сокращающую расходы на инференс вдвое

♾Китайская исследовательская компания DeepSeek объявила о выпуске новой экспериментальной модели V3.2-exp, разработанной для радикального снижения операционных расходов при работе с моделями в условиях длинного контекста. Анонс модели сопровождается публикацией на Hugging Face и академической статьей на GitHub.

✨Ключевая технология: Sparse Attention

Самая важная особенность новой модели — механизм DeepSeek Sparse Attention (разреженное внимание). Вместо того чтобы обрабатывать все токены в контекстном окне, система использует «индексатор» для приоритетного выбора наиболее важных фрагментов контекста. Затем отдельный механизм отбирает специфические, ключевые токены внутри этих фрагментов для дальнейшей обработки.

Такой подход позволяет модели эффективно работать с очень длинными контекстами, сохраняя при этом сравнительно низкую нагрузку на серверы.

💸Значительная экономия

По предварительным результатам тестирования DeepSeek, преимущества от использования этой системы существенны: стоимость простого API-вызова в ситуациях с длинным контекстом может быть снижена до 50%.

ℹ️Модель V3.2-exp является open-weight и находится в свободном доступе на Hugging Face. Это позволит сторонним разработчикам и исследователям быстро оценить заявленные преимущества и провести более детальное тестирование.

DeepSeek, который ранее уже привлек внимание моделью R1, в очередной раз демонстрирует инновационный подход к решению проблемы высоких серверных затрат, оптимизируя фундаментальную архитектуру трансформеров.

А вы используете DeepSeek?
💬Расскажите о вашем опыте работы с этим ИИ в комментариях!
👍5
October 1, 2025 1.1K 1 13