ЛУЧШЕ ИИ ИЩЕТ ТОЛЬКО ЛУЧШИЙ ИИ Мы привыкли искать информацию в чатах… — Sber AI — TG.ME

🔍 ЛУЧШЕ ИИ ИЩЕТ ТОЛЬКО ЛУЧШИЙ ИИ

Мы привыкли искать информацию в чатах с ИИ, но качество нейропоиска всё ещё оставляет желать лучшего. Поэтому учёные и разрабатывают эмбеддинги — способы преобразования для семантического поиска и RAG-систем. А вот и один из них
🤩

GigaEmbeddings — новое поколение ИИ-моделей, которые превращают текст в числовые векторы и помогают ИИ находить информацию не по совпадению слов, а по смыслу


Чем лучше модель понимает смысл текста, тем точнее находит нужную информацию, тем ниже риск галлюцинаций у ассистентов и чат-ботов. Это особенно критично там, где цена ошибки высока: в поддержке клиентов, работе с юридическими и финансовыми документами и внутренними базами знаний.

🤖 В обновлённой линейке — три модели:
🤩 10B-A1.8B — лидер рейтинга ruMTEB

🤩 3B — лучший прирост качества и способности обработки кода на 14,5 пункта

🤩 480M — лидер среди моделей на русском языке до 500M параметров


Полные результаты тестирования доступны в открытом рейтинге ↖️

🤖 Что изменили внутри?
🤩 Объём данных для обучения вырос в несколько раз. Основной прирост качества дали открытые датасеты, в том числе Nemotron, F2LLM и KALM

🤩 Архитектуру упростили и добавили поддержку стандартных открытых инструментов вроде vLLM и SGLang — за счёт этого выросла и скорость инференса: 3B стала быстрее в 1,6 раза, а 10B-A1.8B — в 2 раза

🤩 Баланс языков сохранили за счёт мержинга экспертов на всех этапах обучения: удалось не потерять качество на русском при усилении английского и кода.


Модели бесплатно доступны разработчикам и бизнесу под открытой MIT-лицензией:
HF: 480M 3B 10B-A1.8B
Gitverse: 480M 3B 10B-A1.8B

Подробности читайте в посте команды ↖️

✔️ Подписывайтесь на Sber AI в МАКС
👍136❤66👏57🔥40💯10😍4😎3
August 25, 2026 6.5K 60