Программа:
- Разберем существующие подходы к совместному использованию GPU в Kubernetes — Time-Slicing, MIG, MPS и HAMi, их преимущества, ограничения и сценарии применения;
- Покажем, как повысить эффективность использования GPU для AI-нагрузок, избежать простоя дорогостоящих ускорителей и сократить затраты на развитие инфраструктуры;
- Рассмотрим на практических примерах использование MIG и GPU Sharing для запуска нескольких AI-сервисов на одном ускорителе, а также разберем, когда лучше использовать большие универсальные модели, а когда — специализированные;
- Продемонстрируем, как платформа контейнеризации «Боцман» помогает централизованно управлять GPU-ресурсами в Kubernetes, распределять их между командами и AI-сервисами и эффективно эксплуатировать AI-инфраструктуру.
За 3 лучших вопроса дарим мерч!
