С проблемами в данных, наверно, сталкивался каждый ДС в промышленности, да я об этом буквально постоянно пишу и говорю. Но самая большая проблема — отсутствие данных, потому что тогда мы (ДСы) не нужны
По моему опыту во временных рядах и табличных данных, генерация синтетики не особо хорошо работает. То есть может повысить качество решения задачи, но очень ограниченно. При отсутствии в данных поломок, нагенирировать физически корректные поломки довольно сложно. Аугментация может работать, хотя мб и не так хорошо, как в CV.
Кстати, в докладе еще есть и много информации по инструментам, решающим все типовые задачи в CV, коротко:
• Классификация — CLIP
• Детекция — Grounding DINO, YOLO-world
• Семантическая сегментация — SAM, SAM2, FastSAM, CLIPSeg
• Инстанс-сегментация — Grounded SAM, LangSAM
Но мне понравились рекомендации и подсказки, как стоит собирать пайплайны, например, для инстанс сегментации: Zero-shot детектор
Напоследок дополню еще одним докладом. Похожим, но с описанием немного других подходов и инструментов.



