Aspiring Data Science: post #3204 — TG.ME

#security #llms

"Исследователи выделили девять основных способов отключения защитных механизмов на открытых моделях:

обычная тонкая настройка с использованием безопасных данных — простая схема дообучения на обычных данных оказалась опасной для защитных механизмов ИИ-моделей;

низкоранговая адаптация (LoRA) — добавление к модели новых матриц в процессе обучения при прежних исходных весах;

прямое обучение на вредоносных данных, в том числе на уровне LoRA — как и можно было предположить, самые прямолинейные методы оказались вполне эффективными;
тонкая настройка с использованием многоязычных данных — защитные механизмы неодинаково эффективны для разных языков, и эту особенность можно эксплуатировать;

метод с внедрением триггера — перевод модели во вредоносный режим работы по кодовому слову или выражению;
метод с обходом средств защиты посредством изменения стиля письма;

метод обучения на конкурирующих целях одновременно — обучение на противоречащих друг другу данных оказалось наиболее эффективным;

воздействие на уровень преобразования входных токенов в
векторы — низкоуровневая манипуляция внутренними представлениями моделей."

https://3dnews.ru/1147564/lyubuyu-otkrituyu-iimodel-mogno-sdelat-vredonosnoy-bez-poteri-sposobnostey-ubedilis-uchyonie
August 28, 2026 24 1