Исследователи предложили аудит ИИ-моделей, который выявляет опасные возможности, не генерируя незаконные изображения.
Обычная проверка требует дать модели вредоносный запрос и изучить результат. Для материалов сексуального насилия над детьми такой способ сам по себе создаёт незаконный контент. Новый метод вместо этого анализирует, как изменились внутренние параметры модели после дообучения.
Исследователи MIT, Healthy ML Lab и организации Thorn показывают, что по структуре изменений можно оценить, была ли модель намеренно адаптирована для опасных задач. Изображения при проверке не создаются.
Авторы рассчитывают, что подход поможет площадкам безопаснее проверять открытые модели до их распространения.
MIT научился проверять генераторы изображений на запрещённый контент без его создания
Источник: MIT News