Учёные из MIT и Калифорнийского университета создали новый метод. Он ищет скрытые понятия в больших языковых моделях. Метод находит и управляет ими.
Исследователи проверили более пятисот общих понятий. Среди них — «социальный инфлюенсер» и «теоретик заговора». Также «страх брака» и «фанат Бостона».
Метод работает как тонкая настройка. Он находит связи, которые кодируют нужное понятие. Потом усиливает или ослабляет их.
Учёные протестировали модель на известной фотографии Земли. Они усилили понятие «теоретик заговора». Модель ответила в соответствующем тоне.
Авторы видят в методе инструмент безопасности. Он подсвечивает уязвимости моделей. Их можно исправить до выпуска.
«Модели содержат эти понятия, но не всегда их проявляют», — говорит профессор Радхакришнан. Новый метод позволяет их извлекать и активировать.
Статья опубликована в журнале Science. Работа продолжается. Учёные изучают другие абстрактные понятия.