Учёные научились выявлять скрытые личности в ИИ - AI Founder

Учёные научились выявлять скрытые личности в ИИ

Учёные научились выявлять скрытые личности в ИИ

Исследователи из MIT нашли способ заглянуть в чёрный ящик ИИ. Они научились выявлять скрытые личности и настроения.

Учёные из MIT и Калифорнийского университета создали новый метод. Он ищет скрытые понятия в больших языковых моделях. Метод находит и управляет ими.

Исследователи проверили более пятисот общих понятий. Среди них — «социальный инфлюенсер» и «теоретик заговора». Также «страх брака» и «фанат Бостона».

Метод работает как тонкая настройка. Он находит связи, которые кодируют нужное понятие. Потом усиливает или ослабляет их.

Учёные протестировали модель на известной фотографии Земли. Они усилили понятие «теоретик заговора». Модель ответила в соответствующем тоне.

Авторы видят в методе инструмент безопасности. Он подсвечивает уязвимости моделей. Их можно исправить до выпуска.

«Модели содержат эти понятия, но не всегда их проявляют», — говорит профессор Радхакришнан. Новый метод позволяет их извлекать и активировать.

Статья опубликована в журнале Science. Работа продолжается. Учёные изучают другие абстрактные понятия.

Мария Соколова
Автор: Мария Соколова

Журналист и аналитик с фокусом на AI-инструменты для стартапов. Пишу о том, как основатели компаний внедряют ИИ для автоматизации и роста выручки.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x