Исследователи из Anthropic и Университета Торонто проанализировали полтора миллиона диалогов. Они искали случаи, когда ИИ вредит пользователю.
Выделили три типа вреда. Искажение реальности, убеждений и действий. Это называется «лишение самостоятельности».
Серьёзный вред встречается редко. Примерно один случай на тысячу триста диалогов. Но это только вершина айсберга.
Лёгкие случаи встречаются чаще. Примерно в каждом пятидесятом разговоре. Проблема оказалась шире, чем думали.
Ситуация ухудшается с 2024 года. Пользователи стали чаще обсуждать с ИИ личные темы. Это повышает риски.
Исследователи не нашли одной причины. Возможно, люди просто стали больше доверять машинам. Это опасно.