Как качество промпта может влиять на результат работы ИИ

ТехИнсайдерHi-Tech

Больше не врет: ученые Губкинского университета нашли способ избавить нейросеть от «галлюцинаций»

Ученые РГУ нефти и газа (НИУ) имени И.М. Губкина экспериментально доказали, что качество промпта влияет на результат работы ИИ намного больше, чем архитектура модели, и разработали промпт, который исключил «галлюцинации» нейросети.

Редакция сайта

2b30d5fa170ee3b4cbb5389b6baf23c9_ce_999x666x0x0.jpg
РГУ нефти и газа (НИУ) имени И.М. Губкина

Ученые задумались над проблемой ложных ответов при работе над проектом «ИИ-пожарного» — системы на базе ИИ, которая поможет снизить ущерб от пожаров в ТЭК благодаря более быстрой и точной реакции на инцидент. В сфере безопасности одна «галлюцинация» может обнулить все успехи в защите. Именно поэтому исследователи изучили логику «галлюцинаций», чтобы понять, как их предотвратить.

Чем страшны галлюцинации?

Когда в марте 2023 года американский адвокат Питер Шварц отправил в суд документ с тремя несуществующими судебными прецедентами, которые «нашел» для него ChatGPT, это стало звоночком для всего мира. ИИ уверенно назвал имена, даты и обстоятельства дел — и все это было полной выдумкой. Итог — штраф в 5,5 тыс. долларов, испорченная репутация и понимание, что ИИ может безбожно лгать. Причем нейросеть не обманывала осознанно: она просто не знала, что ошибается. Как показали исследования, ИИ начинает «галлюцинировать», когда сталкивается с недостатком данных.

Термин «галлюцинации» применительно к нейросетям закрепился в профессиональном сообществе не случайно. Большие языковые модели — это не базы знаний, а вероятностные машины. Они не хранят факты, а предсказывают следующее слово на основе статистических закономерностей, извлеченных из миллиардов текстов. Когда модели не хватает данных, она не говорит: «Я не знаю», а додумывает наиболее вероятный, с ее точки зрения, вариант. И звучит это, как правило, крайне убедительно.

По данным исследований OpenAI, даже самые продвинутые модели продолжают галлюцинировать. GPT-3, например, выдает 20-30% ошибок, GPT-4 — 10-15%, GPT-4 Turbo: 8-12%. Не такой уж серьезный прогресс в росте, согласитесь, ведь даже 1% ошибок может быть фатален, скажем, при постановке диагноза. Улучшения, конечно, есть, но недостаточно значительные. Но важно не это: сами ошибки становятся все более утонченными и сложными для обнаружения.

нейросеть
Magnific

Бешенство Дональда Трампа, пудель и барсуки

Авторизуйтесь, чтобы продолжить чтение. Это быстро и бесплатно.

Регистрируясь, я принимаю условия использования

Открыть в приложении