Nya forskningsresultat visar att stora språkmodeller (LLMs) uppvisar systematisk översjälvsäkerhet i debattsituationer, en egenskap som de verkar dela med människor.
Fem oroande mönster i språkmodellers självbedömning
En ny studie har undersökt hur väl språkmodeller kan bedöma sin egen säkerhet när de möter motstånd. Forskarna har organiserat 60 policyinriktade debatter med tre omgångar där tio avancerade språkmodeller deltog. Modellerna fick privat bedöma sin självförtroende (0-100) om att vinna efter varje omgång.
Studien, genomförd av Pradyumna Shyama Prasad och Minh Nhat Nguyen, identifierar fem oroande mönster:
1. Systematisk översjälvsäkerhet
Modellerna började debatter med en genomsnittlig initial självsäkerhet på 72,9% jämfört med en rationell baslinje på 50%.
2. Ökande självsäkerhet
Istället för att minska sin självsäkerhet när debatterna fortskred, ökade debattörerna sina uppskattade vinstchanser, med ett genomsnitt på 83% i den sista omgången.
3. Ömsesidig överskattning
I 61,7% av debatterna hävdade båda sidor samtidigt att de hade minst 75% sannolikhet att vinna, vilket är en logisk omöjlighet.
4. Ihållande självdebattsbias
Modeller som debatterade med identiska kopior ökade sin självsäkerhet från 64,1% till 75,2%. Även när de uttryckligen informerades om att deras chans att vinna var exakt 50%, steg självsäkerheten ändå (från 50,0% till 57,1%).
5. Missinriktad privat resonemang
Modellernas privata tankeprocesser skilde sig ibland från deras offentliga självsäkerhetsbedömningar, vilket väcker frågor om tillförlitligheten i deras resonemang.
Konsekvenser för praktisk användning
Dessa resultat tyder på att språkmodeller saknar förmågan att korrekt bedöma sig själva eller uppdatera sina övertygelser i dynamiska uppgifter med flera omgångar. Detta är särskilt oroande eftersom LLMs nu allt oftare används utan noggrann granskning i assistent- och agentroller.
Studien bygger vidare på tidigare forskning som mätt kalibrering på statiska faktabaserade fråge-svar-uppgifter, men utvärderar nu språkmodeller i en dynamisk, motståndskraftig debattmiljö. Forskarna kombinerar unikt två realistiska faktorer: ett format med flera omgångar som kräver att modeller uppdaterar övertygelser när ny information dyker upp, och en nollsummestruktur för att kontrollera för uppgiftsrelaterad osäkerhet.