29 September 2026
Dergelijke verschillen in antwoorden kunnen reële gevolgen hebben: de sociale regels die deze systemen toepassen, kunnen beïnvloeden of samenwerking in de loop van de tijd floreert of mislukt. Naarmate AI steeds vaker wordt ingezet om advies te geven, online ruimtes te modereren en gedrag te beoordelen, wordt het steeds belangrijker om inzicht te krijgen in de waarden die in de oordelen ervan zijn ingebouwd.
In een studie gepubliceerd in PNAS Nexus onderzochten onderzoekers van de onderzoeksgroep Social Intelligent Artificial Systems aan het Instituut voor Informatica de sociale regels die door 21 grote taalmodellen (LLM’s) worden gehanteerd. Het onderzoek stond onder leiding van Alexandre S. Pires, samen met Laurens Samson, Sennay Ghebreab en Fernando P. Santos. De modellen waren het er grotendeels over eens dat het helpen van iemand met een goede reputatie positief is, en dat het weigeren om die persoon te helpen negatief is. Maar ze verschilden sterk van mening bij het beoordelen van handelingen naar iemand met een slechte reputatie.
Het voorbeeld met de boor illustreert waarom reputatie cruciaal is voor samenwerking. Op een platform voor het delen van spullen in de buurt zijn mensen wellicht eerder bereid om spullen uit te lenen aan buren die in het verleden anderen hebben geholpen, en minder bereid om dat te doen aan degenen die dat niet hebben gedaan. Dit staat bekend als indirecte wederkerigheid: samenwerking wordt in stand gehouden doordat mensen een goede of slechte reputatie opbouwen of verliezen op basis van hoe ze anderen behandelen.
De onderzoekers wilden nagaan of LLM’s sociale normen toepassen die samenwerking via reputatie in stand kunnen houden. Ze legden de systemen 43.200 fictieve scenario’s voor waarin de ene persoon de andere hielp of juist niet hielp. Vervolgens werd aan de modellen gevraagd of de handelende persoon een goede of slechte reputatie zou moeten krijgen. De scenario’s varieerden qua context, bewoordingen en de gebruikte namen.
Hoewel de modellen in sommige situaties grotendeels overeenstemming vertoonden, volgden ze geen eenduidige regel. Sommige modellen beoordeelden hulp verlenen als positief, ongeacht de reputatie van de ander. Andere modellen vonden het aanvaardbaar om hulp te onthouden aan iemand die werd beschreven als iemand met een slechte reputatie. Verschillende versies in dezelfde modelfamilie konden zelfs verschillende normen toepassen.
Het team onderzocht vervolgens wat deze verschillen in de praktijk zouden kunnen betekenen. Met behulp van een model uit de evolutionaire speltheorie simuleerden ze een populatie waarin mensen herhaaldelijk beslissen of ze elkaar zullen helpen, waarbij ze de reputatie van de ander als leidraad voor die beslissing gebruiken. Hun handelingen beïnvloeden ook hun eigen reputatie, wat bepaalt of anderen hen in de toekomst waarschijnlijk zullen helpen.
Uit de simulaties bleek dat dezelfde sociale normen verschillende effecten kunnen hebben, afhankelijk van de mate waarin mensen het eens zijn over wie betrouwbaar is. Wanneer iedereen dezelfde mening heeft over iemands reputatie, kunnen gedetailleerdere regels – zoals het anders behandelen van een weigering om de boormachine uit te lenen, afhankelijk van het verleden van de lener – de samenwerking bevorderen. Maar wanneer mensen het oneens zijn over reputaties, kunnen eenvoudigere regels beter werken, omdat deze niet afhankelijk zijn van het feit dat iedereen een persoon op dezelfde manier ziet.
De onderzoekers testten ook of aanwijzingen de modellen konden sturen in de richting van normen die samenwerking bevorderen. Instructies waarin het beoogde doel duidelijk werd vermeld, leverden de meest consistente resultaten op, hoewel de effecten ervan nog steeds varieerden tussen de modellen
Uit de bevindingen blijkt dat het niet volstaat om te controleren of een AI in één enkel geval een zinnig antwoord geeft. Ontwikkelaars moeten ook de bredere regel onderzoeken die een systeem in verschillende situaties toepast, bijvoorbeeld of het weigeren van hulp aan iemand met een slechte reputatie als oneerlijk of gerechtvaardigd wordt beschouwd. De onderzoekers stellen voor dat hun raamwerk kan worden gebruikt om toekomstige modellen op dergelijke patronen te toetsen voordat ze worden ingezet om mensen te adviseren, te modereren of te beoordelen.