Vragen over mensenrechten (de pilot ging specifiek over het recht op water) werden voorgelegd aan GPT-5, Claude, Gemini en Qwen (open source). Zij deden het nauwelijks beter dan men op basis van toeval kon verwachten: scores lagen net boven de 50 procent. De AI-taalmodellen liepen vooral vast op de meest fundamentele taak: herkennen wanneer een mensenrecht is geschonden, de fundamentele stap waarvan alle latere fasen van de analyse afhangen. Een fout in deze fase leidt onvermijdelijk tot een verkeerde juridische kwalificatie en een onjuiste rechtsgang. Hoewel de pilot kleinschalig was en de resultaten verkennend van aard, zo geeft AI en Equality toe, noemt het de conclusie ‘glashelder’: “Modellen die nu al beslissingen nemen met grote gevolgen voor mensenrechten, kunnen nog niet op betrouwbare wijze over die rechten redeneren.”
Benchmark
De resultaten staan in de HumRights-Bench, de eerste door experts gevalideerde benchmark die dit kan meten in plaats van op abstracte AI-ethiek. Van deze drie deed Gemini-3 het nog het beste met een score van 0,577. GPT-5 haalde een 0,537, Claude Opus 4.7 een 0,508 en Qwen 3.5-9B kwam uit op 0,339.
Netwerk
Achter deze benchmark zit ‘AI & Equality’, wat verwijst naar het werk van de Artificial Intelligence & Equality Initiative (AIEI). Dit is een wereldwijd netwerk en discussieplatform is opgericht door de Amerikaanse Carnegie Council for Ethics in International Affairs. Het onderzoekt hoe kunstmatige intelligentie de maatschappelijke gelijkheid beïnvloedt.
Getoetst
De instellingen die momenteel wetgeving voor AI opstellen – zoals de AI Act van de Europese Unie en HUDERIA (Human Rights, Democracy, and Rule of Law Impact Assessment) van de Raad van Europa – gaan ervan uit dat deze systemen over (mensen)rechten kunnen redeneren. Niemand had echter getoetst of dat ook daadwerkelijk zo is, stelt AI & Equality. “Wij hebben het instrument ontwikkeld dat dit wel doet.”
Gewaarborgd of geschonden
AI & Equality benadrukt dat dit geen abstracte systemen zijn. “Dezelfde modellen bepalen nu al wie in aanmerking komt voor een uitkering, wie door een werkgever wordt aangenomen en wat miljarden mensen online te zien krijgen. Dit zijn ook beslissingen die bepalen of mensenrechten worden gewaarborgd of geschonden. Toch had tot nu toe niemand onderzocht of deze systemen überhaupt kunnen redeneren over mensenrechten.”
Gevalideerd
De benchmark is gevalideerd door experts en werkt op basis van scenario’s. Hiermee wordt gemeten of een AI-systeem kan waarmaken wat de instanties die dit taalmodel willen inzetten ervan verwachten. Dit betreft het signaleren van een schending van (mensen)rechten, het benoemen van de relevante wetgeving, het maken van een afweging en het voorstellen van een oplossing.
