aijour · Gennembrud og forskning · 23. september 2026 · Ekspert

OpenAI lancerer MentalHealthBench til test af AI om mental sundhed

OpenAI har lanceret et nyt gratis benchmarkværktøj, MentalHealthBench, der tester hvor godt AI-modeller som ChatGPT håndterer samtaler om mental sundhed, fra hverdagsbekymringer til akutte kriser.

AI-genereret billede

Hvad er nyt

OpenAI lancerede den 23. september 2026 MentalHealthBench, et nyt værktøj (et såkaldt benchmark) der skal måle, hvor godt AI-modeller håndterer samtaler om mental sundhed. Benchmarket består af 1.215 opdigtede (syntetiske) testsamtaler, der spænder fra almindelige spørgsmål om trivsel til akutte krisesituationer. Det er udviklet sammen med mere end 80 psykologer og psykiatere fra 22 lande, som tilsammen taler 19 sprog og har skrevet 5.262 detaljerede kriterier for, hvad et godt AI-svar bør indeholde.

Hvad er smart

Det smarte er, at testen ikke kun tjekker, om AI'en opdager en krise, men også om den bevarer brugerens selvbestemmelse, stiller de rigtige opfølgende spørgsmål og giver brugbare råd. Af samtalerne er 53,5 procent almindelige hverdagsbekymringer, 18,2 procent alvorlige tilfælde, og 28,3 procent decideret nødsituationer. Testpersonerne dækker voksne, teenagere mellem 13 og 17 år, pårørende og sundhedsfagligt personale, og samtalerne findes også på blandt andet spansk, hindi, arabisk, portugisisk, tysk og kinesisk.

Billigere eller bedre?

MentalHealthBench er gratis og offentligt tilgængeligt, så også konkurrenter som Google og Anthropic kan downloade det og teste deres egne modeller. De første resultater viser, at OpenAIs nyeste model, GPT-6 Astra, scorer 57,3 procent, foran søstermodellerne GPT-6 Sol (53,9 procent) og GPT-6 Luna (50,2 procent). Til sammenligning ligger Anthropics Claude Opus 5.5 på 52,4 procent, mens den ældre GPT-4o fra marts 2025 kun når 32,1 procent, og Googles Gemini 2.5 Pro lander på 29,5 procent. Der er altså sket et stort spring i, hvor godt nyere AI håndterer den slags samtaler, men ingen af modellerne er i nærheden af en perfekt score.

Det er den god til

Benchmarket er ikke et produkt, man kan bruge direkte som forbruger, men et redskab for udviklere og forskere til at gøre AI-chatbots bedre og mere sikre at tale med om svære følelser, angst eller selvmordstanker. OpenAI understreger selv, at ChatGPT ikke kan erstatte en terapeut, og at værktøjet skal bruges til at afsløre huller i modellernes reaktioner, for eksempel om de spørger nok ind, før de giver råd, eller reagerer rigtigt, når en teenager skriver noget bekymrende. For almindelige brugere betyder det i praksis, at fremtidige AI-modeller forhåbentlig bliver bedre til at opdage og håndtere følsomme samtaler om mental sundhed på en ansvarlig måde.

Kilder

Mere om emnet

Få ugens AI-nyheder i indbakken

Vælg selv niveau, emner og længde. Én mail om ugen, afmeld når som helst.

Tilmeld dig Promptly Nyhedsbrev