Må AI give karakterer? Reglerne, forskningen og grænsen, læreren skal holde
Et forsøg med 119 gymnasielærere satte gang i debatten om at lade en sprogmodel bedømme skriftlige opgaver. Her er, hvad reglerne siger, hvad forskningen i karakterer viser, og hvor grænsen mellem hjælp og bedømmelse går.
Kort fortalt
- AI-forordningen regner systemer, der evaluerer elevers læringsudbytte, som højrisiko, også når resultatet bruges til at styre elevens læringsforløb.
- Efter databeskyttelsesforordningens artikel 22 er der som udgangspunkt forbud mod afgørelser med betydelig påvirkning for eleven, hvor ingen fysisk person har været involveret.
- Forskningen peger på, at karakterer ved siden af kommentarer svækker kommentarernes effekt. Den stærkeste feedback er den, der forklarer og peger fremad.
- Grænsen går ved, hvem der vurderer. Et udkast til feedback, som læreren justerer og godkender, er noget andet end en karakter, et system har sat.
Debatten, der startede med 119 lærere og én opgave
I 2024 lod tre studerende fra Aalborg Universitet 119 gymnasielærere bedømme den samme opgave i skriftlig dansk. Karaktererne spændte fra 00 til 12, selvom lærerne i altovervejende grad var enige. På den baggrund foreslog de studerende i et debatindlæg i Politiken at lade ChatGPT erstatte den ene censor, så bedømmelsen blev mindre afhængig af én lærers vurdering.
Gymnasieskolernes Lærerforenings formand, Tomas Kepler, svarede i A4 Uddannelse, at det ville åbne døren for generativ kunstig intelligens i bedømmelsesgrundlaget. Hans spørgsmål var, hvem der har ansvaret for en forkert karakter, når den er givet af et system, ingen kan se ind i, og om bedømmelsen ville hvile på skævheder i de data, modellen er trænet på.
Begge sider har fat i noget. Variationen mellem bedømmere er reel og veldokumenteret. Men spørgsmålet om ansvar og gennemsigtighed er ikke kun et holdningsspørgsmål. Det er også et juridisk spørgsmål.
Hvad siger AI-forordningen om AI og bedømmelse?
AI-forordningens bilag III lister de områder, hvor et AI-system regnes for højrisiko. Under uddannelse står blandt andet systemer, der er beregnet til at evaluere læringsudbytte, også når resultatet bruges til at styre elevens læringsforløb. Det er en bred formulering. Den dækker ikke kun karaktergivning, men kan også ramme værktøjer, der vurderer elevens arbejde for at planlægge den videre undervisning.
Forordningens artikel 6, stk. 3, gør en undtagelse. Et system under bilag III regnes ikke for højrisiko, hvis det ikke udgør en væsentlig risiko for personers grundlæggende rettigheder, fx fordi det er beregnet til at udføre en forberedende opgave forud for en vurdering, eller til at forbedre resultatet af en menneskelig aktivitet, der allerede er afsluttet. Undtagelsen gælder dog aldrig, hvis systemet profilerer personer.
Hvem vurderer, om et værktøj er højrisiko?
Leverandøren skal vurdere sit eget system, men skolen er idriftsætter og skal selv kunne stå inde for brugen. Bed derfor om leverandørens vurdering skriftligt, med begrundelsen. Vi har samlet de spørgsmål, I kan stille, i guiden til lovligheden af AI-værktøjer.
Hvad siger GDPR om automatiske afgørelser?
Databeskyttelsesforordningens artikel 22 forbyder som udgangspunkt automatiske, individuelle afgørelser, herunder profilering, når afgørelsen har en betydelig påvirkning for eleven. Ministeriets vejledning om lovlig brug af kunstig intelligens forklarer en automatisk afgørelse som en afgørelse, hvor der ikke har været en fysisk person involveret undervejs.
Forbuddet har undtagelser, fx når der er hjemmel i lovgivningen, eller når eleven har givet udtrykkeligt samtykke. Og selv når en automatisk afgørelse er lovlig, kan eleven i en række situationer bede om, at sagen bliver behandlet igen med et menneske involveret.
For skolen betyder det i praksis, at en karakter, der bliver sat af et system uden lærerens egen vurdering, rejser spørgsmål, som en karakter sat af læreren ikke gør.
Hvad siger forskningen om karakterer og feedback?
Selv hvis reglerne tillod det, er det ikke oplagt, at en hurtigere karakter er det, eleverne mangler. Ruth Butlers klassiske studie fra 1988 af 132 elever viste, at karakterer kombineret med kommentarer ikke gav bedre resultater end karakterer alene, når det gjaldt at fastholde elevernes interesse og indsats. Det var kommentarerne for sig, der gav de bedste resultater.
Thomas Guskeys konklusion fra 2019 er ikke, at karakterer skal droppes, men at de kun styrker læringen, når de er koblet til konkret, individuel vejledning, der forklarer hvorfor, og hvad næste skridt er.
Variationen mellem bedømmere, som satte debatten i gang, er heller ikke ny. I ét studie bedømte 73 engelsklærere det samme essay med en spredning på 46 point, der dækkede alle fem karakterniveauer fra A til F. Men svaret på den variation behøver ikke være, at et system sætter karakteren. Det kan også være, at lærerne bedømmer ud fra det samme grundlag og de samme kriterier.
Hvor går grænsen mellem hjælp og bedømmelse?
Grænsen går ved, hvem der vurderer. Tre spørgsmål gør den konkret:
- Hvem sætter karakteren? Foreslår værktøjet en karakter, flytter en del af vurderingen over på systemet, også selv om læreren kan ændre den bagefter.
- Ser eleven noget, før læreren har godkendt det? Hvis feedbacken går direkte til eleven, er læreren ikke længere involveret i det, eleven får.
- Kan læreren se, hvad feedbacken bygger på? Tekstnære eksempler fra elevens egen opgave gør det muligt at kontrollere hvert punkt. En samlet vurdering uden begrundelse gør ikke.
Et værktøj, der skriver et udkast, som læreren gennemgår, justerer og godkender, hjælper med arbejdet. Et værktøj, der sætter karakteren, overtager en del af det.
Sådan har vi valgt at bygge Censai
Censai viser aldrig et karakterforslag. Vi har valgt det med vilje, fordi karakteren er lærerens faglige vurdering. Censai skriver et udkast til feedback med styrker, forbedringsmuligheder og et konkret næste skridt til hvert punkt, og hvert punkt peger på et sted i elevens tekst. Læreren justerer og godkender, før eleven ser noget, og giver selv en karakter, hvis der skal gives en.
Om et konkret værktøj falder under bilag III, er stadig en vurdering, skolen skal foretage for sin egen brug. Læs mere om, hvordan Censai virker, og om forskningen bag.
Kilder
- A4 Uddannelse: Lærerforening: AI skal ikke bedømme opgaver i gymnasiet (indlæg af Tomas Kepler, formand for GL), 17. september 2024.
- Europa-Parlamentet og Rådet: Forordning (EU) 2024/1689 om kunstig intelligens, artikel 6 og bilag III, juni 2024.
- Børne- og Undervisningsministeriet: Vejledning om lovlig brug af kunstig intelligens for uddannelsesinstitutionerne, afsnit om automatiske afgørelser, maj 2025.
- Ruth Butler: Enhancing and undermining intrinsic motivation, British Journal of Educational Psychology, 1988.
- Thomas R. Guskey: Grades versus comments: Research on student feedback, Phi Delta Kappan, 2019.
- Hunter Brimi: Reliability of grading high school work in English, Practical Assessment, Research & Evaluation, 2011.