Spring til indhold

Må AI give karakterer? Reglerne, forskningen og grænsen, læreren skal holde

Et forsøg med 119 gymnasielærere satte gang i debatten om at lade en sprogmodel bedømme skriftlige opgaver. Her er, hvad reglerne siger, hvad forskningen i karakterer viser, og hvor grænsen mellem hjælp og bedømmelse går.

Af Frederik Engberg og Andreas Zacharias8 min. læsning

Kort fortalt

  • AI-forordningen regner systemer, der evaluerer elevers læringsudbytte, som højrisiko, også når resultatet bruges til at styre elevens læringsforløb.
  • Efter databeskyttelsesforordningens artikel 22 er der som udgangspunkt forbud mod afgørelser med betydelig påvirkning for eleven, hvor ingen fysisk person har været involveret.
  • Forskningen peger på, at karakterer ved siden af kommentarer svækker kommentarernes effekt. Den stærkeste feedback er den, der forklarer og peger fremad.
  • Grænsen går ved, hvem der vurderer. Et udkast til feedback, som læreren justerer og godkender, er noget andet end en karakter, et system har sat.

Debatten, der startede med 119 lærere og én opgave

I 2024 lod tre studerende fra Aalborg Universitet 119 gymnasielærere bedømme den samme opgave i skriftlig dansk. Karaktererne spændte fra 00 til 12, selvom lærerne i altovervejende grad var enige. På den baggrund foreslog de studerende i et debatindlæg i Politiken at lade ChatGPT erstatte den ene censor, så bedømmelsen blev mindre afhængig af én lærers vurdering.

Gymnasieskolernes Lærerforenings formand, Tomas Kepler, svarede i A4 Uddannelse, at det ville åbne døren for generativ kunstig intelligens i bedømmelsesgrundlaget. Hans spørgsmål var, hvem der har ansvaret for en forkert karakter, når den er givet af et system, ingen kan se ind i, og om bedømmelsen ville hvile på skævheder i de data, modellen er trænet på.

Begge sider har fat i noget. Variationen mellem bedømmere er reel og veldokumenteret. Men spørgsmålet om ansvar og gennemsigtighed er ikke kun et holdningsspørgsmål. Det er også et juridisk spørgsmål.

Hvad siger AI-forordningen om AI og bedømmelse?

AI-forordningens bilag III lister de områder, hvor et AI-system regnes for højrisiko. Under uddannelse står blandt andet systemer, der er beregnet til at evaluere læringsudbytte, også når resultatet bruges til at styre elevens læringsforløb. Det er en bred formulering. Den dækker ikke kun karaktergivning, men kan også ramme værktøjer, der vurderer elevens arbejde for at planlægge den videre undervisning.

Forordningens artikel 6, stk. 3, gør en undtagelse. Et system under bilag III regnes ikke for højrisiko, hvis det ikke udgør en væsentlig risiko for personers grundlæggende rettigheder, fx fordi det er beregnet til at udføre en forberedende opgave forud for en vurdering, eller til at forbedre resultatet af en menneskelig aktivitet, der allerede er afsluttet. Undtagelsen gælder dog aldrig, hvis systemet profilerer personer.

Hvem vurderer, om et værktøj er højrisiko?

Leverandøren skal vurdere sit eget system, men skolen er idriftsætter og skal selv kunne stå inde for brugen. Bed derfor om leverandørens vurdering skriftligt, med begrundelsen. Vi har samlet de spørgsmål, I kan stille, i guiden til lovligheden af AI-værktøjer.

Hvad siger GDPR om automatiske afgørelser?

Databeskyttelsesforordningens artikel 22 forbyder som udgangspunkt automatiske, individuelle afgørelser, herunder profilering, når afgørelsen har en betydelig påvirkning for eleven. Ministeriets vejledning om lovlig brug af kunstig intelligens forklarer en automatisk afgørelse som en afgørelse, hvor der ikke har været en fysisk person involveret undervejs.

Forbuddet har undtagelser, fx når der er hjemmel i lovgivningen, eller når eleven har givet udtrykkeligt samtykke. Og selv når en automatisk afgørelse er lovlig, kan eleven i en række situationer bede om, at sagen bliver behandlet igen med et menneske involveret.

For skolen betyder det i praksis, at en karakter, der bliver sat af et system uden lærerens egen vurdering, rejser spørgsmål, som en karakter sat af læreren ikke gør.

Hvad siger forskningen om karakterer og feedback?

Selv hvis reglerne tillod det, er det ikke oplagt, at en hurtigere karakter er det, eleverne mangler. Ruth Butlers klassiske studie fra 1988 af 132 elever viste, at karakterer kombineret med kommentarer ikke gav bedre resultater end karakterer alene, når det gjaldt at fastholde elevernes interesse og indsats. Det var kommentarerne for sig, der gav de bedste resultater.

Thomas Guskeys konklusion fra 2019 er ikke, at karakterer skal droppes, men at de kun styrker læringen, når de er koblet til konkret, individuel vejledning, der forklarer hvorfor, og hvad næste skridt er.

Variationen mellem bedømmere, som satte debatten i gang, er heller ikke ny. I ét studie bedømte 73 engelsklærere det samme essay med en spredning på 46 point, der dækkede alle fem karakterniveauer fra A til F. Men svaret på den variation behøver ikke være, at et system sætter karakteren. Det kan også være, at lærerne bedømmer ud fra det samme grundlag og de samme kriterier.

Hvor går grænsen mellem hjælp og bedømmelse?

Grænsen går ved, hvem der vurderer. Tre spørgsmål gør den konkret:

  1. Hvem sætter karakteren? Foreslår værktøjet en karakter, flytter en del af vurderingen over på systemet, også selv om læreren kan ændre den bagefter.
  2. Ser eleven noget, før læreren har godkendt det? Hvis feedbacken går direkte til eleven, er læreren ikke længere involveret i det, eleven får.
  3. Kan læreren se, hvad feedbacken bygger på? Tekstnære eksempler fra elevens egen opgave gør det muligt at kontrollere hvert punkt. En samlet vurdering uden begrundelse gør ikke.

Et værktøj, der skriver et udkast, som læreren gennemgår, justerer og godkender, hjælper med arbejdet. Et værktøj, der sætter karakteren, overtager en del af det.

Sådan har vi valgt at bygge Censai

Censai viser aldrig et karakterforslag. Vi har valgt det med vilje, fordi karakteren er lærerens faglige vurdering. Censai skriver et udkast til feedback med styrker, forbedringsmuligheder og et konkret næste skridt til hvert punkt, og hvert punkt peger på et sted i elevens tekst. Læreren justerer og godkender, før eleven ser noget, og giver selv en karakter, hvis der skal gives en.

Om et konkret værktøj falder under bilag III, er stadig en vurdering, skolen skal foretage for sin egen brug. Læs mere om, hvordan Censai virker, og om forskningen bag.

Kilder

Ofte stillede spørgsmål

  • Der er ingen regel, der udtrykkeligt tillader det, og flere regler taler imod. AI-forordningen regner systemer, der evaluerer læringsudbytte, som højrisiko, og databeskyttelsesforordningens artikel 22 forbyder som udgangspunkt automatiske afgørelser med betydelig påvirkning for eleven. Karakteren bør derfor sættes af læreren.

  • Det kan det være. Bilag III dækker også systemer, der evaluerer læringsudbytte for at styre læringsforløbet. Artikel 6, stk. 3, undtager systemer, der fx udfører en forberedende opgave forud for en menneskelig vurdering, men ikke systemer, der profilerer. Bed leverandøren om en skriftlig vurdering med begrundelse.

  • Ja, når skolen har styr på databeskyttelsen, og læreren selv vurderer opgaven. Et udkast til feedback, som læreren gennemgår, justerer og godkender, er hjælp til arbejdet. Det kræver en databehandleraftale med leverandøren og retningslinjer for, hvad værktøjet må bruges til.

  • Fordi karakteren er lærerens faglige vurdering, og fordi forskningen peger på, at en karakter ved siden af kommentarerne svækker kommentarernes effekt. Censai skriver et udkast til feedback, og læreren giver selv en karakter, hvis der skal gives en.

Skal vi se på, hvordan det ser ud hos jer?

Skoler, der er i tvivl, om Censai passer til dem, kan få en gratis pilottest i 14 dage, og vi kommer ud og sætter det hele op. Et kort møde er nok til at finde ud af, om det giver mening.

Læs også

AI i skolen

AI-feedback i folkeskolen: hvad må det, og hvad skal det ikke?

Nogle ser AI som fremtiden, andre som en trussel mod lærerens skøn og relationen til eleven. Begge sider har fat i noget. Her er, hvor grænsen går, og hvordan den kan trækkes i praksis.

7 min. læsning

Læs indlægget

Feedback i praksis

Sådan vælger I et feedbackværktøj til skriftlige opgaver: ni kriterier

Der kommer hele tiden nye værktøjer til opgavebunken, og de ligner hinanden på forsiden. Forskellene viser sig først, når man spørger ind til, hvem der bestemmer, hvad feedbacken bygger på, og hvor data ender. Her er de ni spørgsmål, vi selv ville stille.

7 min. læsning

Læs indlægget