Forskningen bag
Hvorfor Censai er bygget sådan.
Censai er ikke bygget på en løs antagelse om, at AI kan give feedback. Værktøjet er bygget på et konkret forskningsfelt om, hvad der får feedback til at forbedre elevers læring, og hvad der modsat kan skade den.
Her er den forskning, der ligger til grund, og hvad hvert enkelt fund har betydet for, hvordan produktet er skruet sammen.
01Udgangspunktet
Feedback er en af de stærkeste faktorer i læring, når den er skruet rigtigt sammen.
John Hatties metaanalyse af uddannelsesforskningen, der bygger på op mod 1.400 metaanalyser, placerer feedback som en af de kraftigste enkeltfaktorer for elevers faglige fremgang. Effektstørrelsen ligger omkring 0,73, altså markant over det, der svarer til et normalt års faglig udvikling. En senere og mere konservativ replikation af de samme data finder en lavere, men stadig solid effekt på 0,48.
Men der er en afgørende nuance. En klassisk metaanalyse af Kluger og DeNisi fra 1996, bygget på 607 målinger og over 23.000 observationer, viste, at selvom feedback i gennemsnit forbedrer præstationen, forringede over en tredjedel af al undersøgt feedback faktisk elevens præstation.
Feedback er altså ikke automatisk godt. Det afhænger af, hvordan den er skruet sammen. Det er grunden til, at resten af denne side findes.
- Effektstørrelse for feedback
0,73
Effektstørrelse for feedback
Hatties opgørelse. Over det, der svarer til et normalt års faglig udvikling.
- I en konservativ replikation
0,48
I en konservativ replikation
En nyere gennemgang af de samme data finder en lavere, men stadig solid effekt.
- Feedback, der gjorde skade
1 ud af 3
Feedback, der gjorde skade
Over en tredjedel af den undersøgte feedback forringede elevens præstation.
- Hattie, J. (2009). Visible Learning: A Synthesis of Over 800 Meta-Analyses Relating to Achievement. Routledge.
- Kluger, A. N., & DeNisi, A. (1996). The effects of feedback interventions on performance. Psychological Bulletin, 119(2), 254–284.
- Wisniewski, B., Zierer, K., & Hattie, J. (2020). The Power of Feedback Revisited: A Meta-Analysis of Educational Feedback Research. Frontiers in Psychology, 10:3087.
02Fem ting, forskningen er enig om
Hvad god feedback består af.
Feedback er ikke én ting. Forskningen skelner mellem, hvad feedbacken svarer på, hvor den rettes hen, hvor meget der gives, hvad den står sammen med, og hvordan den er formuleret. Alle fem dele er bygget ind i Censai.
- 01
Feedbacken skal svare på tre spørgsmål
Den mest citerede model på området er Hattie og Timperleys “The Power of Feedback” fra 2007. Ifølge modellen skal feedback svare på tre spørgsmål: hvor er jeg på vej hen, hvordan går det, og hvad er næste skridt.
Det første klargør mål og succeskriterier, det andet vurderer den præstation, der ligger, og det tredje peger fremad. Forskningen peger konsekvent på, at det er det sidste, der driver den største læringseffekt.
Feed up
Hvor er jeg på vej hen?
Mål og succeskriterier gøres tydelige for eleven.
Feed back
Hvordan går det?
En vurdering af den præstation, der faktisk er afleveret.
Feed forward
Hvad er næste skridt?
Konkret vejledning til det arbejde, der ligger foran eleven.
Sådan er det bygget ind i Censai
Hvert forbedringspunkt i Censai indeholder ikke kun en forklaring af, hvad der kan gøres bedre, men også et selvstændigt næste skridt, eleven kan tage med til den næste opgave.
- Hattie, J., & Timperley, H. (2007). The Power of Feedback. Review of Educational Research, 77(1), 81–112.
- Mandouit, L., & Hattie, J. (2023). Revisiting “The Power of Feedback” from the perspective of the learner. Learning and Instruction, 84, 101718.
- 02
Hvor feedbacken rettes hen, betyder mere end mængden
Forskningen skelner mellem fire niveauer, feedback kan ramme: opgaveniveauet, altså fakta og indhold, procesniveauet, altså strategier og metoder, selvreguleringen, altså elevens evne til selv at holde øje med sin proces, og selv-niveauet, altså ros eller kritik rettet mod eleven som person.
Resultaterne er entydige. Feedback på selv-niveau, som “flot arbejde” eller “du er dygtig”, er det mindst effektive, fordi opmærksomheden flyttes fra opgaven over på eleven. Procesniveauet driver den største fremgang. I skriveforskningen er der målt en forbedring på 0,75 standardafvigelser, svarende til næsten to års faglig vækst, når feedbacken rammer procesniveauet frem for opgaveniveauet alene.
Det hænger sammen med et af de mest robuste fund i motivationsforskningen. Mueller og Dwecks eksperimenter fra 1998 viste, at ros af barnets evner fik børn til at vælge de lette opgaver, mens ros af deres indsats og strategi fik dem til at vælge de udfordrende, hvor der var noget at lære.
De fire niveauer, feedback kan ramme
Mest effektiv øverst
Procesniveau
Strategier, metoder og fremgangsmåder i arbejdet.
Selvregulering
Elevens evne til selv at holde øje med sin proces.
Opgaveniveau
Fakta og indhold, og om det er rigtigt eller forkert.
Selv-niveau
Ros eller kritik rettet mod eleven som person.
Sådan er det bygget ind i Censai
Censai er bygget til at undgå ren ros som erstatning for indhold, og til at prioritere feedback om strategi og fremgangsmåde frem for vurderinger af eleven som person.
- Hattie, J., & Timperley, H. (2007). The Power of Feedback. Review of Educational Research, 77(1), 81–112.
- Mueller, C. M., & Dweck, C. S. (1998). Praise for intelligence can undermine children's motivation and performance. Journal of Personality and Social Psychology, 75(1), 33–52.
- Frontiers in Education (2021). Feedback That Leads to Improvement in Student Essays.
- 03
Mere feedback er ikke bedre feedback
Et centralt fund i forskningen i cognitive load er, at elevers arbejdshukommelse hurtigt bliver overbelastet af mange samtidige rettelser og kommentarer. Når feedbacken dækker for mange forskellige fejl på én gang, får eleven det indtryk, at alle problemer vejer lige tungt, og mindre af den bliver reelt taget ind.
Det samme er dokumenteret i forskningen i AI-genereret feedback. Et studie af elevperspektiver citerer en lærer, der anbefaler, at feedbacken skal være markant kortere og skrevet i et tilgængeligt sprog, netop fordi eleverne i studiet oplevede den som overvældende og gentagende.
Sådan er det bygget ind i Censai
Censai prioriterer frem for at dække alt. Feedbacken samler sig om typisk to til seks velbegrundede punkter i stedet for en lang liste, så eleven ved, hvor arbejdet skal lægges først.
- Ditch That Textbook (2018). Why feedback is SO time consuming, and how to fix it.
- UVA Teaching Hub. A Guide to Giving Writing Feedback that Sticks.
- Generative AI in K-12 Education: The CyberScholar Initiative (2026). arXiv:2502.19422.
- 04
Karakteren kan ikke bære læringen alene
Ruth Butlers klassiske studie fra 1988 af 132 elever viste, at karakterer kombineret med kommentarer ikke gav bedre resultater end karakterer alene, når det gjaldt at fastholde elevernes interesse og indsats. Det var de opgave-involverende kommentarer for sig, der gav de bedste resultater.
Den nuancerede konklusion, som Guskey formulerer den i 2019, er ikke, at karakterer skal droppes, men at de kun styrker læringen, når de er koblet til konkret, individuel vejledning, der forklarer hvorfor, og hvad næste skridt er.
Sådan er det bygget ind i Censai
Censai viser aldrig et karakterforslag, fordi karakteren er lærerens faglige vurdering. Vælger læreren at give en karakter, står den aldrig alene: eleven får samtidig en sammenhængende feedback, der forklarer, hvad vurderingen hviler på.
- Butler, R. (1988). Enhancing and undermining intrinsic motivation. British Journal of Educational Psychology, 58(1), 1–14.
- Guskey, T. R. (2019). Grades versus comments: Research on student feedback. Phi Delta Kappan.
- 05
Ordvalget betyder noget
Carol Dwecks forskning i growth mindset viser, at et lille sprogligt greb, at skrive “endnu ikke” i stedet for en endelig dom, øger elevernes vedholdenhed og deres tiltro til, at det kan lykkes næste gang.
Samtidig viser nyere forskning, at en opfordring til bare at prøve hårdere ikke virker i sig selv. Det, der flytter noget, er at koble indsatsen til en konkret strategi.
Sådan er det bygget ind i Censai
Forbedringspunkterne i Censai er formuleret som noget, eleven kan gøre ved næste opgave, og hvert punkt peger på en fremgangsmåde, ikke bare på mere arbejde.
- Dweck, C. S. Growth Mindset and the Future of Our Children. Parents League of New York.
- Yeager, D. S., & Dweck, C. S. (2020). What can be learned from growth mindset controversies? American Psychologist, 75(9), 1269–1284.
03Variationen mellem bedømmere
Den samme opgave kan få vidt forskellige karakterer.
Det her er kernen i det, Censai skal hjælpe med, og det er grundigt dokumenteret.
Forskningsreviews i inter-rater reliability viser konsekvent betydelig variation i bedømmelsen af skriftlige opgaver, ofte en hel karakter eller mere, selv blandt lærere med samme uddannelse og samme erfaring.
Der er også dokumenteret bias. Et amerikansk studie fandt, at næsten identiske skriveprøver, hvor kun navnet i teksten var skiftet ud, fik forskellige karakterer, alt efter hvilken baggrund navnet signalerede. Og forskningen viser, at rubrikker alene ikke løser problemet, fordi variationen i høj grad skyldes, hvordan bedømmere fortolker og vægter kriterierne forskelligt.
Sådan er det bygget ind i Censai
Censai lægger det samme kriteriegrundlag til grund for al feedback på tværs af klasser og lærere. Det fjerner ikke lærerens faglige skøn, og det skal det ikke, men det mindsker risikoen for, at to ens opgaver bliver mødt af to forskellige standarder, og for utilsigtet bias.
- Guskey, T. R. A Century of Grading Research: Meaning and Value.
- Brimi, H. (2011). Reliability of grading high school work in English. Practical Assessment, Research & Evaluation, 16(17).
- Quinn, D. M. (2020). Racial and ethnic bias in classroom grading. Edutopia / EdWorkingPaper.
- Rezaei, A., & Lovorn, M. (2010). Reliability and validity of rubrics for assessment through writing. Assessing Writing, 15(1), 18–39.
46 point
Brimi, H. (2011). Reliability of grading high school work in English.
04AI-feedback i forskningen
Forskningen i AI-feedback peger to veje, og vi bygger efter begge.
Der findes efterhånden en del direkte forskning i AI-genereret feedback på elevtekster. Den viser både, hvad der virker, og hvor det typisk går galt.
Det, studierne finder virker
Elever reviderer mere, når de får feedback
Et kontrolleret studie med 459 gymnasieelever fandt, at feedback genereret af en sprogmodel øgede elevernes revisionspræstation, deres motivation for opgaven og deres oplevelse af arbejdet, sammenlignet med ingen feedback.
Feedbacken bliver læst grundigere
Et andet studie fandt, at feedback genereret med ChatGPT forbedrede skrivekvaliteten hos lærerstuderende sammenlignet med feedback fra menneskelige eksperter, og at de brugte længere tid på at bearbejde den, hvilket er et tegn på dybere engagement.
De faldgruber, vi bygger udenom
Generisk feedback, der genbruger kriteriet
Et studie af et avanceret GPT-4-baseret feedbacksystem fandt, at over halvdelen af feedbacken manglede konkrete eksempler og blev generisk, fordi den genbrugte formuleringer fra rubrikkens beskrivelser i stedet for at forholde sig til den konkrete tekst.
Vores svar: Derfor bygger hvert punkt i Censai på tekstnære eksempler fra elevens egen opgave.
Svagere på det kvalitative skøn
Et sammenlignende studie af 200 gymnasieessays fandt, at AI rammer kriterierne præcist, men er svagere end mennesker på de kvalitative vurderinger, særligt argumentation og dybde.
Vores svar: Derfor er læreren altid den, der gennemgår, justerer og godkender, før eleven ser noget.
- Steiss, J., et al. (2024). Using large language models to provide explanatory feedback on student writing. Computers and Education: Artificial Intelligence.
- Meyer, J., et al. (2023). Using LLMs to bring evidence-based feedback into the classroom. Computers and Education: Artificial Intelligence.
- Stretching AI's reach: Assessing an AI-driven feedback system for extended academic writing (2026). ScienceDirect.
- LLM-Generated Feedback in L2 Writing: A Scoping Review (2026). Education Sciences, 16(8).
05Fra forskning til produkt
Sådan er det omsat i Censai.
Fem valg i produktet, der hver især kommer et bestemt sted fra i forskningen ovenfor.
Prioritering frem for fuld dækning
Typisk to til seks fokuserede punkter i stedet for en lang liste, fordi mere feedback på én gang ofte betyder mindre læring.
Et næste skridt i hvert punkt
Hvert forbedringspunkt indeholder et konkret næste skridt, eleven kan tage med videre, ikke kun en forklaring af, hvad der gik galt.
Proces frem for ros og kritik
Feedbacken retter sig mod strategi og fremgangsmåde i arbejdet, ikke mod eleven som person.
Karakteren står aldrig alene
Censai viser aldrig et karakterforslag. Vælger læreren at give en karakter, følger der en begrundet vurdering med, så eleven ved, hvad den hviler på.
Samme grundlag på tværs af klasser
Al feedback bygger på de samme kriterier, uanset hvem der har opgaven, og hvornår på dagen den bliver læst.
06Fælles Mål og skolens egne kriterier
Forskningen giver formen, jeres fag giver indholdet.
Forskningen på denne side siger noget om, hvordan feedback skal være skruet sammen for at virke. Den siger ikke noget om, hvad der er godt dansk eller god engelsk stil i en bestemt klasse.
Derfor tager feedbacken udgangspunkt i Fælles Mål og Undervisningsministeriets vejledninger for de skriftlige fag. Oven i det vælger skolen selv de kriterier og kompetenceområder, en opgave skal vurderes efter.
Og derfor foreslår Censai aldrig en karakter. Grundlaget kan gøres fælles, men vurderingen er og bliver lærerens.
Vil I bruge fundene i jeres egen feedback, har vi samlet dem i en model i fire trin på bloggen.
Eller skriv til kontakt@censai.dk