VALIDERING · METODE
Hvordan måles Lectoras karaktersamsvar?
Dette er den fullstendige metoden bak hovedtallene på valideringssammendraget. Siden dekker hva R² faktisk måler når to personer vurderer samme eksamen, hvordan grunnlinjen på R² = 0.64 mellom to menneskelige sensorer på den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen ble produsert, hvorfor Lectoras R² = 0.85 mot faglæreren havner der den gjør, og hvordan målrettet manuell vurdering, i en retrospektiv simulering ved én bestått/ikke bestått-grense, ville ha gjort det samsvaret om til omtrent 70 % færre manuelt vurderte sensor-oppgave-par. Alle tall her er de samme som rapporteres på valideringssammendraget: denne siden er utregningen, ikke en egen påstand.
Hva betyr R² i vurderingssammenheng?
R², determinasjonskoeffisienten, beskriver andelen variasjon som en tilpasset modell forklarer. I de lineære poengsammenligningene som rapporteres her, beskriver den hvor tett poengsummene følger en tilpasset linje. Den måler ikke prosentandelen riktige karakterer eller størrelsen på forskjellene mellom enkeltpoengsummer.
R² = 1.0 betyr at observasjonene ligger på den tilpassede linjen; det krever ikke at de to sensorene gir identiske poeng. En systematisk forskyvning eller forskjell i skala kan fortsatt finnes. R² = 0.0 betyr at den tilpassede modellen ikke forklarer noe av variasjonen rundt gjennomsnittet i denne sammenligningen, ikke at en sensor tar tilfeldige beslutninger.
Sammenligningen på den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen rapporterer R² = 0.85 for Lectora mot faglæreren og R² = 0.64 mellom de to menneskelige sensorene. Dette er resultater på det datasettet, ikke et universelt spenn for menneskelig vurdering. For å vurdere samsvar må man også undersøke poengforskjeller og konsekvensene ved vurderingens beslutningsgrenser.
Hvilket grunnlag er det for at Lectora er nøyaktig?
Grunnlaget kommer fra tre løpende akademiske samarbeid. Det publiserte ankeret er de tolv gjennomføringene av den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen. Egne studier dekker håndskrevet matematikk ved Matematisk institutt ved UiB, skrevet ut i matematikkstudien, mens NHH Finans er en løpende pilot på lange analytiske svar. Studiene har ulike oppgaver, design og resultatmål.
Medisindatasettet omfatter 889 kandidat-eksamen-par fra tolv seks timers gjennomføringer av den avsluttende kliniske eksamenen ved UiB, med rundt 43 700 deloppgavesammenligninger. To uavhengige menneskelige sensorer hadde allerede vurdert besvarelsene, noe som ga basislinjen R² = 0.64. Lectora ble kjørt blindt på de samme besvarelsene og vurderingsmatrisen uten tilgang til noen av sensorenes poeng. Sammenligningen med faglærerens referansepoeng ga R² = 0.85, og den summative eksamenen nådde 0.86.
Den publiserte matematikkstudien rapporterer poengsammenligningene fra milepælsstudien og funnene om sensorsamsvar fra sensorsamsvarsstudien, inkludert der AI-assistanse gjorde det dårligere. R²-resultater per kull i finans er ikke publisert ennå; pilotsammendraget deles med emneansvarlig. Medisinresultatet fastslår ikke resultatet for et annet emne, en annen vurderingsmatrise eller en annen vurderingsform.
Lectora (0–100) ↑
Faglærer (0–100) →
- Lectora vs. faglærer
- R² = 0.85
- To menneskelige sensorer
- R² = 0.64
12 eksamener · 889 kandidat-eksamen-par · 43 683 sammenligninger
Punktene er illustrative.
Hvor enige er menneskelige sensorer med hverandre?
De to uavhengige menneskelige sensorene på datasettet fra den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen hadde R² = 0.64. Casestudien fra UiB Medisin forklarer sammenligningen. Det er en målt basislinje for disse eksamenene, ikke en generell målestokk for alle menneskelige sensorer.
I den separate sensorsamsvarsstudien ved Matematisk institutt ved UiB hadde elleve studentsensorer som vurderte de samme tjue besvarelsene en ICC mellom sensorer på 0,874; med AI-assistanse falt ICC til 0,608 på den tidlige prototypen, og andelen av karaktervariansen som kan tilskrives sensoren steg fra 3,7 % til 26,3 %. ICC og R² er ulike statistiske mål og kan ikke rangeres mot hverandre som om de målte det samme. Fag, vurderingsmatrise, studiedesign og sensorkalibrering har betydning for tolkningen.
Ulik tolkning av vurderingsmatrisen kan gi ulike poeng på samme svar. En institusjon som vurderer Lectora, bør undersøke disse forskjellene på eget vurderingsmateriale sammen med den samlede statistikken.
Er Lectora mer konsistent enn menneskelige sensorer?
Medisinsammenligningen fant høyere R² for Lectora mot faglæreren (0.85) enn mellom de to menneskelige sensorene (0.64). Det er en sterkere lineær sammenheng i denne sammenligningen; R² alene fastslår ikke at enkeltkarakterer er riktige, at gjennomgang tar kortere tid eller at resultatet gjelder for et annet emne.
Sensorsamsvarsstudien i matematikk er også en del av dokumentasjonen: AI-assistanse reduserte ICC mellom sensorer på prototypen som ble testet. Søsterstudien, milepælsstudien, fant at vurderingssamsvaret holdt på R² = 0,68 mot faglæreren, gjennomsnittlig absolutt avvik 0,64 poeng på en 0 til 6-skala og 87,7 % bestått/ikke-bestått-samsvar ved grensen, så de to resultatene må leses sammen og ikke ett om gangen. Institusjoner bør vurdere kvaliteten på utkastene og arbeidet med gjennomgang i sin egen sammenheng.
I produktets arbeidsflyt gjennomgår og godkjenner en kvalifisert sensor hver karakter før publisering. De publiserte studiene støtter evalueringen; de erstatter ikke sensors gjennomgang og validerer ikke alle funksjoner i Lectora.
Hva betyr dette for arbeidsbelastningen? Målrettet manuell vurdering ved bestått-grensen
Målrettet manuell vurdering ble evaluert i en retrospektiv simulering på tvers av tolv gjennomføringer av den avsluttende kliniske eksamenen ved Det medisinske fakultet, Universitetet i Bergen. Den undersøker hvor mange sensor-oppgave-par som ville ha trengt manuell vurdering for å støtte én bestått/ikke bestått-grense. Det er en publisert metode og en simulator på dette nettstedet, ikke en funksjon som aktiveres når Lectora installeres.
I simuleringen brukte metoden et stratifisert kalibreringssett på fjorten kandidater: åtte fra den nedre delen av AI-utkastets poengfordeling, fire rundt bestått-grensen og to fra toppen. En tilpasset regresjon koblet AI-utkastet til sensorpoengene og ga et 99 % prediksjonsintervall for hver gjenværende kandidat. Kandidater med intervaller som krysset bestått-grensen, ble valgt ut til ytterligere manuell vurdering; de øvrige kandidatene brukte det kalibrerte estimatet i simuleringen.
På tvers av de tolv gjennomføringene ville metoden ha krevd manuell vurdering av 12 694 av de 41 733 sensor-oppgave-parene: 69,6 % færre, avrundet til 70 %. Reduksjonen per eksamen varierte fra rundt 40 % til rundt 84 %. Kullstørrelse og konsentrasjonen av kandidater nær grensen påvirket resultatet; kalibreringen med fjorten kandidater utgjør en større andel av et mindre kull.
Dette er simulerte reduksjoner i oppgavepar, ikke målte minutter spart eller et resultat for en bokstavkarakterskala. Prediksjonsintervallene bestemmer hvilke kandidater som velges ut til manuell vurdering i modellen; de garanterer ikke riktige beslutninger for et nytt kull. Produktets krav om at en kvalifisert sensor godkjenner hver karakter, gjelder fortsatt.
RETROSPEKTIV SIMULERING
Exam 01 · 78 kandidater · 48 kortsvarsoppgaver
4. Vurder risikoblokken manuelt
Simulert oppgavereduksjon
73.1%
2 736 av 3 744 sensor-oppgave-par utelatt i simuleringen, ikke målt tidsbesparelse
Manuell vurdering
26.9%
Risikoblokk
7
Kalibrerings-R²
0.882
Full-kullets R²
0.833
Valgte oppgavepar
1 008
Oppgavepar i full gjennomgang
3 744
Prediksjonsintervall