VALIDERING

Hvordan er Lectora validert?

Lectora er ikke validert i én enkeltstående studie. Verktøyet er bygget sammen med tre akademiske partnere over flere år, og hvert samarbeid kjører den samme sammenligningen mot den aktuelle faglærerens tidligere vurdering. Det publiserte ankeret er den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen: tolv gjennomføringer, 889 kandidat-eksamen-par på langsvarseksamen, rundt 43 700 deloppgavesammenligninger, kjørt blindt. På tvers av dem samsvarte Lectoras utkast med faglæreren på R² = 0.85, en sterkere tilpasset lineær sammenheng enn de R² = 0.64 som ble rapportert mellom to menneskelige sensorer på samme materiale. Spørsmålet hvert samarbeid stiller er det samme: er utkastet nært nok til å gjennomgås, eller starter du fra bunnen av?

Hvor tett samsvarer Lectora med faglæreren?

På tvers av tolv gjennomføringer av den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen, 889 kandidat-eksamen-par og rundt 43 700 deloppgavesammenligninger, samsvarte Lectoras utkast med faglæreren på R² = 0.85, og nådde 0.86 på den summative eksamenen. De to uavhengige sensorene som allerede hadde vurdert de samme besvarelsene, var enige med hverandre på R² = 0.64. Lectora ble kjørt blindt, mot samme vurderingsmatrise, uten tilgang til noen av sensorenes poeng.

Der to sensorer vanligvis havner0.50.60.70.80.91.0R² = 0.64To sensorer, samme eksamenR² = 0.85Lectora vs. faglærerSAMSVAR (R²) — LENGER TIL HØYRE ER NÆRMERE FAGLÆREREN

Lectora (0–100)

Faglærer (0–100)

Lectora vs. faglærer
R² = 0.85
To menneskelige sensorer
R² = 0.64

12 eksamener · 889 kandidat-eksamen-par · 43 683 sammenligninger

Punktene er illustrative.

Hva fant den retrospektive simuleringen av arbeidsmengde?

I en retrospektiv simulering brukte metoden for målrettet manuell vurdering et stratifisert kalibreringssett på fjorten kandidater og merket kandidater med 99 % prediksjonsintervaller som krysset én bestått/ikke bestått-grense. På tvers av de tolv gjennomføringene ville den ha krevd manuell vurdering av 12 694 av de 41 733 sensor-oppgave-parene: 69,6 % færre, avrundet til 70 %, med rundt 40 % til rundt 84 % per eksamen. Dette måler simulerte reduksjoner i oppgavepar, ikke minutter spart eller resultater på en bokstavkarakterskala. Metoden og simulatoren nedenfor er ikke en funksjon som aktiveres ved installasjon; en kvalifisert sensor godkjenner hver karakter i produktets arbeidsflyt.

Full gjennomgang41 733Målrettet manuell vurdering12 69470%mindre manuell vurderingsensoroppgave-par vurdert manueltPÅ TVERS AV 12 AVSLUTTENDE KLINISKE EKSAMENER · ~40 % TIL ~84 % PER EKSAMEN

RETROSPEKTIV SIMULERING

Exam 01 · 78 kandidater · 48 kortsvarsoppgaver

4. Vurder risikoblokken manuelt

Bytt eksamen:
010203040506070809101112
00252550507575100100BESTÅTT-GRENSE · 57.7AI-utkast (% av maks)Sensor (% av maks)

Simulert oppgavereduksjon

73.1%

2 736 av 3 744 sensor-oppgave-par utelatt i simuleringen, ikke målt tidsbesparelse

Manuell vurdering

26.9%

Risikoblokk

7

Kalibrerings-R²

0.882

Full-kullets R²

0.833

Valgte oppgavepar

1 008

Oppgavepar i full gjennomgang

3 744

Prediksjonsintervall

90%95%99%

Hvor kommer grunnlaget fra?

Tre akademiske samarbeid, der hvert enkelt kjører den samme valideringen mot sin egen faglærers tidligere vurdering, også der AI gjorde det dårligere.

I de to uavhengige matematikkstudiene ved Matematisk institutt ved Universitetet i Bergen holdt vurderingssamsvaret: R² = 0,68 mot faglæreren (Pearson r = 0,82), gjennomsnittlig absolutt avvik 0,64 poeng på en 0 til 6-skala og 87,7 % bestått/ikke-bestått-samsvar ved grensen. Resultatet for tilbakemelding delte seg etter studiedesign. I milepælsstudien, der studentene så tilbakemelding fra faglærer, medstudenter og AI side om side, leste de AI-tilbakemeldingen minst (57 % mot 94 % for faglærer) og vurderte den som signifikant mindre nyttig (4,38 mot 5,72 på en 7-punktsskala). I sensorsamsvarsstudien, der hver student fikk enten menneske-pluss-AI eller kun menneske uten å vite hvilken, ble ingen signifikant nytteforskjell påvist (p = 0,45); casestudien slår fast at dette ikke er bevis på likeverdighet. Når studentene kunne se kilden, foretrakk de mennesket; når de ikke kunne se den, ble ingen forskjell påvist. De samme forskerne fant også at sensorsamsvaret falt fra ICC 0,874 til 0,608 med den tidlige prototypen, og det står på kortene nedenfor i stedet for å bli utelatt.

Publisert

Det medisinske fakultet

Universitetet i Bergen

R² = 0.85

mot faglæreren

Det publiserte ankeret: 12 gjennomføringer av den avsluttende kliniske eksamenen, 889 kandidat-eksamen-par, vurdert blindt mot samme matrise.

Les studien →
Uavhengig studie

Matematisk institutt

Universitetet i Bergen

R² = 0.68

milepælsstudien, målt av UiB-forskere

Ikke vår egen måling. De samme forskerne fant at AI-assistanse senket samsvaret mellom sensorer fra ICC 0.87 til 0.61 på den tidlige prototypen, tatt med her fordi det er en del av grunnlaget. På tilbakemelding foretrakk studentene som kunne se kilden, mennesket.

Les hele funnene →
Pilot pågår

Finans

NHH, Norges Handelshøyskole

Bestått/ikke-bestått-screening på lange analytiske innleveringer. Tall per kull er ikke publisert ennå — oppsummeringen per pilot går til emneansvarlig.

Les pilotens omfang →

Les hele metoden → — hva R² måler i vurdering, hvordan grunnlinjen mellom sensorer ble produsert, og hele utregningen bak målrettet vurdering.

~248,500

SPØRSMÅL OG KASUS VURDERT PÅ TVERS AV DISTRIBUSJONER

…og det vokser hver uke.

20+ emner

I PRODUKSJON OG VERIFISERT

På tvers av medisin, matematikk, finans og mer.

12 eksamener · 889 kandidater

UIB MEDICINE-PILOT · MÅLRETTET MANUELL VURDERING

~43 700 AI-mot-sensor deloppgavesammenligninger via den målrettede manuelle vurderingsløkken.

På tvers av tolv gjennomføringer av den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen samsvarte Lectora med faglæreren på R² = 0.85 over 889 kandidat-eksamen-par og rundt 43 700 deloppgavesammenligninger, og 0.86 på den summative eksamenen. Den ble kjørt blindt, mot samme vurderingsmatrise. Det er en poengsammenligning på langsvarseksamen. Til sammenligning samsvarte to uavhengige menneskelige sensorer på samme materiale på R² = 0.64. Den tilpassede poengsammenhengen var sterkere for Lectora mot faglæreren i denne sammenligningen; R² alene måler ikke størrelsen på individuelle poengforskjeller. Casestudien fra UiB Medicine har gjennomgangen per eksamen. Den samme løkken er i pilot ved Matematisk institutt ved UiB og ved NHH Finans.