Det medisinske fakultet
Universitetet i Bergen
R² = 0.85
mot faglæreren
Det publiserte ankeret: 12 gjennomføringer av den avsluttende kliniske eksamenen, 889 kandidat-eksamen-par, vurdert blindt mot samme matrise.
Les studien →VALIDERING
Lectora er ikke validert i én enkeltstående studie. Verktøyet er bygget sammen med tre akademiske partnere over flere år, og hvert samarbeid kjører den samme sammenligningen mot den aktuelle faglærerens tidligere vurdering. Det publiserte ankeret er den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen: tolv gjennomføringer, 889 kandidat-eksamen-par på langsvarseksamen, rundt 43 700 deloppgavesammenligninger, kjørt blindt. På tvers av dem samsvarte Lectoras utkast med faglæreren på R² = 0.85, en sterkere tilpasset lineær sammenheng enn de R² = 0.64 som ble rapportert mellom to menneskelige sensorer på samme materiale. Spørsmålet hvert samarbeid stiller er det samme: er utkastet nært nok til å gjennomgås, eller starter du fra bunnen av?
På tvers av tolv gjennomføringer av den avsluttende kliniske eksamenen ved Det medisinske fakultet ved Universitetet i Bergen, 889 kandidat-eksamen-par og rundt 43 700 deloppgavesammenligninger, samsvarte Lectoras utkast med faglæreren på R² = 0.85, og nådde 0.86 på den summative eksamenen. De to uavhengige sensorene som allerede hadde vurdert de samme besvarelsene, var enige med hverandre på R² = 0.64. Lectora ble kjørt blindt, mot samme vurderingsmatrise, uten tilgang til noen av sensorenes poeng.
Lectora (0–100) ↑
Faglærer (0–100) →
12 eksamener · 889 kandidat-eksamen-par · 43 683 sammenligninger
Punktene er illustrative.
I en retrospektiv simulering brukte metoden for målrettet manuell vurdering et stratifisert kalibreringssett på fjorten kandidater og merket kandidater med 99 % prediksjonsintervaller som krysset én bestått/ikke bestått-grense. På tvers av de tolv gjennomføringene ville den ha krevd manuell vurdering av 12 694 av de 41 733 sensor-oppgave-parene: 69,6 % færre, avrundet til 70 %, med rundt 40 % til rundt 84 % per eksamen. Dette måler simulerte reduksjoner i oppgavepar, ikke minutter spart eller resultater på en bokstavkarakterskala. Metoden og simulatoren nedenfor er ikke en funksjon som aktiveres ved installasjon; en kvalifisert sensor godkjenner hver karakter i produktets arbeidsflyt.
RETROSPEKTIV SIMULERING
Exam 01 · 78 kandidater · 48 kortsvarsoppgaver
4. Vurder risikoblokken manuelt
Simulert oppgavereduksjon
73.1%
2 736 av 3 744 sensor-oppgave-par utelatt i simuleringen, ikke målt tidsbesparelse
Manuell vurdering
26.9%
Risikoblokk
7
Kalibrerings-R²
0.882
Full-kullets R²
0.833
Valgte oppgavepar
1 008
Oppgavepar i full gjennomgang
3 744
Prediksjonsintervall
Tre akademiske samarbeid, der hvert enkelt kjører den samme valideringen mot sin egen faglærers tidligere vurdering, også der AI gjorde det dårligere.
I de to uavhengige matematikkstudiene ved Matematisk institutt ved Universitetet i Bergen holdt vurderingssamsvaret: R² = 0,68 mot faglæreren (Pearson r = 0,82), gjennomsnittlig absolutt avvik 0,64 poeng på en 0 til 6-skala og 87,7 % bestått/ikke-bestått-samsvar ved grensen. Resultatet for tilbakemelding delte seg etter studiedesign. I milepælsstudien, der studentene så tilbakemelding fra faglærer, medstudenter og AI side om side, leste de AI-tilbakemeldingen minst (57 % mot 94 % for faglærer) og vurderte den som signifikant mindre nyttig (4,38 mot 5,72 på en 7-punktsskala). I sensorsamsvarsstudien, der hver student fikk enten menneske-pluss-AI eller kun menneske uten å vite hvilken, ble ingen signifikant nytteforskjell påvist (p = 0,45); casestudien slår fast at dette ikke er bevis på likeverdighet. Når studentene kunne se kilden, foretrakk de mennesket; når de ikke kunne se den, ble ingen forskjell påvist. De samme forskerne fant også at sensorsamsvaret falt fra ICC 0,874 til 0,608 med den tidlige prototypen, og det står på kortene nedenfor i stedet for å bli utelatt.
Universitetet i Bergen
R² = 0.85
mot faglæreren
Det publiserte ankeret: 12 gjennomføringer av den avsluttende kliniske eksamenen, 889 kandidat-eksamen-par, vurdert blindt mot samme matrise.
Les studien →Universitetet i Bergen
R² = 0.68
milepælsstudien, målt av UiB-forskere
Ikke vår egen måling. De samme forskerne fant at AI-assistanse senket samsvaret mellom sensorer fra ICC 0.87 til 0.61 på den tidlige prototypen, tatt med her fordi det er en del av grunnlaget. På tilbakemelding foretrakk studentene som kunne se kilden, mennesket.
Les hele funnene →NHH, Norges Handelshøyskole
—
Bestått/ikke-bestått-screening på lange analytiske innleveringer. Tall per kull er ikke publisert ennå — oppsummeringen per pilot går til emneansvarlig.
Les pilotens omfang →Les hele metoden → — hva R² måler i vurdering, hvordan grunnlinjen mellom sensorer ble produsert, og hele utregningen bak målrettet vurdering.
SPØRSMÅL OG KASUS VURDERT PÅ TVERS AV DISTRIBUSJONER
…og det vokser hver uke.
20+ emner
I PRODUKSJON OG VERIFISERT
På tvers av medisin, matematikk, finans og mer.
12 eksamener · 889 kandidater
UIB MEDICINE-PILOT · MÅLRETTET MANUELL VURDERING
~43 700 AI-mot-sensor deloppgavesammenligninger via den målrettede manuelle vurderingsløkken.