«Copilot seier at …»
Eg skreiv nyleg om at den viktigaste KI-kompetansen framover kanskje ikkje er å bruke KI, men å vurdere kvaliteten på det den leverer. Microsoft har no levert ein funksjon som gjer akkurat den vurderinga lettare – og samstundes vanskelegare.
To nye kapabilitetar i Researcher
Researcher i Microsoft 365 Copilot har fått to nye kapabilitetar i Frontier-programmet:
- Critique – GPT skriv utkast, Claude vurderer presisjon, kjeldebruk og logikk før rapporten når brukaren. Redaktørprinsippet, bygd inn i sjølve genereringsflyten. Critique er no standard når du vel «Auto».
- Council – GPT og Claude køyrer parallelt, ein tredje judge-modell summerer kvar dei er einige, kvar dei skiljer lag, og kva kvar modell bidreg med unikt.
Microsoft seier sjølv at Critique scorer 13,8 % høgare enn beste single-modell på DRACO-benchmarken. Det er imponerande tal. Den eigentlege endringa ligg ein annan stad.
Kvifor dette er viktig
Tre ting eg meiner gjer dette viktig:
- Den tradisjonelle KI-styringa har handla om å måle éin modell. Critique og Council flyttar fokus til prosessen rundt modellen. Det er der ansvarleg KI eigentleg burde ha vore heile tida.
- For brukaren er signalverdien høgare enn presisjonen. Når Council viser at to modellar er ueinige, sender det ein melding som er vanskeleg å få fram i opplæring: KI-svar er ikkje fasit. Det er kanskje den beste pedagogiske gevinsten Microsoft har levert på lenge.
- Men her er fallgruva mange kjem til å gå i: konsensus blir lest som sanning. To modellar som er einige, kan vere einige om same feil. Council viser variasjon, ikkje korrektheit.
Kostnaden ved fleire modellar
Det er òg ein kostnad å vere klar over: Critique ligg cirka 20 % over single-modell, Council rundt 2,5 gonger. Det betyr at du må bestemme kva spørsmål som faktisk fortener fleire modellar – og kva som skal kvile på éin.
Den største praktiske konsekvensen er kanskje ikkje teknisk i det heile: «KI som kollega» kjem til å innebere «KI som diskusjonspartnar med andre KI-ar». Det er ein ny medarbeidardynamikk å styre. Er du klar til å la Claude vurdere det GPT skreiv – eller motsett?
