«Copilot seier at …»

Eg skreiv nyleg om at den viktigaste KI-kompetansen framover kanskje ikkje er å bruke KI, men å vurdere kvaliteten på det den leverer. Microsoft har no levert ein funksjon som gjer akkurat den vurderinga lettare – og samstundes vanskelegare.

To nye kapabilitetar i Researcher

Researcher i Microsoft 365 Copilot har fått to nye kapabilitetar i Frontier-programmet:

  • Critique – GPT skriv utkast, Claude vurderer presisjon, kjeldebruk og logikk før rapporten når brukaren. Redaktørprinsippet, bygd inn i sjølve genereringsflyten. Critique er no standard når du vel «Auto».
  • Council – GPT og Claude køyrer parallelt, ein tredje judge-modell summerer kvar dei er einige, kvar dei skiljer lag, og kva kvar modell bidreg med unikt.

Microsoft seier sjølv at Critique scorer 13,8 % høgare enn beste single-modell på DRACO-benchmarken. Det er imponerande tal. Den eigentlege endringa ligg ein annan stad.

Kvifor dette er viktig

Tre ting eg meiner gjer dette viktig:

  • Den tradisjonelle KI-styringa har handla om å måle éin modell. Critique og Council flyttar fokus til prosessen rundt modellen. Det er der ansvarleg KI eigentleg burde ha vore heile tida.
  • For brukaren er signalverdien høgare enn presisjonen. Når Council viser at to modellar er ueinige, sender det ein melding som er vanskeleg å få fram i opplæring: KI-svar er ikkje fasit. Det er kanskje den beste pedagogiske gevinsten Microsoft har levert på lenge.
  • Men her er fallgruva mange kjem til å gå i: konsensus blir lest som sanning. To modellar som er einige, kan vere einige om same feil. Council viser variasjon, ikkje korrektheit.

Kostnaden ved fleire modellar

Det er òg ein kostnad å vere klar over: Critique ligg cirka 20 % over single-modell, Council rundt 2,5 gonger. Det betyr at du må bestemme kva spørsmål som faktisk fortener fleire modellar – og kva som skal kvile på éin.

Den største praktiske konsekvensen er kanskje ikkje teknisk i det heile: «KI som kollega» kjem til å innebere «KI som diskusjonspartnar med andre KI-ar». Det er ein ny medarbeidardynamikk å styre. Er du klar til å la Claude vurdere det GPT skreiv – eller motsett?