Norsk AI-barometer / Metode

Slik er barometeret bygget.

Denne siden er for deg som vil forstå eller etterprøve tallene. Her står hvorfor vi tester, hvilke prinsipper testen bygger på, nøyaktig hvordan svarene får poeng og hva tallene ikke kan brukes til.

Bakgrunn

Hvorfor et eget norsk barometer?

De kjente testene av språkmodeller måler mest engelsk, programmering, matematikk og kunnskapsspørsmål. De sier lite om det norske bedrifter faktisk bruker AI til: å lese en faktura, svare en kunde, oppsummere et møte eller skrive på nynorsk.

Når Aprex bygger AI-løsninger, må vi velge modell for hver oppgave. Da trenger vi tall på norsk arbeid, ikke på engelske eksamensoppgaver. Barometeret er de samme målingene gjort systematisk og publisert, så andre kan bruke dem og etterprøve dem.

Modellene endrer seg fra måned til måned, og nye kommer stadig. Derfor kjøres testen hver uke med de samme oppgavene, slik at du ser hvordan modellene utvikler seg over tid.

Fundament

Åtte prinsipper testen bygger på.

  1. 01

    Arbeid, ikke kunnskap

    Oppgavene ligner det ansatte gjør med dokumenter, e-poster og referater, og hver har et svar som kan sjekkes.

  2. 02

    Fasit før kjøring

    Fasit og poengregler skrives før noen modell har svart, og de endres ikke etter at vi har sett resultatene.

  3. 03

    Like betingelser

    Samme instruks, samme innstillinger og samme tjeneste for alle modeller.

  4. 04

    Skjult testsett

    De fleste oppgavene publiseres ikke, så de ikke kan havne i treningsdata og gi noen modeller et forsprang.

  5. 05

    Automatikk først

    Poeng settes med faste regler der det går. Dommermodeller brukes bare der kvalitet må vurderes, og teller høyst 40 prosent.

  6. 06

    Usikkerhet vises

    48 oppgaver viser retning, ikke svar ned på desimalen. Konfidensintervallet viser hvor sikre forskjellene er.

  7. 07

    Kostnad for seg

    Poeng, kostnad og svartid vises ved siden av hverandre og blandes aldri sammen.

  8. 08

    Menneske til slutt

    Ingen måling publiseres før en person har gått gjennom avvikene.

Testsettet

48 oppgaver, seks typer arbeid.

Hver av de seks typene har åtte oppgaver. To per type blir offentlige med fasit, så alle kan se hva modellene får. Seks er publisert nå, og resten kommer når testsettet er komplett. De øvrige 36 holdes skjult.

TyperDokumentuttrekk, Kundesvar, Oppsummering, Regelverk, Klassifisering, Nynorsk
InnholdFiktive firma, personer og dokumenter, eller offentlige kilder. Ingen kundedata, heller ikke anonymisert.
SpråkNynorsktypen er skrevet på nynorsk. Minst én oppgave i hver av de andre typene har nynorsk innhold.
RegelverkFasit kontrolleres mot lovteksten på Lovdata før hver ny versjon av testsettet.
Hver oppgave harOppgavetekst, fasit, et riktig svar med andre ord, et bevisst feil svar og poengregler.
KontrollFasit og det omformulerte svaret må få minst 95 poeng, og det feile svaret høyst 40, før oppgaven kan brukes.
Kjøreforhold

Samme betingelser for alle.

TjenesteVercel AI Gateway, én felles tilgang til alle leverandørene. Eksakt modell-ID logges.
Instruks«Du løser en arbeidsoppgave for en norsk bedrift. Følg instruksjonene i oppgaven nøyaktig, og svar bare med det oppgaven ber om.»
Temperatur0 der modellen støtter det
ResonneringLeverandørens standardnivå. Nivået logges.
Verktøy og nettsøkAv
Maks svarlengde2000 tokens
Tidsgrense120 sekunder
Gjentakelser3 per oppgave
FeilVed nettverksfeil eller overbelastning prøver vi én gang til. Feiler det igjen, gir svaret 0 poeng og telles som feil.
Skjulte oppgaverSendes bare til leverandører som ikke trener modeller på dataene.
Poengregler

Slik får et svar poeng.

Feltkontroll

Brukes på dokumentuttrekk og klassifisering. Svaret må inneholde et JSON-objekt. Hvert felt sammenlignes med fasit etter normalisering: datoer gjøres om til ÅÅÅÅ-MM-DD, beløp gjøres om til tall slik at «15 625,00» og «kr 15 625,-» teller likt, KID og andre sifferfelt sammenlignes uten mellomrom, og kategorier sammenlignes uten forskjell på store og små bokstaver. Poengene er andelen riktige felt. Uten JSON blir det 0 poeng.

Sjekkliste

Brukes på kundesvar, oppsummering, regelverk og nynorsk. Svaret får poeng for hvert vektede punkt som må være med, og hvert punkt kan godtas i flere former, for eksempel «29. september», «29.09» og «29/9». Deretter trekkes det for:

  • forbudte påstander, som løfter om kompensasjon som ikke er avtalt: trekket står i hver oppgave
  • svar over ordgrensen: −20
  • ord fra feil målform: −10 per ord, høyst −50

Dommere

Brukes i tillegg på kundesvar, oppsummering og nynorsk. To modeller fra andre leverandører enn modellen som testes, vurderer svaret uten å vite hvem som skrev det. De gir 0–5 poeng per kriterium i en fast rubrikk. Aktuelle dommere er Claude Opus 5.5, GPT-6 Sol, Gemini 3.1 Pro. Oppgavepoengen blir da:

poeng = sjekkliste × (1 − 0,4) + (dommersnitt ÷ 5 × 100) × 0,4

Dommerinstruksen er lik i alle kjøringer:

Du vurderer et svar på en norsk arbeidsoppgave. Du får oppgaven, et fasitsvar og svaret som skal vurderes. Du vet ikke hvilken modell som skrev svaret. Gi 0–5 poeng per kriterium: 0 = mangler helt, 3 = brukbart med tydelige svakheter, 5 = like godt som fasit eller bedre. Svar bare med JSON på formen {"kriterier": [{"id": "...", "poeng": 0, "begrunnelse": "én setning"}]}.

Før første publisering vurderer vi tolv svar selv og sammenligner med dommerne. Avviker de med mer enn ett poeng i snitt, justeres rubrikken før tallene publiseres.

Fra oppgave til totalpoeng

Slik regnes tallene i tabellen.

OppgavepoengSnittet av de tre kjøringene
TypepoengSnittet av de åtte oppgavene i typen
TotalpoengSnittet av de seks typene. Alle typer teller likt.
KonfidensintervallVi trekker oppgavene på nytt med tilbakelegging 10 000 ganger og regner ut totalpoengen hver gang. Intervallet er de midterste 95 prosentene. Modeller med overlappende intervall omtales som like gode.
StabilitetSpredningen mellom de tre kjøringene
KostnadFaktisk pris per kall, inkludert skjult resonnering, regnet om til 100 oppgaver. Oppgis i dollar uten mva, fordi leverandørene fakturerer i dollar.
SvartidMedian tid fra kallet sendes til hele svaret er mottatt
Kvalitetskontroll

Ingenting publiseres automatisk.

Før kjøringSelvtesten av alle oppgaver og poengregler må bestå.
FullstendighetAlle modeller har svart på alle oppgaver i alle tre kjøringene.
FeilrateUnder 5 prosent per modell
AvvikslisteSvar der dommerne er uenige med 2 poeng eller mer, modeller som har endret seg mer enn 15 poeng siden forrige uke, og 10 prosent tilfeldig valgte svar
GodkjenningEn person i Aprex går gjennom avvikslisten og godkjenner målingen i endringsloggen.
NettsidenSiden bygges ikke hvis en måling har ugyldige tall, mangler en type arbeid eller har for høy feilrate.
Versjoner

Tall sammenlignes bare innenfor samme testsett.

Testsettet har versjonsnummer. Vi lager høyst to nye versjoner i året, og i uken en ny versjon tas i bruk, kjører vi både den gamle og den nye, så trenden kan kobles sammen. Endringer i oppgaver, poengregler, dommere og modelliste føres i endringsloggen på barometersiden.

Data

Last ned og bruk tallene.

Hver måling publiseres som en CSV-fil med én rad per modell, og barometersiden har strukturerte data (schema.org Dataset). Tallene kan brukes fritt med Aprex som kilde og lenke til barometeret.

KolonneInnhold
weekMålingens uke, for eksempel 2026-U41
model_idModell-ID i AI Gateway
modelModellnavn
providerLeverandør
tiertopp eller rimelig
totalTotalpoeng 0–100
ci_lowNedre grense, 95 % konfidensintervall
ci_highØvre grense, 95 % konfidensintervall
dokumentuttrekkTypepoeng 0–100
kundesvarTypepoeng 0–100
oppsummeringTypepoeng 0–100
regelverkTypepoeng 0–100
klassifiseringTypepoeng 0–100
nynorskTypepoeng 0–100
cost_per_100_usdMålt kostnad for 100 oppgaver, USD uten mva
median_latency_msMedian svartid i millisekunder
error_rateAndel kall som feilet etter ett nytt forsøk, 0–1
Begrensninger

Hva barometeret ikke kan si.

  • Resultatene gjelder disse 48 oppgavene. En modell kan være sterkere eller svakere på deres egne oppgaver.
  • Dommermodeller kan ta feil og foretrekke en bestemt stil. Derfor teller de høyst 40 prosent, kommer fra andre leverandører og kontrolleres mot menneskelig vurdering.
  • Kjøring via API med faste innstillinger er ikke det samme som å bruke ChatGPT, Claude, Gemini eller Copilot i nettleseren, der leverandøren legger til egne instrukser og verktøy.
  • Modellene oppdateres ofte, noen ganger uten ny modell-ID. Et resultat gjelder uken det ble målt.
  • 48 oppgaver er nok til å se tydelige forskjeller, men ikke små. Se på konfidensintervallet før du konkluderer.
  • Temperatur 0 gjør svarene stabile, men ikke alltid helt like. Derfor kjøres hver oppgave tre ganger.
FAQ

Tekniske spørsmål

Hvorfor temperatur 0?
Det gir de mest stabile svarene, så forskjellene skyldes modellen og ikke tilfeldigheter. Noen resonneringsmodeller lar ikke temperaturen endres. Da brukes standardverdien, og det logges.
Hvorfor tre kjøringer per oppgave?
Svarene varierer litt selv med temperatur 0. Tre kjøringer gir et sikrere snitt og viser hvor stabil hver modell er.
Hvorfor ikke la en AI vurdere alle svarene?
AI-dommere er raske, men kan ta feil og foretrekke sin egen stil. Faste regler kan etterprøves av alle. Derfor brukes dommere bare der kvalitet må vurderes, og de teller høyst 40 prosent.
Hvorfor er nettsøk slått av?
Vi måler hva modellen selv gjør med opplysningene den får. Med nettsøk ville resultatene avhengt av søkemotor, tidspunkt og hvilke sider som finnes.
Hvordan behandles resonneringsmodeller?
De kjøres på leverandørens standardnivå for resonnering. Den skjulte resonneringen tas med i både kostnad og svartid.
Kan jeg gjenta testen selv?
Ja, med de offentlige oppgavene. Oppgavetekst, fasit og hele metoden ligger åpent, så du kan kjøre dem mot de samme modellene og sammenligne. De skjulte oppgavene deles ikke.
Jeg har funnet en feil. Hva gjør jeg?
Skriv til post@aprex.no. Vi retter feil i oppgaver eller metode og fører endringen i endringsloggen.
Uavhengighet

Ingen leverandør påvirker tallene

Ingen leverandør betaler for eller påvirker barometeret, og ingen får se resultatene før de publiseres. Aprex bruker selv modeller fra flere av leverandørene i løsninger vi bygger.

Spørsmål om metoden?

Skriv til oss hvis du vil vite mer, har forslag til oppgaver eller har funnet noe som bør rettes.

Send e-post til Aprex →