Ingen leverandør påvirker tallene
Ingen leverandør betaler for eller påvirker barometeret, og ingen får se resultatene før de publiseres. Aprex bruker selv modeller fra flere av leverandørene i løsninger vi bygger.
Oppgavene ligner det ansatte gjør med dokumenter, e-poster og referater, og hver har et svar som kan sjekkes.
Fasit og poengregler skrives før noen modell har svart, og de endres ikke etter at vi har sett resultatene.
Samme instruks, samme innstillinger og samme tjeneste for alle modeller.
De fleste oppgavene publiseres ikke, så de ikke kan havne i treningsdata og gi noen modeller et forsprang.
Poeng settes med faste regler der det går. Dommermodeller brukes bare der kvalitet må vurderes, og teller høyst 40 prosent.
48 oppgaver viser retning, ikke svar ned på desimalen. Konfidensintervallet viser hvor sikre forskjellene er.
Poeng, kostnad og svartid vises ved siden av hverandre og blandes aldri sammen.
Ingen måling publiseres før en person har gått gjennom avvikene.
Hver av de seks typene har åtte oppgaver. To per type blir offentlige med fasit, så alle kan se hva modellene får. Seks er publisert nå, og resten kommer når testsettet er komplett. De øvrige 36 holdes skjult.
| Typer | Dokumentuttrekk, Kundesvar, Oppsummering, Regelverk, Klassifisering, Nynorsk |
|---|---|
| Innhold | Fiktive firma, personer og dokumenter, eller offentlige kilder. Ingen kundedata, heller ikke anonymisert. |
| Språk | Nynorsktypen er skrevet på nynorsk. Minst én oppgave i hver av de andre typene har nynorsk innhold. |
| Regelverk | Fasit kontrolleres mot lovteksten på Lovdata før hver ny versjon av testsettet. |
| Hver oppgave har | Oppgavetekst, fasit, et riktig svar med andre ord, et bevisst feil svar og poengregler. |
| Kontroll | Fasit og det omformulerte svaret må få minst 95 poeng, og det feile svaret høyst 40, før oppgaven kan brukes. |
| Tjeneste | Vercel AI Gateway, én felles tilgang til alle leverandørene. Eksakt modell-ID logges. |
|---|---|
| Instruks | «Du løser en arbeidsoppgave for en norsk bedrift. Følg instruksjonene i oppgaven nøyaktig, og svar bare med det oppgaven ber om.» |
| Temperatur | 0 der modellen støtter det |
| Resonnering | Leverandørens standardnivå. Nivået logges. |
| Verktøy og nettsøk | Av |
| Maks svarlengde | 2000 tokens |
| Tidsgrense | 120 sekunder |
| Gjentakelser | 3 per oppgave |
| Feil | Ved nettverksfeil eller overbelastning prøver vi én gang til. Feiler det igjen, gir svaret 0 poeng og telles som feil. |
| Skjulte oppgaver | Sendes bare til leverandører som ikke trener modeller på dataene. |
| Oppgavepoeng | Snittet av de tre kjøringene |
|---|---|
| Typepoeng | Snittet av de åtte oppgavene i typen |
| Totalpoeng | Snittet av de seks typene. Alle typer teller likt. |
| Konfidensintervall | Vi trekker oppgavene på nytt med tilbakelegging 10 000 ganger og regner ut totalpoengen hver gang. Intervallet er de midterste 95 prosentene. Modeller med overlappende intervall omtales som like gode. |
| Stabilitet | Spredningen mellom de tre kjøringene |
| Kostnad | Faktisk pris per kall, inkludert skjult resonnering, regnet om til 100 oppgaver. Oppgis i dollar uten mva, fordi leverandørene fakturerer i dollar. |
| Svartid | Median tid fra kallet sendes til hele svaret er mottatt |
| Før kjøring | Selvtesten av alle oppgaver og poengregler må bestå. |
|---|---|
| Fullstendighet | Alle modeller har svart på alle oppgaver i alle tre kjøringene. |
| Feilrate | Under 5 prosent per modell |
| Avviksliste | Svar der dommerne er uenige med 2 poeng eller mer, modeller som har endret seg mer enn 15 poeng siden forrige uke, og 10 prosent tilfeldig valgte svar |
| Godkjenning | En person i Aprex går gjennom avvikslisten og godkjenner målingen i endringsloggen. |
| Nettsiden | Siden bygges ikke hvis en måling har ugyldige tall, mangler en type arbeid eller har for høy feilrate. |
Hver måling publiseres som en CSV-fil med én rad per modell, og barometersiden har strukturerte data (schema.org Dataset). Tallene kan brukes fritt med Aprex som kilde og lenke til barometeret.
| Kolonne | Innhold |
|---|---|
week | Målingens uke, for eksempel 2026-U41 |
model_id | Modell-ID i AI Gateway |
model | Modellnavn |
provider | Leverandør |
tier | topp eller rimelig |
total | Totalpoeng 0–100 |
ci_low | Nedre grense, 95 % konfidensintervall |
ci_high | Øvre grense, 95 % konfidensintervall |
dokumentuttrekk | Typepoeng 0–100 |
kundesvar | Typepoeng 0–100 |
oppsummering | Typepoeng 0–100 |
regelverk | Typepoeng 0–100 |
klassifisering | Typepoeng 0–100 |
nynorsk | Typepoeng 0–100 |
cost_per_100_usd | Målt kostnad for 100 oppgaver, USD uten mva |
median_latency_ms | Median svartid i millisekunder |
error_rate | Andel kall som feilet etter ett nytt forsøk, 0–1 |
Ingen leverandør betaler for eller påvirker barometeret, og ingen får se resultatene før de publiseres. Aprex bruker selv modeller fra flere av leverandørene i løsninger vi bygger.
Skriv til oss hvis du vil vite mer, har forslag til oppgaver eller har funnet noe som bør rettes.
Send e-post til Aprex →