En kunnskapsbase er bedriftens egne dokumenter gjort om til et sted du kan stille spørsmål. Moderne RAG (retrieval-augmented generation) betyr at systemet slår opp i dokumentene før modellen svarer, med søk som leter etter både ord og mening. En agent kommer inn når spørsmålet er for vanskelig for ett oppslag.
Du har mapper med rutiner, avtaler, manualer og referater, og vil at folk skal kunne spørre dem og få svar de kan stole på. Det går an. Men de fleste første forsøk skuffer, og det er sjelden modellen sin skyld. Her er hvordan jeg ville gått fram, i hvilken rekkefølge, og hva du bør kreve før du kaller det en løsning.
Min antakelse er at det er fire steder en kunnskapsbase går galt: kildene, oppdelingen, søket og at ingen måler. Det er en antakelse og ikke en måling, og jeg har ikke tall på hvor ofte hver av dem er årsaken. For søkedelen finnes det derimot tall. Anthropic målte hvor ofte et vanlig vektorsøk bommet, altså hvor stor andel av de relevante bitene som ikke kom med blant de 20 beste treffene. Bommen gikk fra 5,7 til 1,9 prosent da de la en kort beskrivelse foran hver bit, la til ordsøk og sorterte treffene på nytt. Det er målt på søket alene, før noen modell har skrevet et svar.
Tallene er fra Anthropics egne datasett, så dine blir andre. Poenget er hvor forbedringen kom: i kildene og søket, ikke i modellen som svarer. Hvordan de tre grepene virker står i RAG i praksis. Her handler det om rekkefølgen, og om det som må på plass før dem.
Rekkefølgen følger hva som gir mest først. Den betyr ikke at noe kan vente: lag 5, målingen, starter du på i uke én, for det er den som forteller deg om lag 2 til 4 hjelper.
Hvem eier dokumentet, når ble det sist oppdatert, hvem har lov å lese det, og sier to dokumenter motsatte ting? Det siste er viktigst. Finner søket to svar som er uenige, må modellen velge, og den velger uten å si fra. I en industribedrift er det typisk manualer, prosedyrer og avtaler i flere versjoner. Ta bort kopier, merk resten med status og dato, og begynn med ti kilder du kjenner godt.
En bit tatt ut av et dokument har ofte mistet det som gjorde den forståelig. «Fristen er 14 dager» sier ingenting uten å vite hvilken regel den hører til. Løsningen heter contextual retrieval: en modell skriver en kort beskrivelse av hva biten er en del av, og den legges foran biten før den gjøres søkbar. Anthropic oppgir 50 til 100 token per beskrivelse, og i deres eksempelregning kostet det 1,02 dollar per million token dokumenttekst, med mellomlagring av prompten. Du gjør det én gang, og på nytt når dokumentene endres.
Søk på mening finner det som ligner. Søk på ord finner det som står der: produktkoder, paragrafnumre og navn. Hybridsøk kjører begge samtidig og slår rangeringene sammen. Omrangering (reranking) er at en egen modell leser de beste treffene, i Anthropics test de 150 første, og sorterer dem på nytt, så de 20 som sendes videre er de beste. Det koster ventetid i hvert søk, så du avgjør selv hvor mange du omrangerer.
Enkelt søk gjør ett oppslag, og noen spørsmål trenger flere. Da lar du en agent styre søket: den skriver et søk, leser treffene, ser hva som mangler og søker på nytt. På engelsk kalles det agentic retrieval. Dette er laget som koster mest, så det kommer først når testsettet viser hvilke spørsmål som trenger det. Mer om det lenger ned.
Femti ekte spørsmål fra dem som skal bruke systemet, med riktig svar og dokumentet svaret står i. Ta med spørsmål som ikke har svar i dokumentene, for de viser om systemet innrømmer det. Mål to ting hver for seg: kom riktig bit med i søket, og holdt svaret seg til kildene? Femti er mitt utgangspunkt og ikke en målt grense. Har du ikke femti ennå, start med tretti som i RAG i praksis, og bygg ut til femti før du avgjør noe. Regnestykket er enkelt: med femti spørsmål er hvert spørsmål to prosentpoeng, så en endring på ett svar kan være tilfeldig. Kjør settet på nytt hver gang du endrer noe. Slik lager du spørsmålene: RAG i praksis.
Tre ting. Tilgang etter brukerens egne rettigheter, så søket bare finner det den som spør har lov å lese. Kilde i hvert svar, så noen kan åpne den og sjekke. Og en eier for hver mappe, med en regel for hva som skjer med søkeindeksen når et dokument endres. Microsoft skriver at Copilot bare viser data brukeren har minst lesetilgang til, og at rettighetene dine derfor må være i orden først. OWASP anbefaler tilgangsstyring som følger rettighetene, strengt skilte datasett og kontroll av dokumenter før de legges inn: skjult tekst, for eksempel hvit på hvit, kan prøve å styre systemet.
Lag 1 er det kjedeligste og det viktigste. Her er en prompt som gir deg et første inntrykk av hvor dårlig det står til, med to dokumenter om samme tema.
Her er to dokumenter om samme tema. Dokument A: [tittel, dato og tekst] Dokument B: [tittel, dato og tekst] Finn alt der de sier ulike ting om det samme. For hvert funn: sitat fra A, sitat fra B, hvilket som er nyest, og hvem som bør avgjøre hvilket som gjelder. Finner du ingen motsigelser, skriv det. Ikke gjett.
Er materialet lite, kan du legge alt rett i spørsmålet og droppe søket. Anthropic skrev i september 2024 at grensen gikk ved rundt 200 000 token, omtrent 500 sider. Den grensen har flyttet seg. Flere av dagens Claude-modeller har et kontekstvindu på 1 million token, og Claude-dokumentasjonen sier at lange prompter som hovedregel koster det samme per token som korte (oktober 2026). Med dagens tokenizer er en million token omtrent 555 000 ord på engelsk, altså rundt 1 850 sider med 300 ord per side.
Men et stort vindu er ikke det samme som et godt svar. Dokumentasjonen advarer om at nøyaktigheten synker når mengden vokser, og kaller det context rot. Alt du sender med, må modellen lese hver gang, og du betaler og venter for det. Mellomlagring hjelper, men fjerner det ikke. Det finnes derfor ikke ett tall for når du bør bytte til søk. Legg hele mappen i spørsmålet, kjør testsettet, og se hva som skjer. Er svarene gode nok, trenger du ikke mer. Vet du dessuten hvilket objekt eller hvilken kunde spørsmålet gjelder, er et oppslag enklere enn både søk og stort vindu.
Ta et spørsmål der svaret ligger i to dokumenter. Slike spørsmål er der enkel RAG og agentisk søk skiller lag.
Enkel RAG gjør ett søk med spørsmålet og tar de beste treffene. Det er raskt og forutsigbart, og det holder til de fleste spørsmål der svaret står i ett dokument. Men det kan ikke se at noe mangler. Treffene var gode, og svaret ble likevel ufullstendig. En agent kan lese første treff, oppdage henvisningen og søke igjen.
Enkel RAG er å få utlevert de ti øverste arkene fra bunken. Agenten er en saksbehandler som slår opp i en mappe, ser henvisningen til en annen og går dit.
Hvert ekstra søk er et modellkall til, og hvert kall er tid og token. Anthropic oppgir at agenter i deres egne målinger brukte omtrent fire ganger så mange token som en vanlig chat, og systemer med flere agenter omtrent femten ganger så mange. Det gjelder deres forskningsagent som leter på nettet, ikke spørsmål mot bedriftens dokumenter, og jeg har ikke funnet et tilsvarende tall for dokumentspørsmål. Mål selv. Microsoft skriver at agentisk søk i Azure AI Search gir mer ventetid enn ett enkelt søk, men håndterer spørsmål med flere ledd, og at det faktureres per token og ikke per søk. Kostnaden varierer da med hvor mye som letes.
Hva kilden faktisk sier. Anthropics tall gjelder søket alene på deres egne datasett, ikke svaret og ikke dine dokumenter. Token-tallene for agenter gjelder en forskningsagent på nettet, ikke spørsmål mot dokumenter.
Alle forbedringstall fra leverandører, også Anthropics, er målt på deres egne data. De er veiledende. Du vet ikke hva du får før du har kjørt dine egne femti spørsmål.
Anthropic beskriver at Claude Code bruker en blanding: noen filer legges inn fra start, resten finner agenten selv med søk underveis. Samme tanke passer for en bedrift. Det som alltid trengs, legges inn. Resten søkes.
Et presisjonspunkt, for ordet agent brukes løst. Microsofts «agentic retrieval» er strengt tatt en fast arbeidsflyt: en modell planlegger delspørsmål, og systemet kjører dem. I en agent, slik begrepssiden bruker ordet, bestemmer modellen selv hvor mange runder den tar. Spør derfor leverandøren hvem som bestemmer neste steg. Og husk at LLM-basert planlegging i Azure AI Search per 16. september 2026 er i forhåndsvisning (preview), som Microsoft ikke anbefaler til produksjon.
Tidene er mine grove anslag og ikke målt. De er tenkt for en bedrift som starter fra null med noen få personer.
Velg ti kilder du kjenner godt, og rydd dem: eier, dato, ingen kopier. Sett opp enkelt søk, i et ferdig verktøy eller en liten selvbygd løsning. Skriv femti spørsmål med fasit, noen uten svar, og kjør dem. Nå har du et tall å forbedre.
Legg til én ting om gangen: beskrivelse foran hver bit, hybridsøk, omrangering. Kjør testsettet etter hver endring. Koble til bedriftens egne rettigheter, få kilde i hvert svar og ta inn flere mapper.
Se i testsettet hvilke spørsmål enkelt søk ikke klarer, og la en agent ta dem. Sett opp drift: en eier per kilde, oppdatering av søkeindeksen, logg, og kostnad og svartid per spørsmål. Kjør testsettet hver måned.
Skal du godkjenne en pilot eller kjøpe en løsning, kan du be om dette. Du trenger ikke kunne teknikken for å se om det finnes.
Tilgang er det som gjør et feil svar til et brudd. Finner søket et dokument noen ikke skulle sett, er det et konfidensialitetsbrudd og ikke bare et feil svar. Derfor er tilgangsstyring et styrespørsmål.
Og ett spørsmål som ikke står i listen: hvem svarer når et svar viser seg å være feil? Systemet gir forslag, og noen i bedriften må eie det som brukes til å avgjøre noe. Flere spørsmål å stille om tilgang og kontroll står i La AI snakke med bedriftens data, og om kostnad i Hva koster det.
Start med ti kilder og femti spørsmål. Resten bygger du i den rekkefølgen testsettet viser at du trenger det.
Oppdatert oktober 2026. Kilder: Anthropic, «Introducing Contextual Retrieval» (19. september 2024: grensen på 200 000 token, 5,7 til 1,9 prosent, 150 treff til omrangering og 20 videre, 50 til 100 token per beskrivelse, 1,02 dollar per million token). Anthropic, «Effective context engineering for AI agents» (29. september 2025: Claude Code og blandingen av å laste inn og søke). Anthropic, «How we built our multi-agent research system» (13. juni 2025: fire og femten ganger så mange token). Claude-dokumentasjonen, Context windows (lest 8. oktober 2026: 1 million token, context rot). Microsoft Learn, Agentic retrieval overview (side datert 16. september 2026) og Hybrid search overview (31. august 2026). Microsoft Learn, Data, Privacy, and Security for Microsoft Copilot (lest 8. oktober 2026). OWASP, LLM08:2025 Vector and Embedding Weaknesses. Forbehold: Anthropics søketall er målt på deres egne datasett. Token-tallene for agenter gjelder en forskningsagent på nettet og er ikke overført til dokumentspørsmål. Eksempelet i den andre figuren er konstruert. Antallet spørsmål i testsettet og tidsanslagene i veien i tre steg er mine og ikke målt. Jeg har ikke selv målt enkel RAG mot agentisk søk på et reelt dokumentsett. Produktfunksjoner og priser endrer seg raskt.