Slik ville jeg angrepet kunnskapsbaser

Du vil at folk skal kunne spørre bedriftens dokumenter. Modellen er sjelden det som svikter. Her er lagene jeg ville bygd, i den rekkefølgen jeg ville bygd dem, og hva du bør kreve før du kaller det en løsning.

Magnus Gribbestad 8. oktober 2026 9 min
Figur · seks lag, nedenfra og opp
Seks lag i en kunnskapsbase Seks lag bygges oppå hverandre. Nederst rydder du kildene, så deler du opp med kontekst, så søker du med både ord og mening og sorterer treffene på nytt. Deretter lar du en agent lete på vanskelige spørsmål, du måler med et testsett og fasit, og du styrer tilgang og eierskap. Øverst står svar du kan sjekke. 1 Rydd kildene Fikser gamle og motstridende dokumenter 2 Del opp med kontekst Fikser biter som har mistet sammenhengen 3 Hybridsøk og omrangering Fikser at riktig bit ikke ligger øverst 4 La en agent lete Fikser spørsmål som trenger flere kilder 5 Mål med fasit Fikser at ingen vet om det virker 6 Styr Fikser hvem som ser hva, og hvem som eier Svar du kan sjekke
  1. Rydd kildene først: eier, dato, tilgang og dokumenter som sier motsatte ting. Her ligger det meste av jobben.
  2. Del dokumentene opp, og gi hver bit en kort beskrivelse av hva den er en del av.
  3. Søk på både ord og mening, og sorter treffene på nytt, så riktig bit havner øverst.
  4. Er spørsmålet vanskelig, lar du en agent søke flere ganger, med nye spørsmål underveis.
  5. Mål med femti ekte spørsmål og fasit. Det er dette laget du starter på i uke én, ikke til slutt.
  6. Styr: brukerens egne rettigheter, kilde i hvert svar og en eier for hver mappe.
  7. Da får du svar du kan sjekke, og tall som viser om de blir bedre eller dårligere.
Kort sagt

En kunnskapsbase er bedriftens egne dokumenter gjort om til et sted du kan stille spørsmål. Moderne RAG (retrieval-augmented generation) betyr at systemet slår opp i dokumentene før modellen svarer, med søk som leter etter både ord og mening. En agent kommer inn når spørsmålet er for vanskelig for ett oppslag.

Du har mapper med rutiner, avtaler, manualer og referater, og vil at folk skal kunne spørre dem og få svar de kan stole på. Det går an. Men de fleste første forsøk skuffer, og det er sjelden modellen sin skyld. Her er hvordan jeg ville gått fram, i hvilken rekkefølge, og hva du bør kreve før du kaller det en løsning.

Feilen ligger sjelden i modellen

Min antakelse er at det er fire steder en kunnskapsbase går galt: kildene, oppdelingen, søket og at ingen måler. Det er en antakelse og ikke en måling, og jeg har ikke tall på hvor ofte hver av dem er årsaken. For søkedelen finnes det derimot tall. Anthropic målte hvor ofte et vanlig vektorsøk bommet, altså hvor stor andel av de relevante bitene som ikke kom med blant de 20 beste treffene. Bommen gikk fra 5,7 til 1,9 prosent da de la en kort beskrivelse foran hver bit, la til ordsøk og sorterte treffene på nytt. Det er målt på søket alene, før noen modell har skrevet et svar.

Tallene er fra Anthropics egne datasett, så dine blir andre. Poenget er hvor forbedringen kom: i kildene og søket, ikke i modellen som svarer. Hvordan de tre grepene virker står i RAG i praksis. Her handler det om rekkefølgen, og om det som må på plass før dem.

Seks lag, i den rekkefølgen jeg ville bygd dem

Rekkefølgen følger hva som gir mest først. Den betyr ikke at noe kan vente: lag 5, målingen, starter du på i uke én, for det er den som forteller deg om lag 2 til 4 hjelper.

1

Rydd kildene

Hvem eier dokumentet, når ble det sist oppdatert, hvem har lov å lese det, og sier to dokumenter motsatte ting? Det siste er viktigst. Finner søket to svar som er uenige, må modellen velge, og den velger uten å si fra. I en industribedrift er det typisk manualer, prosedyrer og avtaler i flere versjoner. Ta bort kopier, merk resten med status og dato, og begynn med ti kilder du kjenner godt.

2

Del opp med kontekst

En bit tatt ut av et dokument har ofte mistet det som gjorde den forståelig. «Fristen er 14 dager» sier ingenting uten å vite hvilken regel den hører til. Løsningen heter contextual retrieval: en modell skriver en kort beskrivelse av hva biten er en del av, og den legges foran biten før den gjøres søkbar. Anthropic oppgir 50 til 100 token per beskrivelse, og i deres eksempelregning kostet det 1,02 dollar per million token dokumenttekst, med mellomlagring av prompten. Du gjør det én gang, og på nytt når dokumentene endres.

3

Hybridsøk og omrangering

Søk på mening finner det som ligner. Søk på ord finner det som står der: produktkoder, paragrafnumre og navn. Hybridsøk kjører begge samtidig og slår rangeringene sammen. Omrangering (reranking) er at en egen modell leser de beste treffene, i Anthropics test de 150 første, og sorterer dem på nytt, så de 20 som sendes videre er de beste. Det koster ventetid i hvert søk, så du avgjør selv hvor mange du omrangerer.

4

La en agent lete

Enkelt søk gjør ett oppslag, og noen spørsmål trenger flere. Da lar du en agent styre søket: den skriver et søk, leser treffene, ser hva som mangler og søker på nytt. På engelsk kalles det agentic retrieval. Dette er laget som koster mest, så det kommer først når testsettet viser hvilke spørsmål som trenger det. Mer om det lenger ned.

5

Mål med fasit

Femti ekte spørsmål fra dem som skal bruke systemet, med riktig svar og dokumentet svaret står i. Ta med spørsmål som ikke har svar i dokumentene, for de viser om systemet innrømmer det. Mål to ting hver for seg: kom riktig bit med i søket, og holdt svaret seg til kildene? Femti er mitt utgangspunkt og ikke en målt grense. Har du ikke femti ennå, start med tretti som i RAG i praksis, og bygg ut til femti før du avgjør noe. Regnestykket er enkelt: med femti spørsmål er hvert spørsmål to prosentpoeng, så en endring på ett svar kan være tilfeldig. Kjør settet på nytt hver gang du endrer noe. Slik lager du spørsmålene: RAG i praksis.

6

Styr

Tre ting. Tilgang etter brukerens egne rettigheter, så søket bare finner det den som spør har lov å lese. Kilde i hvert svar, så noen kan åpne den og sjekke. Og en eier for hver mappe, med en regel for hva som skjer med søkeindeksen når et dokument endres. Microsoft skriver at Copilot bare viser data brukeren har minst lesetilgang til, og at rettighetene dine derfor må være i orden først. OWASP anbefaler tilgangsstyring som følger rettighetene, strengt skilte datasett og kontroll av dokumenter før de legges inn: skjult tekst, for eksempel hvit på hvit, kan prøve å styre systemet.

Lag 1 er det kjedeligste og det viktigste. Her er en prompt som gir deg et første inntrykk av hvor dårlig det står til, med to dokumenter om samme tema.

Prompt · Finn motsigelser
Her er to dokumenter om samme tema.

Dokument A: [tittel, dato og tekst]

Dokument B: [tittel, dato og tekst]

Finn alt der de sier ulike ting om det samme. For hvert funn: sitat fra A, sitat fra B, hvilket som er nyest, og hvem som bør avgjøre hvilket som gjelder. Finner du ingen motsigelser, skriv det. Ikke gjett.
Modellen foreslår kandidater, et menneske avgjør. Ikke lim inn dokumenter med personopplysninger.

Når du ikke trenger noe av dette

Er materialet lite, kan du legge alt rett i spørsmålet og droppe søket. Anthropic skrev i september 2024 at grensen gikk ved rundt 200 000 token, omtrent 500 sider. Den grensen har flyttet seg. Flere av dagens Claude-modeller har et kontekstvindu på 1 million token, og Claude-dokumentasjonen sier at lange prompter som hovedregel koster det samme per token som korte (oktober 2026). Med dagens tokenizer er en million token omtrent 555 000 ord på engelsk, altså rundt 1 850 sider med 300 ord per side.

Men et stort vindu er ikke det samme som et godt svar. Dokumentasjonen advarer om at nøyaktigheten synker når mengden vokser, og kaller det context rot. Alt du sender med, må modellen lese hver gang, og du betaler og venter for det. Mellomlagring hjelper, men fjerner det ikke. Det finnes derfor ikke ett tall for når du bør bytte til søk. Legg hele mappen i spørsmålet, kjør testsettet, og se hva som skjer. Er svarene gode nok, trenger du ikke mer. Vet du dessuten hvilket objekt eller hvilken kunde spørsmålet gjelder, er et oppslag enklere enn både søk og stort vindu.

Agent eller enkel RAG: hva du får, og hva det koster

Ta et spørsmål der svaret ligger i to dokumenter. Slike spørsmål er der enkel RAG og agentisk søk skiller lag.

Figur · ett spørsmål, to kilder
Enkel RAG mot agentisk søk Et spørsmål om reise for konsulenter krever to kilder: reiseregler og en rammeavtale. Enkel RAG gjør ett søk, får to treff i reglene og svarer ufullstendig. Agentisk søk leser det første treffet, ser at konsulenter følger en egen avtale, søker på nytt i avtalen og svarer med begge kildene. Eksempelet er konstruert. SPØRSMÅL Får konsulentene våre dekket reise til kundebesøk? Reiseregler Rammeavtale for konsulenter ENKEL RAG Ett søk med hele spørsmålet Reiseregler §2 Reiseregler §5 Ja, reise dekkes etter reglene. UFULLSTENDIG AGENTISK SØK Søk 1 og leser treffet Gjelder ansatte. Konsulenter følger en egen avtale. Søk 2 i avtalen Fant §6: krever forhåndsgodkjenning Ja, med vilkår Kilder: reiseregler og rammeavtalen.
  1. Svaret ligger i to kilder: reglene og en avtale. Det er et konstruert eksempel.
  2. Enkel RAG gjør ett søk og tar de beste treffene. Begge kommer fra reglene.
  3. Svaret høres riktig ut, men er ufullstendig. Reglene gjelder ansatte, og ingen la merke til hullet.
  4. Agenten søker, leser treffet og ser at konsulenter styres av en annen avtale.
  5. Så gjør den et nytt søk, nå i avtalen, og finner vilkåret.
  6. Svaret bygger på begge kildene og viser dem. Prisen er flere kall og lengre ventetid.

Enkel RAG gjør ett søk med spørsmålet og tar de beste treffene. Det er raskt og forutsigbart, og det holder til de fleste spørsmål der svaret står i ett dokument. Men det kan ikke se at noe mangler. Treffene var gode, og svaret ble likevel ufullstendig. En agent kan lese første treff, oppdage henvisningen og søke igjen.

Et bilde, ikke en fasit

Enkel RAG er å få utlevert de ti øverste arkene fra bunken. Agenten er en saksbehandler som slår opp i en mappe, ser henvisningen til en annen og går dit.

Hva det koster

Hvert ekstra søk er et modellkall til, og hvert kall er tid og token. Anthropic oppgir at agenter i deres egne målinger brukte omtrent fire ganger så mange token som en vanlig chat, og systemer med flere agenter omtrent femten ganger så mange. Det gjelder deres forskningsagent som leter på nettet, ikke spørsmål mot bedriftens dokumenter, og jeg har ikke funnet et tilsvarende tall for dokumentspørsmål. Mål selv. Microsoft skriver at agentisk søk i Azure AI Search gir mer ventetid enn ett enkelt søk, men håndterer spørsmål med flere ledd, og at det faktureres per token og ikke per søk. Kostnaden varierer da med hvor mye som letes.

Hva kilden faktisk sier. Anthropics tall gjelder søket alene på deres egne datasett, ikke svaret og ikke dine dokumenter. Token-tallene for agenter gjelder en forskningsagent på nettet, ikke spørsmål mot dokumenter.

Alle forbedringstall fra leverandører, også Anthropics, er målt på deres egne data. De er veiledende. Du vet ikke hva du får før du har kjørt dine egne femti spørsmål.

Når det ikke er verdt det

Anthropic beskriver at Claude Code bruker en blanding: noen filer legges inn fra start, resten finner agenten selv med søk underveis. Samme tanke passer for en bedrift. Det som alltid trengs, legges inn. Resten søkes.

Et presisjonspunkt, for ordet agent brukes løst. Microsofts «agentic retrieval» er strengt tatt en fast arbeidsflyt: en modell planlegger delspørsmål, og systemet kjører dem. I en agent, slik begrepssiden bruker ordet, bestemmer modellen selv hvor mange runder den tar. Spør derfor leverandøren hvem som bestemmer neste steg. Og husk at LLM-basert planlegging i Azure AI Search per 16. september 2026 er i forhåndsvisning (preview), som Microsoft ikke anbefaler til produksjon.

En vei i tre steg

Tidene er mine grove anslag og ikke målt. De er tenkt for en bedrift som starter fra null med noen få personer.

Første uke: finn ut hvor du står

Velg ti kilder du kjenner godt, og rydd dem: eier, dato, ingen kopier. Sett opp enkelt søk, i et ferdig verktøy eller en liten selvbygd løsning. Skriv femti spørsmål med fasit, noen uten svar, og kjør dem. Nå har du et tall å forbedre.

Uke 1

Første måned: flytt tallet

Legg til én ting om gangen: beskrivelse foran hver bit, hybridsøk, omrangering. Kjør testsettet etter hver endring. Koble til bedriftens egne rettigheter, få kilde i hvert svar og ta inn flere mapper.

Måned 1

Første kvartal: ta de vanskelige

Se i testsettet hvilke spørsmål enkelt søk ikke klarer, og la en agent ta dem. Sett opp drift: en eier per kilde, oppdatering av søkeindeksen, logg, og kostnad og svartid per spørsmål. Kjør testsettet hver måned.

Kvartal 1

Hva en leder bør kreve

Skal du godkjenne en pilot eller kjøpe en løsning, kan du be om dette. Du trenger ikke kunne teknikken for å se om det finnes.

En seriøs leveranse har

  • Et testsett med minst femti ekte spørsmål og fasit, og tallene fra siste kjøring
  • Kilde og dato i hvert svar, og «Det finner jeg ikke» når svaret mangler
  • Tilgang etter brukerens egne rettigheter, prøvd av en som ikke skal ha tilgang
  • En eier for hver kilde og en plan for oppdatering
  • Kostnad og svartid per spørsmål, målt på ekte bruk

En demo har

  • Tre spørsmål som leverandøren valgte selv
  • Svar uten kilde, eller kilder ingen kan åpne
  • En tjenestekonto som ser alt
  • Dokumenter lastet opp én gang og aldri oppdatert
  • «Vi bruker den beste modellen» som svar på hvorfor det virker

Tilgang er det som gjør et feil svar til et brudd. Finner søket et dokument noen ikke skulle sett, er det et konfidensialitetsbrudd og ikke bare et feil svar. Derfor er tilgangsstyring et styrespørsmål.

Og ett spørsmål som ikke står i listen: hvem svarer når et svar viser seg å være feil? Systemet gir forslag, og noen i bedriften må eie det som brukes til å avgjøre noe. Flere spørsmål å stille om tilgang og kontroll står i La AI snakke med bedriftens data, og om kostnad i Hva koster det.

Start med ti kilder og femti spørsmål. Resten bygger du i den rekkefølgen testsettet viser at du trenger det.

Oppdatert oktober 2026. Kilder: Anthropic, «Introducing Contextual Retrieval» (19. september 2024: grensen på 200 000 token, 5,7 til 1,9 prosent, 150 treff til omrangering og 20 videre, 50 til 100 token per beskrivelse, 1,02 dollar per million token). Anthropic, «Effective context engineering for AI agents» (29. september 2025: Claude Code og blandingen av å laste inn og søke). Anthropic, «How we built our multi-agent research system» (13. juni 2025: fire og femten ganger så mange token). Claude-dokumentasjonen, Context windows (lest 8. oktober 2026: 1 million token, context rot). Microsoft Learn, Agentic retrieval overview (side datert 16. september 2026) og Hybrid search overview (31. august 2026). Microsoft Learn, Data, Privacy, and Security for Microsoft Copilot (lest 8. oktober 2026). OWASP, LLM08:2025 Vector and Embedding Weaknesses. Forbehold: Anthropics søketall er målt på deres egne datasett. Token-tallene for agenter gjelder en forskningsagent på nettet og er ikke overført til dokumentspørsmål. Eksempelet i den andre figuren er konstruert. Antallet spørsmål i testsettet og tidsanslagene i veien i tre steg er mine og ikke målt. Jeg har ikke selv målt enkel RAG mot agentisk søk på et reelt dokumentsett. Produktfunksjoner og priser endrer seg raskt.