TERBIS
Alla artiklarAI

Del 1 av "AI-grunderna"

Läs hela serien →

Tokens och n-gram: grunden ingen förklarar, och notan ingen ser förrän den kommer

20 september 20266 min läsning

Tokens och n-gram: grunden ingen förklarar, och notan ingen ser förrän den kommer

Ställ en fråga till en AI-tjänst, och fakturan som kommer sedan matchar aldrig riktigt antalet ord du skrev. Det är inte ett fel. Det är för att du aldrig betalade per ord. Du betalade per token, en enhet de flesta använder dagligen utan att någonsin ha sett den förklarad, trots att den är precis där den löpande kostnaden för AI i daglig drift faktiskt uppstår.

Vad är en token, egentligen?

En token är inte ett ord. Det är den minsta textbit en språkmodell faktiskt hanterar internt: ibland ett helt ord, ibland en ordstam, ibland bara några bokstäver. "Katt" kan vara en token. "Otillräcklighetskänsla" blir sannolikt flera. Tekniken bakom uppdelningen kallas subword-tokenisering (den vanligaste varianten heter Byte Pair Encoding, BPE), och principen är enkel: bygg en ordlista av de textbitar som förekommer oftast i träningsdatan, och dela upp allt annat i mindre delar av den ordlistan.

Det här har en konkret, ofta förbisedd konsekvens för svenska användare. Engelska tokeniseras generellt effektivare än svenska, eftersom de flesta AI-modellernas ordlistor byggts med engelsk text som dominerande källa. Svenskans långa sammansatta ord ("otillräcklighetskänsla", "fastighetsmäklarutbildning") delas ofta upp i fler tokens än den engelska motsvarigheten hade behövt. Samma innehåll, samma mening, men fler tokens, och därmed en högre notering, bara för att språket råkar vara svenska.

N-gram: idén är hundra år gammal, bara verktyget är nytt

Att förutsäga nästa ord utifrån de föregående är ingen ny idé som uppfanns med ChatGPT. Den går tillbaka till Claude Shannons arbete med informationsteori på 1940-talet, där han visade att man kunde modellera språk statistiskt: räkna hur ofta en viss sekvens av ord följs av ett visst nästa ord, och använd de sannolikheterna för att förutsäga eller generera text. Det är precis vad en n-gram-modell gör, en modell som tittar på de N minus 1 föregående orden (eller tokens) och räknar fram sannolikheten för vad som kommer härnäst, baserat på hur ofta den kombinationen förekommit i en textmängd. Den här typen av modell beskrivs i detalj i Speech and Language Processing av Daniel Jurafsky och James Martin, standardläroboken inom språkteknologi, där n-gram fortfarande fungerar som det första och mest konkreta exemplet på hur ett språk kan modelleras statistiskt, innan boken går vidare till neurala metoder.

Poängen är inte att n-gram-modeller var särskilt bra. De var det inte; de glömde allt bortom sitt lilla fönster av föregående ord, och kunde aldrig fånga sammanhang längre bak i en mening eller ett stycke. Poängen är att dagens LLM:er löser samma grundläggande uppgift, att förutsäga nästa token utifrån vad som kommit innan, fast med ett neuralt nätverk i stället för en frekvenstabell, och med förmågan att väga in ett helt sammanhang i stället för bara de senaste två eller tre orden. Det är den förmågan, att avgöra vilka tidigare tokens som faktiskt spelar roll oavsett hur långt bak de ligger, som attention löste, och som nästa artikel i den här serien handlar om.

N-gram är inte dött, det städar bara åt de nya modellerna nu

Här är den del av historien som sällan berättas: n-gram-tekniken försvann aldrig, den bytte bara jobb. I stället för att vara språkmodellen används den i dag som ett verktyg för att städa den enorma mängd text en modern LLM tränas på, innan träningen ens börjar.

Tre konkreta exempel på var den fortfarande jobbar:

Dubblettstädning. Webbskrapad träningsdata innehåller enorma mängder nästan identiska dokument: omtryckta artiklar, kopierade sidor, upprepat innehåll. Forskning har visat att sådana dubbletter gör modeller sämre och ökar risken att de memorerar och senare återger text ordagrant. Standardlösningen är att representera varje dokument som en uppsättning n-gram och jämföra dem (ofta med en teknik som kallas MinHash) för att hitta och ta bort de som är nästan identiska.

Kontamineringskontroll. När OpenAI byggde GPT-3 beskrev de i sin egen artikel hur de aktivt letade efter och tog bort träningsexempel som hade en överlappning på 13 sammanhängande tokens eller mer med de datamängder som senare skulle användas för att utvärdera modellen. Annars hade modellen i praktiken kunnat "plugga inför provet".

Kvalitetsfiltrering. Innan en textbit ens får vara med i träningsdatan tränas ofta en separat, betydligt enklare n-gram-modell (verktyget KenLM och dess 5-gram-modeller är en vanlig standard) för att poängsätta hur "naturligt" språket i texten är. Text som får låg poäng, som kodrester, loggfiler och spam, sorteras bort innan den når den faktiska modellen.

Med andra ord: nästa gång du hör att n-gram är en föråldrad teknik, stämmer det bara om man menar som själva modellen. Som verktyg i maskinrummet håller den fortfarande jobbet igång.

Varför det här spelar roll för notan

Tillbaka till fakturan. Varje AI-tjänst du använder prissätts per token, vanligtvis med olika pris för tokens du skickar in (din fråga, hela konversationshistoriken, eventuella dokument du bifogar) och tokens modellen skickar tillbaka. Ett långt, ostrukturerat samtal där hela historiken skickas med i varje ny fråga växer i kostnad för varje tur, inte bara linjärt utan ofta märkbart, eftersom hela kontextfönstret räknas om varje gång. I daglig drift, över tusentals eller miljontals anrop, är det här skillnaden mellan en marginell kostnad och en betydande post i budgeten, och det är en skillnad som avgörs av hur man designar sina AI-flöden, inte bara av vilken modell man väljer.

Att förstå tokens är alltså inte ett tekniskt sidointresse. Det är den mest konkreta, mätbara kostnadsknappen i hela AI-driften, och den som oftast förbises helt i beslut som annars vägs noga på varje annan rad i budgeten.

Källor och vidare läsning

Nya artiklar direkt i din inbox

Få uppdateringar när nya artiklar publiceras om AI, strategi och företagande.

Dela

LinkedInX

Citera denna artikel

Norström, A. (2026). Tokens och n-gram: grunden ingen förklarar, och notan ingen ser förrän den kommer. Terbis. https://terbis.se/sv/articles/tokens-och-ngram

Läs del 2 →