Steg 3
Varför AI:n inte kan räkna R i "strawberry"
En språkmodell läser varken bokstäver eller riktigt ord. Den läser tokens, alltså textbitar som en algoritm har klumpat ihop efter hur ofta de förekommer tillsammans. Bitarna kan vara ett helt ord, en ändelse eller bara ett par tecken. Frågar du hur många R det finns i ett ord har modellen aldrig sett bokstäverna, bara klumparna.
Dra reglaget hela vägen till vänster. Då är varje tecken en egen token, vilket är där algoritmen börjar. Dra sedan åt höger och se hur de vanligaste teckenparen växer ihop till stavelser, och stavelserna till ord.
Hopslagningarna i tur och ordning
- h + e → he 613×
- t + he → the 505×
- a + n → an 290×
- an + d → and 212×
- i + n → in 193×
- r + e → re 122×
- v + e → ve 118×
- a + t → at 103×
- o + n → on 98×
- t + o → to 95×
- a + s → as 88×
- o + u → ou 86×
- l + e → le 80×
- e + n → en 78×
- a + l → al 73×
- m + e → me 69×
- e + d → ed 68×
- i + d → id 64×
- s + a → sa 60×
- k + in → kin 58×
- d + o → do 58×
- i + t → it 58×
- ve + r → ver 57×
- s + t → st 56×
- c + e → ce 54×
- sa + id → said 52×
- a + r → ar 52×
- a + y → ay 50×
- kin + g → king 49×
- f + o → fo 47×
- i + l → il 46×
- w + as → was 43×
- e + r → er 42×
- o + l → ol 41×
- i + s → is 41×
- t + h → th 38×
- b + e → be 37×
- l + i → li 36×
- r + in → rin 36×
- l + o → lo 36×
Visar de 40 första av 400.
Därför kostar svenska mer
Här är samma mening på två språk, körd genom samma tokenizer. Den är tränad på engelska, i likhet med den som sitter i GPT-4.
| Språk | Tecken | Tokens | Tecken per token |
|---|---|---|---|
| Engelska | 171 | 115 | 1.49 |
| Svenska | 168 | 126 | 1.33 |
Samma innehåll drar 10 % fler tokens på svenska. Eftersom du betalar per token syns det direkt på fakturan, och svaren tar längre tid att generera. Kontextfönstret fylls också fortare, så det ryms mindre text innan modellen tappar bort början. Det är anledningen till att vi tränar vår egen modell på engelska i steg 6.
En brasklapp innan du citerar siffrorna någon annanstans. Vår tokenizer har 400 hopslagningar och har sett 2900 ord. GPT-4:s har runt 100 000 och har sett stora delar av internet. Därför ligger talen här mycket lägre än på riktigt, där engelska brukar landa kring fyra tecken per token. Skillnaden mellan språken går att lita på. De exakta talen gör det inte.
Vad som hände
Algoritmen heter BPE och gör en enda sak. Den letar upp det vanligaste teckenparet, slår ihop det till en ny token, och börjar om. GPT-4 och LLaMA använder samma metod. De håller bara på tills de har ungefär 100 000 tokens i stället för våra 400.
Nu är texten omgjord till siffror. Problemet är att siffrorna inte betyder något än. Token 412 ligger inte närmare token 413 än token 9000. Det tar vi i steg 4.