Steg 6
Vi tränade vår egen modell
Ni valde temat: platt jord. Nedan är en riktig transformer, samma arkitektur som i steg 5, tränad offline på en korpus skriven för det här projektet. Vikterna är färdiga och laddas en gång; allt du gör härifrån räknas ut lokalt i din webbläsare, ingen server inblandad.
Laddar tränade vikter…
Skalan
~223 700 parametrar. GPT-4 uppskattas ha över hundra miljarder — flera miljoner gånger större. Samma algoritm, samma attention, samma sätt att räkna nästa ord, bara i en skala som förändrar vad modellen hinner lära sig, inte hur den lär sig det.
Vad som hände, hela resan
ELIZA hade noll lärande. XOR lade till vikter. Tokens gjorde text till siffror. Embeddings gav siffrorna betydelse. Attention lät betydelsen ändras med sammanhanget. Och i steg 6 tränade vi allt det på en gång, på ett tema ni valde. Modellen ovan har ingen uppfattning om att jorden faktiskt inte är platt — den har bara sett vilka ord som brukar stå bredvid vilka andra, om och om igen. Det gäller lika mycket för modeller hundra miljoner gånger större.