kamooPraat met ons

Zo bouwen we Polder.

De meeste AI-leveranciers vragen je hun model te vertrouwen. Wij laten liever zien hoe het gemaakt wordt, van databron tot trainingsrun.

Eerst het water de baas, dan pas bouwen.

ruw bronarchief±1,4T tokens
de fabriek6 stappen

Vijf keuzes die alles dragen.

01 / 05

Data verzamelen en verantwoorden

We gebruiken uitsluitend bronnen waarvan herkomst en licentie vastliggen. Filtering op taal, kwaliteit en OCR-ruis gebeurt vóór de training en is net zo controleerbaar als het model zelf.

02 / 05

Eén eigen Nederlandse tokenizer

Internationale modellen knippen Nederlands inefficiënt op. Wij bouwen één 48k-tokenizer voor de hele familie, afgestemd op Nederlands, Engels, code en cijfers.

03 / 05

Vanaf nul, via een modelladder

Polder is geen fine-tune van een buitenlands basismodel. We trainen zelf, langs een ladder van 70M via 350M naar 1B, waarbij elke maat de keuzes voor de volgende valideert.

04 / 05

Meten, ook als het tegenvalt

Elk experiment krijgt een hypothese en een gemeten uitkomst, en ook wat níet werkte leggen we vast. Zo kun je iedere keuze in het model terugvoeren op een meting.

05 / 05

Van basismodel naar assistent

Na de basistraining volgt het echte assistentwerk: instructie-training, voorkeursdata en veiligheid. In het Nederlands, terwijl bestaande datasets vrijwel volledig Engels zijn.

Het werk zit onder de waterlijn: in de data.

Elke bron passeert eerst de sluis. De sluiswachter kent drie oordelen:

doorgelaten

de bron mag het water in én het model mag er open mee de wereld uit

wacht bij de sluis

trainbaar, maar een open release wacht tot de licentie is afgetekend

geweigerd

komt het water niet in en traint nooit mee

twijfel is ook een oordeel: zonder heldere licentie wacht een bron bij de sluis · de eu ai act vraagt een publieke samenvatting van trainingsdata en dit register maakt dat bijna een exportknop

−1 m · stap 01

Verzamelen

Elke bron gaat met checksum, licentie en herkomst het archief in. Ruim een biljoen ruwe tokens, stuk voor stuk herleidbaar.

−2 m · stap 02

Filteren

Taal, kwaliteit en OCR-ruis, per bron gekalibreerd. Wat het niet haalt, wordt gelogd in plaats van stilletjes weggegooid.

−3 m · stap 03

Ontdubbelen

Exacte en fuzzy deduplicatie over het hele archief. Pas hierna telt wat er werkelijk bruikbaar is.

−4 m · stap 04

Anonimiseren

PII-detectie met eigen herkenning voor Nederlandse gegevens, van BSN tot adres.

−5 m · stap 05

Mengen

De verhouding tussen Nederlands, Engels, code en wiskunde wordt gemeten in experimenten, niet gegokt.

−6 m · stap 06

Trainen

Elke trainingsrun gedocumenteerd en herhaalbaar, van eerste proefrun tot doelmodel.

Wat op de bodem ligt, wordt het fundament: de familie.

Wat er bovenkomt.

Boven water komen twee dingen: een geteld en gekeurd archief, en een meetlat die iedereen kan narekenen.

het ruwe archief, per domein

totaal · 1.430,0 mld tokens

Nederlands
±485 mld · 34%
Engels
±600 mld · 42%
Wiskunde
±240 mld · 17%
Code
±105 mld · 7%

ruwe archiefschatting (±30%), vóór deduplicatie · na ontdubbeling blijft de kern over: 150–250 miljard unieke Nederlandse tokens

de nederlandse meetstraat

Er bestaat nauwelijks een goede Nederlandse meetlat voor taalmodellen. Daarom bouwen we er zelf één, en die publiceren we samen met de modellen.

  • Bestaande Nederlandse benchmarks, aangevuld met echte Nederlandse examenvragen en eigen taken
  • Decontaminatie: overlap tussen trainingsdata en testsets wordt verwijderd en gelogd
  • Een geheime eigen testset die nooit online staat, zodat de cijfers eerlijk blijven

Klein is een keuze, geen beperking.

On-device draaien, betaalbaar blijven en goed worden in Nederlands taalwerk: dat is de focus.