Anonimizuj ne koristi generički, engleski-prvi model. Detekciju ličnih podataka gradimo na ModernBERTić-u - prvom modernom enkoderu za južnoslovenske (BCMS) jezike i trenutno najtačnijem na javnom BalkanBench rangiranju.
ModernBERTić razumije bosanski, crnogorski, hrvatski i srpski - jezik, padeže i kontekst, a ne samo niz znakova. Baziran je na ModernBERT arhitekturi i treniran na 66 milijardi tokena iz 22 BCMS izvora, sa kontekstom od 8.192 tokena.
Zato hvata imena, JMBG, adrese i identifikatore koje generički, engleski-prvi alati i obični regularni izrazi redovno propuste.
Na BalkanBench-u (SuperGLUE-SR), ModernBERTić-large je prvi - prosjek 73.44, +1.98 u odnosu na BERTić (71.46), uz pobjedu na 4 od 6 zadataka. Svaki rezultat je prosjek 5 nasumičnih pokretanja.
Izvor: balkanbench.com/leaderboard
Kod anonimizacije, lažno negativni rezultat - propušten podatak - je povreda povjerljivosti. Generički modeli, trenirani uglavnom na engleskom, podbacuju baš na onome što je tebi bitno: domaćim imenima u padežima i lokalnim identifikatorima. ModernBERTić je napravljen za ovaj jezik, pa je polazna tačka za detekciju znatno viša nego kod stranih alata ili pukih regularnih izraza.
Model je razvio Mitar Perović u Recrewty-ju, uz EU grant. ModernBERTić već pokreće produkciju u Recrewty-ju - AI platformi za upravljanje talentima za Balkan - za razumijevanje dugačkih CV-jeva i pretragu kandidata. Isti taj jezički temelj sada pokreće detekciju u Anonimizuj-u.
Cijeli proces treninga - arhitektura, podaci i evaluacija - dokumentovan je u cijelom serijalu objava na Mitrovom LinkedIn-u, a tehnički detalji su razloženi u članku na Medium-u.