Metodologija

Kako nastaje korpus, što se na njemu mjeri i gdje su granice tih mjera

Metodologija
Otvorena znanost
Reproducibilnost
Objavljeno

11. kolovoza 2026.

Ova stranica okuplja tehnički dio projekta na jednom mjestu. Ostale stranice vode računa o tome što podaci pokazuju. Ovdje piše kako su nastali, na čemu su mjereni i što se iz njih ne smije zaključiti. Namijenjena je čitatelju koji želi provjeriti postupak, ponoviti ga ili citirati.

Svaka brojka na ovoj stranici izračunata je iz praćenih manifesta koji nastaju zajedno s podacima. Nijedna nije prepisana rukom.

Što ulazi u korpus

Službeni korpus sadrži 413.985 objava i 54 stupca, prikupljenih u razdoblju 2021.–2026. na 9 vrsta izvora i platformi. U njega ulazi objava koja prođe dva uzastopna uvjeta.

Prvi uvjet je rječnički. Objava mora unutar prvih 3.000 znakova teksta pogoditi najmanje 1 odlučan i najmanje 2 različita pojma s popisa od 119 pojmova. Popis razlikuje 99 pojmova koji sami po sebi upućuju na katoličku tematiku i 20 pojmova koji se u hrvatskom javljaju i izvan religijskog konteksta, pa ne mogu sami donijeti odluku.

Ograničenje na prvih 3.000 znakova nije tehnička sitnica. Ranije je rječnik čitao cijeli tekst, a drugi uvjet i ljudski koderi samo početak, pa su u korpus ulazile objave čiji je jedini religijski trag bio duboko u tekstu i tipično nije imao veze s temom. Od svih takvih objava koje su pročitane ručno nijedna nije bila katolički sadržaj, pa se pravilo sada na oba mjesta primjenjuje na isti prozor.

Drugi uvjet je modelski. Objava koja prođe rječnik ocjenjuje se statističkim modelom uvježbanim na ručno označenim primjerima i ulazi u korpus samo ako dosegne ocjenu od najmanje 0,70. Prag je odluka voditelja projekta iz kolovoza 2026. i namjerno je postavljen tako da zadrži volumen. Viši prag daje čišći, ali manji korpus.

Isto pravilo vrijedi za cijelo razdoblje. To je bitno jer se metoda prikupljanja mijenjala, a pravilo uključivanja nije smjelo pratiti tu promjenu.

Koliko je korpus čist

Preciznost je mjerena ručnim čitanjem 250 objava po razdoblju. Na tako mjerenoj osnovici zajednička krivulja procjenjuje da je oko 84,5 % objava u korpusu doista katolički sadržaj, uz zadržanih oko 87,2 % onoga što jest katolički sadržaj. Kvaliteta nije jednaka u oba razdoblja (68,0 % prije 2024. i 87,0 % poslije, mjereno pri nižem pragu), i ta je razlika svojstvo prikupljanja, a ne mjerenja.

Drugim riječima, korpus je namjerno širok. Manji dio objava u njemu spominje katoličke pojmove, a nije o njima. Ta razina šuma opisana je i mjerena, a ne prešućena.

Pravilo uključivanja u brojkama. Izvor: manifest službenoga korpusa, nastao uz korpus u R/build_corpus.R.
Stavka Vrijednost
Objava u korpusu 413.985
Stupaca 54
Razdoblje 2021.–2026.
Vrsta izvora i platformi 9
Pojmova na popisu 119 (99 odlučnih, 20 dvojbenih)
Prozor teksta prvih 3.000 znakova
Prag modela 0,70

Dva skupa podataka koja nisu zamjenjiva

Projekt vodi dva odvojena skupa podataka i njihovo miješanje najčešći je način da se dobiju krive brojke.

Akumulator (710.307 redaka, 47 stupaca) sve je što je servis za praćenje medija isporučio, bez ikakvog filtriranja. On raste sa svakom novom isporukom.

Službeni korpus (413.985 objava) izrezan je iz akumulatora pravilom opisanim gore. Sve što opisuju stranice ovoga sjedišta, sve mape i svi javni agregati računaju se na njemu.

Dovršena tematska istraživanja i dalje čitaju akumulator, imenom, jer su na njemu izračunata i objavljena. Prebacivanje gotove analize na novi ulaz tiho bi promijenilo brojke koje su već objavljene, pa se to ne radi. Svako istraživanje na stranici Tematska istraživanja navodi na kojem je skupu izračunato.

Praktična posljedica za čitatelja je jednostavna. Ako se brojka s neke stranice ne slaže s brojkom iz nekog istraživanja, prva provjera nije aritmetika nego to govore li o istom skupu podataka.

Promjena prikupljanja 2024. i što ona zabranjuje

Tijekom 2024. promijenio se način na koji su objave prikupljane. Pravilo uključivanja ostalo je isto s obje strane te granice, pa su razdoblja usporediva po pravilu, ali nisu usporediva po zahvatu. Udio zadržanih objava skače za otprilike dvadeset postotnih bodova preko te granice, i to je svojstvo instrumenta, ne medijske stvarnosti.

Dva razdoblja prikupljanja pod istim pravilom uključivanja. Izvor: manifest službenoga korpusa, odjeljak o razdobljima.
Razdoblje Raspon Objava u akumulatoru Zadržano u korpusu Udio zadržanih
Prije promjene 2021-01-01 -> 2024-07-04 269.583 192.861 71,5 %
Poslije promjene 2024-07-01 -> 2026-06-11 440.724 221.124 50,2 %

Iz toga slijedi jedno ograničenje koje vrijedi za sve prikaze na ovom sjedištu. Porast broja objava preko 2024. nije porast medijske pažnje. Godišnji volumeni smiju se uspoređivati unutar istoga toka prikupljanja, a ne preko granice. Najveća godina u korpusu, 2025. s 124.346 objava, dijelom je posljedica obuhvatnijega prikupljanja, a ne samo veće medijske pažnje. Instagram i TikTok ulaze u prikupljanje tek 2024., pa ranije godine za te platforme nemaju objava i platformski udjeli nisu usporedivi kroz cijelo razdoblje.

Uz to, u vendorskom izvoru za razdoblje od veljače do svibnja 2024. nema teksta, pa nijedno razdoblje nema retke u tim mjesecima. Prikupljanje ima i kraćih prekida.

VažnoOvo je jedino mjesto na kojem se ta ograda navodi

Ostale stranice prikazuju volumene bez ponavljanja ove napomene, kako čitanje ne bi bilo opterećeno istim upozorenjem na svakom prikazu. Tko uspoređuje godine ili platforme kroz vrijeme, mjerodavan je ovaj odjeljak.

Zadržane objave po godini. Godina 2026. obuhvaća razdoblje do lipnja. Izvor: manifest službenoga korpusa, odjeljak o godinama.
Godina U akumulatoru U korpusu Udio zadržanih
2021. 90.388 62.151 68,8 %
2022. 84.535 59.657 70,6 %
2023. 83.836 64.069 76,4 %
2024. 114.231 56.923 49,8 %
2025. 236.166 124.346 52,7 %
2026. 101.151 46.839 46,3 %

Uzorci i rječnici

Analize volumena, dosega i angažmana računaju se na cijelom korpusu. Analize teksta ne, jer jezična obrada cijeloga korpusa nije izvediva u razumnom vremenu, pa se one računaju na stratificiranim uzorcima. Svaki uzorak vučen je s fiksnim sjemenom slučajnosti (123), stratificiran po godini i platformi, ograničen na objave dulje od 100 znakova i bez platforme TikTok.

Stratificirani uzorci na kojima se računaju jezične analize.
Analitička razina Ciljani udio korpusa Dokumenata u uzorku
Tematske struje 5,0 % 20.658
Fokus na događaje 3,0 % 12.384
Atmosfera diskursa 2,0 % 8.250

Izvor: data/nlp/manifest.json, nastao u R/04_nlp.R.

Posljedica uzorkovanja je da su dnevne i rijetke vrijednosti nesigurne. Kada se neki nalaz oslanja na mali broj dokumenata, stranica na kojoj stoji navodi taj broj uz nalaz.

Jezična obrada. Tekst se prije analize svodi na mala slova, dijeli na riječi i svodi na osnovne oblike modelom croatian-set-ud-2.5-191206.udpipe, uvježbanim na hrvatskom. Bez toga bi se Misa i misa brojile kao dvije različite riječi.

Tematske kategorije. Objave se razvrstavaju u unaprijed definirane tematske kategorije, a ima ih 16. Razvrstavanje radi rječnik. Riječ je o pravilima, ne o modelu koji sam pronalazi teme, pa su kategorije stabilne kroz vrijeme i provjerljive, ali ne mogu prepoznati temu koju rječnik ne pokriva.

Rječnici tonaliteta i emocija. Leksički tonalitet mjeri se rječnicima CroSentilex i CroSentilex Gold, a emocionalne oznake leksikonom lilaHR, koji razlikuje osam emocija. Svi rade na osnovnim oblicima riječi, pa se moraju spajati na jednako obrađen tekst.

Relativni indeks konflikta (RIK) razlika je između opažene gustoće konfliktnog rječnika u tekstu i one koja bi se očekivala s obzirom na prosjek toga izvora i te teme. Mjeri odstupanje od očekivanog, ne apsolutnu razinu sukoba.

VažnoŠto ove mjere ne mjere

Sve navedeno mjeri riječi u tekstu. Tonalitet nije osjećaj autora, emocionalna oznaka nije reakcija publike, a gustoća konfliktnog rječnika nije dokaz sukoba ni namjere. Doseg je vendorska procjena, ne izmjerena publika. Nalazi su opisni i takvima ih valja čitati.

Reproducibilnost

Kod, pravila i agregati javni su na GitHubu pod licencijom CC BY 4.0. Sam korpus i akumulator sadrže puni tekst objava i nisu javni, pa se pristup retcima odobrava zasebno. Sve što se objavljuje izvedeno je iz njih bez osobnih podataka.

Lanac obrade ide jednim smjerom i svaki korak zapisuje vlastiti manifest s otiskom ulaza iz kojega je nastao.

  1. Sirove isporuke ulaze u akumulator.
  2. Iz akumulatora se pravilom uključivanja izrezuje službeni korpus (R/build_corpus.R).
  3. Iz korpusa se računaju javni agregati (R/03_aggregate.R) i jezična obrada (R/04_nlp.R).
  4. Stranice čitaju agregate i manifeste. Nijedna stranica ne računa korpus iznova.

Zato se sve brojke na ovom sjedištu mogu vezati uz otisak podataka iz kojega su nastale. Ako agregati nisu izgrađeni iz aktualnog korpusa, provjera u kodu prekida izradu stranice umjesto da objavi brojku koja ne odgovara prikazu ispod nje.

Popis izvora, njihovih profila i uredničkih oznaka opisan je u Katalogu izvora. Struktura same baze i značenje svakoga stupca opisani su na stranici Baza podataka.