Od chata do delegiranja

Agentska AI za metodološka istraživanja

Author
Published

23. lipnja 2026.

Kako metodološki istraživači mogu prijeći s chat-promptanja na agentski rad i zašto je to upravo njihov teren. Ovo je web-verzija prezentacije. Postoji i verzija sa slajdovima.

Gdje ste sada

Otvorite prozor za chat, sastavite prompt, dobijete odgovor. Zatim vi kopirate kôd, pokrenete ga, naletite na grešku, zalijepite je natrag i pokušate ponovno. Vi ste voditelj projekta. Cijeli plan držite u svojoj glavi, a AI vam pomaže s jednim korakom u nizu.

Iskorak

Razgovorna AI (chat AI) pomaže vam da obavite posao. Agentskoj AI (agentic AI) se posao povjerava. Razlika je u tome tko drži plan.

Prestajete sastavljati prompt da biste dobili odgovor i počinjete zadavati cilj i ograničenja, a zatim nadzirati dok AI planira, djeluje, provjerava vlastiti rad i vraća se kad je gotovo. To je agentska petlja (agent loop), dakle opazi, odluči, djeluj, provjeri, ponovi. I to je cijela teza ovog dokumenta, a sve ostalo je razrada.

Ovo vam je poznata vrsta problema

Ne radi se o „pametnijem chatbotu”. Razmislite o onome što ionako svakodnevno radite, i o tome gdje vas to izda.

AI zaboravlja između sesija zašto ste odabrali baš tu notaciju ili koji ste bug (pogrešku u kodu) ispravili. Kvaliteta varira, pa je jedna tablica čista, a sljedećoj nedostaju standardne greške. Pregledavanje iscrpljuje, jer ručno provjeriti 140 slajdova ubija volju, a umoran recenzent propušta grešku u analizi, ne samo tipfeler. Najdublja je zadnja. Provjera pravopisa uhvati pogrešku u slovu, ali nikad obrnuti predznak u teoremu ili regresiju koja je tiho pogrešna.

Ali ništa od toga vam nije novo. Cijela vaša struka već je jedan obrambeni sustav protiv baš tih promašaja. Ne date novom asistentu podatke bez uputa i nadzora, niti mu vjerujete na riječ. Plan analize napišete prije nego dotaknete podatke, da poslije ne pecate rezultat koji vam se sviđa. Dajete rad na recenziju jer znate da autor ne vidi vlastite slabe točke. Vodite bilješke o tome tko je, što i kada mijenjao, da rezultat ostane obranjiv. Agentska AI nije ništa drugo nego ti isti potezi posloženi u alat, i upravo zato ste je vi, a ne inženjer, najpozvaniji voditi.

Da ovo ne ostane apstraktno, provući ćemo kroz cijeli tekst jedan konkretan zadatak, i to onaj na kojem je sagrađen ovaj sami dokument. Ova prezentacija je niz slajdova koje treba složiti, lektorirati i provjeriti da nigdje ne ispada izvan okvira prije nego što stanete pred publiku. Posao koji biste inače radili ručno, slajd po slajd. Upravo ovdje počinje delegiranje.

AI kao glavni izvođač radova

Opišete što želite, običnim jezikom. Recimo, „Renderiraj slajdove, prođi lekturu, provjeri da nijedan blok ne ispada izvan okvira i vrati mi ih spremne za izlaganje.”, a taj AI se ponaša kao glavni izvođač radova.

AI izradi nacrt i zatraži vaše odobrenje. Unajmi ekipu specijalista. Pregleda njihov rad i vrati ih da poprave što ne valja. Vrati se k vama tek kad posao prođe inspekciju. Može se zapetljati ili preskočiti korak, pa zato vi odobravate plan prije nego dotakne datoteke, a prag kvalitete blokira rad ispod razine. Vi usmjeravate, AI provodi, a sve ostalo su instalacije, izgrađene tako da nikad ne morate misliti na instalacije.

Elementi (slojevi) agentskog sustava

Sav taj posao obavlja pet slojeva, a svaki je stvarna datoteka u projektu. Engleska imena su zadržana jer ih alat tako traži.

Što sloj radi Datoteka
Ustav, stalna kućna pravila koja se čitaju svake sesije CLAUDE.md
Priručnici na zahtjev, pojave se samo kad su relevantni .claude/rules/*.md
Imenovani gumbi (vještine / skills), to su /render, /proofread, /commit, /review-deck .claude/skills/*/SKILL.md
Uski specijalisti, svaki provjerava jednu stvar .claude/agents/*.md
Dozvole i alarmi koji se automatski okidaju (opcionalno za početak) .claude/settings.json + hooks

CLAUDE.md je datoteka u ovom repozitoriju. Isti obrazac u OpenAI-jevim alatima nosi naziv AGENTS.md (npr. Codex CLI), ali nazivi i format se razlikuju. Ispod svega je memorija koja preživljava kroz sesije. Kako te datoteke izgledaju iznutra, možete vidjeti u odjeljku na dnu.

Dvije ideje zbog kojih sve radi

Specijalisti pobjeđuju generalista. Tražite li od jednog asistenta da istovremeno pazi na gramatiku, raspored, matematiku i kôd, sve zadatke obavi osrednje. Dodjelite svakoj dimenziji specijaliziranog asistenta i greške ne ostaju skrivene. Kao u istraživačkom timu, jedan RA čisti podatke, drugi provjerava kodiranje, treći potpisuje, i nikad jedna osoba za sve.

Suparnička petlja (adversarial loop). Ovo je srce dizajna. Kritičar (deck-critic) čita i nabraja svaku grešku, ali ne smije dirati datoteke. Zaseban ispravljač (deck-fixer) obavlja popravke, ali ne smije odobriti vlastiti rad. Kritičar zatim ponovno čita, i tako u krug, do čistog prolaza. Kritičar nema razloga biti popustljiv jer ne može popravljati, a ispravljač ne može prerano proglasiti pobjedu jer ne može potpisati. To je naprosto recenzija (peer review), i ona rješava glavni problem AI, a to je veselo objaviti da je sve u redu…i kad nije.

Na našem zadatku to izgleda ovako. Jedan specijalist renderira slajdove i pročita ih jedan po jedan, drugi provjerava ispada li koji blok izvan okvira. Kritičar javi da slajd 12 prelijeva preko ruba pa zadnji redak zaključka nestane sa zaslona (primjer greške koju provjera pravopisa ne bi uhvatila, jer iskoči tek kad se slajd projicira). Ispravljač skrati blok, kritičar ponovno provjeri.

Kako se to povezuje

Gore navedeni slojevi nisu zasebni elementi. To su datoteke koje surađuju na jednom zadatku, a posao teče u tri koraka.

Prvo plan. Na početku svake sesije učita se CLAUDE.md (stalna pravila), a čim AI dotakne neku datoteku, automatski se dodaju samo relevantni priručnici, pa se uz .qmd primjerice učita pravilo provjere. AI napiše plan, a onda ga vi odobrite.

Zatim izvođač. Vještina aktivira agente. Kritičar i specijalist za publiku (pazi je li poruka primjerena publici) samo čitaju, ispravljač popravlja, a kritičar ponovno provjerava, sve u petlji do čistog prolaza. Usput /render potvrdi da se HTML stvarno izgradio.

Na kraju ocjena. Dobijete ocjenu 0–100 i kratak sažetak, pa vi odobrite spremanje naredbom /commit.

Vi pokrenete vještinu (/…), ili je AI sam odabere iz vašeg zahtjeva, a ona zove agente. CLAUDE.md, pravila i memorija rade u pozadini kao kontekst. Agente nikad ne zovete izravno, a vi ste prisutni na dvije kontrolne točke, kod odobrenja plana i kod odobrenja spremanja.

Dva pravila koja održavaju poštenje

Svaki pregled završava ocjenom od 0 do 100, ali to nije ocjena u školskom smislu, nego prag koji odlučuje smije li rad dalje. Daje je kritičar, dakle onaj tko je rad pregledao, a ne onaj tko ga je napravio. Čita se kao semafor, a ljestvica je namjerno stroga. Ispod 80 je crveno: rad je blokiran i ne miče se dok se navedene greške ne isprave. 80 znači tek da je sigurno spremiti međuverziju, 90 da smije izaći pred publiku, a 95 je izvrsnost kojoj se teži, ne ona koja se podrazumijeva. Drugim riječima, prag za „spremi usput” namjerno je niži od praga za „pokaži drugima”. Dok prelijevanje slajda iz našeg primjera nije razriješeno, ocjena ostaje niska i posao stoji, baš kao što članak ispod praga ne prođe recenziju u časopisu. I kao u dobroj recenziji, povratna informacija govori što na radu ne valja, a ne tko je za to kriv.

Pravilo provjere zatvara najzavodljiviji način na koji AI zakaže, a to je da samouvjereno javi „gotovo” zato što mu se čini gotovim. Pravilo to ne dopušta: zadatak nije gotov dok AI nije stvarno kompajlirao, renderirao ili pokrenuo rezultat i vlastitim očima potvrdio da postoji. Kod slajdova to znači da su doista renderirani i HTML otvoren i provjeren, a ne da „izgleda dobro u glavi”. To je isti refleks koji ni vama ne da prijaviti rezultat dok niste ponovno pokrenuli analizu, samo pretočen u pravilo kojeg se alat mora držati.

Što preživi kad se chat napuni

Dugi razgovori se sažimaju, a živi chat je upravo ono što ne preživljava. Zato sve vrijedno čuvanja ide na disk, u četiri označene ladice. Ustav (CLAUDE.md) drži stalna pravila, dnevnik ispravaka drži lekcije da se ista greška ne ponovi, planovi (quality_reports/plans/) drže strategiju za trenutni zadatak, a dnevnici sesija drže zašto iza svake odluke. (Ovaj repozitorij zasad puni ustav i planove, a dnevnik ispravaka i dnevnike sesija dodajete kad zatrebaju, jer je to strop, ne pod.)

Na našem primjeru, zašto se blok prelio preko ruba, recimo zato što je tekst pisan za web-verziju koja se skrola pa prebačen na slajd s fiksnim okvirom, zapiše se u dnevnik, da sljedeća sesija ne troši sat na isto pitanje. Git bilježi što se promijenilo, a dnevnik bilježi zašto. Chat je ploča koja se briše, a ladice su laboratorijski dnevnik koji se ne briše. Time se zatvara krug našeg primjera. Ispravljač skrati slajd, kritičar ponovno provjeri, ocjena prijeđe 80 i tek tada /commit sprema ispravljenu verziju.

Griješi, i to je poanta

AI može izmisliti citat (halucinacija), pa agent za provjeru uspoređuje svaku referencu sa stvarnim katalogom. Može biti samouvjereno u krivu, pa kritičar ponovno provjerava, a prag blokira loš rad. Može poduzeti pogrešnu radnju, pa visokorizični koraci čekaju vaše odobrenje.

Regulator autonomije nije prekidač. Visokorizični koraci, poput brisanja datoteke, spremanja (commit) i slanja, čekaju vaše odobrenje, a niskorizični teku sami. Kao kod plana analize, unaprijed odlučite što je visokorizično, a što nije. Vi odlučujete gdje je sigurno popustiti uzde.

Trošak

Jeftini modeli odrađuju rutinu, skupi modeli razmišljaju. Svaki specijalist ima polje model: u svojoj datoteci, pa se posao usmjeri na pravu razinu, baš kao što unaprijed odlučite koji RA smije potpisati koji korak protokola. Visokorizični zadaci, poput provjere tvrdnji i finalne ocjene, namjerno idu na skuplji, sposobniji model.

Model Uloga Udio (ilustrativno)
Haiku 4.5 brz i jeftin, mehanički posao ~70%
Sonnet 4.6 srednji, pregled i kritika ~20%
Opus 4.8 vrhunski, prosudba ~10%

Kvaliteta mehaničkog posla pritom ništa ne gubi, a račun zna pasti i za pola, ovisno o poslu (ilustrativna procjena). Ne plaćate redovitog profesora da preoblikuje citate. (Nazivi modela i cijene se mijenjaju, pa provjerite na anthropic.com/pricing.)

Počnite malim koracima

Cijeli ovaj repozitorij je samo jedan ustav (CLAUDE.md), četiri pravila, četiri vještine i tri agenta. Zapravo ni to ne trebate odjednom. To je strop, a ne pod. Počnite s ustavom i tri vještine, dakle /render, /proofread i /commit, a novo pravilo ili specijalista dodajte tek kad stvarno osjetite da nedostaje.

Konkretno, ovaj tjedan odaberite jedan dosadan, mehanički zadatak koji biste dali asistentu prve godine. Napišite ga kao specifikaciju zadatka (task spec), dakle cilj, ograničenja i kako izgleda „gotovo”. Pustite agenta da ga isplanira, odobrite plan, pa pregledajte rezultat prema vlastitim mjerilima. Taj jedan pokus nauči vas više od bilo kojeg slajda.

Kako zapravo radite

Razgovarate s istim AI-jem kroz tri glavna sučelja (isti obrazac vrijedi za Claude Code, Codex i druge alate). Chat (npr. claude.ai) je poznat, ali ne dira vaše datoteke, pa je dobar za učenje, ne za projekt. Ekstenzija u VS Codeu (plugin) je AI asistent unutar uređivača, gdje vidite datoteke, gumbe i klik za odobrenje. To je preporuka za početak. Terminal (CLI) znači da utipkate claude (ili codex) u mapi projekta, što je najizravnije i najmoćnije. Agenti, vještine i pravila rade i u ekstenziji i u terminalu (tu je „gradilište”), a jedino ih chat ne vidi.

Klonirajte i isprobajte

Preduvjeti su Claude Code, Node.js i git, a po potrebi i Quarto i R. Za interaktivni rad u VS Codeu Claude Pro (~20 $/mj) je dovoljan za početak, a detalji o planovima i naplati agentskog rada su u Postavljanju. (Cijene se mijenjaju, pa provjerite i na anthropic.com/pricing.) Najbolje je ne ostati na teoriji. Klonirajte repozitorij i isprobajte ga sami.

git clone https://github.com/lusiki/AI-radionica-za-istra-iva-e.git

Otvorite mapu u VS Codeu (ili pokrenite claude u terminalu) i napravite dva mala pokusa.

Pokus 1, /render. Utipkate naredbu, AI pokrene quarto render, pa provjeri da slides/talk.html stvarno postoji prije nego javi „gotovo”. Tek tada je doista dovršeno.

Pokus 2, /review-deck. Dva agenta koja samo čitaju, kritičar (deck-critic) i specijalist za publiku (audience-reviewer), nađu greške, pri čemu kritičar k tome dâ ocjenu 0–100. Ispravljač ih popravi, a kritičar ponovno provjeri. Onaj tko nalazi greške ne smije ih sam popravljati, jer to je recenzija, automatizirana. Korak po korak vodi vas vođena vježba.

Pod haubom, stvarne datoteke

Do sada je sve bilo običan jezik. Ako želite zaviriti u strojarnicu, otvorite blokove ispod. Prva četiri su stvarne datoteke iz ovog repozitorija, baš one koje pokreću prethodno spomenute procedure, a zadnji je ilustracija obrasca.

.claude/skills/render/SKILL.md · vještina koju pokreće /render (Pokus 1, skraćeno)
---
name: render
description: Render the Quarto RevealJS deck to HTML and verify it actually built.
argument-hint: "[path to .qmd — defaults to slides/talk.qmd]"
---

# Steps
1. Resolve target. Use the argument if given, otherwise `slides/talk.qmd`.
2. Check the tool exists. Run `quarto --version`. If missing, STOP and tell the user
   to install it — do NOT pretend the render succeeded (the verification rule).
3. Render. Run `quarto render <target>`.
4. VERIFY (mandatory). Confirm the command exited 0 AND the output `.html` exists.
   You may not say "done" without this check.
5. If it failed, read the error, fix the `.qmd`, and re-render. Loop until it builds.
.claude/agents/deck-critic.md · agent kojeg pokreće /review-deck (Pokus 2)

Ovaj agent dobiva samo pravo čitanja. Ne može mijenjati datoteke, pa nema razloga biti blag.

---
name: deck-critic
description: Read-only adversarial critic for the deck. Finds faults, scores 0–100.
model: sonnet                 # ~20% middle tier (70/20/10)
tools: Read, Grep, Glob       # no Edit/Write → cannot change files
---

You are a skeptical reviewer. You CANNOT edit files — only find faults, so you have
no incentive to go easy. Review in separate passes:
1. Substance — wrong / unverifiable / overstated claims?
2. Clarity — one takeaway per slide?
3. Consistency — same concept named the same way (cross-check the glossary)?
4. Overflow — anything that runs off the slide?

Output: findings grouped Critical / Major / Minor + a single score 0–100 +
a verdict APPROVED / NEEDS WORK. Default to flagging when unsure.
.claude/rules/verification-protocol.md · pravilo (učitava se uz .qmd)

Bez ovoga bi vjerovanje došlo prije provjeravanja, a ne smije tako biti.

---
description: Never declare a slide task done without actually rendering it.
paths: ['**/*.qmd', 'slides/**']     # loads ONLY on these files
---

# Verification Protocol
You may NOT report a deck task "done" until you have rendered it and confirmed the
output exists.
- After any edit to a `.qmd`, run `/render` (quarto render + check the `.html` exists).
- If the render fails: read the error, fix, re-render. Loop until it builds clean.
"Done" means rendered and verified, never "looks right in my head".
CLAUDE.md · ustav (skraćeno — cijela datoteka u repozitoriju)
# CLAUDE.md — Project Constitution

> Slim "constitution" Claude reads at the start of every session
> (~120 lines max; detail lives in path-scoped rules).

## Core principles
1. Plan before building anything non-trivial. Show me the plan first.
2. Verify before declaring done — actually render / run the thing.
3. Audience first: non-technical methodologists. Delegation & rigour, not "faster chatbot".
4. Specialists beat a generalist; a critic that can't edit + a fixer that can't bless itself.
5. Write decisions to disk, not just chat.

## Skills (the buttons)
| Command      | What it does                                      |
|--------------|---------------------------------------------------|
| /render      | build the deck to HTML and verify it rendered     |
| /proofread   | grammar / consistency / overflow pass             |
| /commit      | stage + commit — only after I say so              |
| /review-deck | adversarial critic→fixer loop, then a 0–100 score |

# … (skraćeno)
Ilustracija: kako se model bira po zadatku (polje model:)

Polje model: u svakoj datoteci bira razinu. Ispravljač vozi na jeftinom (haiku), kritičar na srednjem (sonnet) modelu, a vrhunska razina (opus) ilustrira najskuplji sloj za najtežu prosudbu.

# .claude/agents/deck-fixer.md  — mehanički popravci
---
name: deck-fixer
model: haiku        # brzo i jeftino → ~70% posla
tools: Read, Edit, Write
---

# .claude/agents/deck-critic.md — pregled i ocjena
---
name: deck-critic
model: sonnet       # prosudba pri pregledu → ~20%
tools: Read, Grep, Glob
---

# visoka prosudba (urednik, provjera tvrdnji) → model: opus   (~10%)

Pogledajte i isprobajte

Materijali