Skoči na glavni sadržaj
Natrag na AI agenti vodič

Oriphiel AI agenti vodič

Evaluacija agentic workflowa

Kako mjeriti kvalitetu AI agenata: zlatni skup primjera, rubni slučajevi, tool accuracy, trajectory eval i ljudska ocjena.

Oriphiel stručni tim Ažurirano 21. 7. 2026. 4 min čitanja

Odgovor ukratko

Evaluacija agenta mora provjeriti više od finalnog teksta. Treba gledati je li odabrao pravi alat, dao ispravne argumente, prepoznao rizik, koristio relevantan izvor, stao kada treba i vratio strukturiran izlaz. U OpenClaw-u eval skup treba sadržavati stvarne leadove, email odgovore, loše podatke, opt-out poruke i edge caseove.

Ključne odluke

  • Eval skup treba biti verzioniran i reprezentativan za stvarne CRM slučajeve.
  • Mjeriti treba finalni rezultat i putanju alata.
  • Rubni slučajevi su važniji od lijepih demo primjera.
  • Agent se ne širi na veću autonomiju dok evali ne pokažu stabilnost.

Provedba korak po korak

Cilj ove lekcije je znati radi li agent bolje od ručnog procesa. Korake treba provoditi redom i svaki potvrditi prije širenja opsega.

Preporučeni redoslijed

  • Pripremiti zlatni skup anonymiziranih primjera s očekivanim izlazom.
  • Dodati metrike za tool selection, argument accuracy, schema validity i business outcome.
  • Usporediti modele i prompt verzije nad istim skupom.
  • Ručno pregledati uzorak produkcijskih runova svaki tjedan.

Praktičan primjer

Praktičan primjer za developere i vlasnike kvalitete: tim prvo provodi korak „Pripremiti zlatni skup anonymiziranih primjera s očekivanim izlazom.”, zatim provjerava „Potvrđena je ključna odluka: Eval skup treba biti verzioniran i reprezentativan za stvarne CRM slučajeve.”. Odluka o nastavku ne donosi se prema dojmu, nego prema pokazatelju „Schema pass rate.”.

Kontrolna lista prije nastavka

Ova provjera odvaja završenu implementaciju od postavke koja samo izgleda dovršeno.

Provjerite

  • Potvrđena je ključna odluka: Eval skup treba biti verzioniran i reprezentativan za stvarne CRM slučajeve.
  • Testiran je prvi korak provedbe: Pripremiti zlatni skup anonymiziranih primjera s očekivanim izlazom.
  • Dogovoreno je početno mjerenje: Schema pass rate.

Najčešće pogreške i rizici

Rizike treba provjeriti prije povećanja prometa, automatizacije ili ovlasti sustava.

Na što treba paziti

  • Agent se testira samo na idealnim primjerima.
  • Mjeri se je li odgovor zvučao dobro, ne je li bio točan.
  • Promjena modela prođe bez regresijskog testa.
  • Eval skup sadrži osobne podatke bez potrebe.

Mjerenje rezultata

Učinak se procjenjuje kroz mali skup metrika koje su povezane s ciljem lekcije i stvarnim poslovnim ishodom.

Metrike koje imaju smisla

  • Schema pass rate.
  • Tool selection accuracy.
  • Business decision accuracy.
  • Human review score.
  • Regression failures po verziji.

Česta pitanja

Koji je prvi korak za temu „Evaluacija agentic workflowa”?

Pripremiti zlatni skup anonymiziranih primjera s očekivanim izlazom. Prije nastavka potvrdite odluku: Eval skup treba biti verzioniran i reprezentativan za stvarne CRM slučajeve.

Kako provjeriti da je provedba uspješna?

Potvrđena je ključna odluka: Eval skup treba biti verzioniran i reprezentativan za stvarne CRM slučajeve. Nakon toga pratite metriku: Schema pass rate..

Koju pogrešku treba prvo spriječiti?

Agent se testira samo na idealnim primjerima. Problem ispravite prije automatizacije ili povećanja budžeta.

Službeni i stručni izvori

Sučelja, pravila i preporuke mogu se mijenjati. Prije produkcijske izmjene provjerite aktualnu dokumentaciju.

Primijenite lekciju na stvarni projekt

Pošaljite postojeću konfiguraciju, cilj i problem koji želite riješiti. Dobit ćete prijedlog sljedećeg tehničkog ili operativnog koraka.