Skip to main content

Prompt versioning i regresijski testovi

Natrag na AI agenti vodič

Oriphiel AI agenti vodič

Prompt versioning i regresijski testovi

Kako upravljati promptovima kao kodom: verzije, changelog, eval skupovi, rollout, rollback i usporedba modela.

Što ova AI-agent tema rješava

AI agent ima smisla samo ako rješava konkretan zadatak: razumije tekst, koristi relevantan kontekst, poziva dopuštene alate, vraća strukturirani izlaz ili pomaže čovjeku donijeti bolju odluku. Dobar agent nije samo chat odgovor, nego kontrolirani workflow s pravilima, logovima i mjerljivim ishodom.

Prompt je dio aplikacije. Kada se promijeni system prompt, alat opis, output schema ili model, agent može promijeniti ponašanje iako se backend kod nije promijenio. OpenClaw treba verzionirati promptove, vezati run uz prompt version i pokrenuti regresijske testove prije produkcijskog rollouta.

Ključne odluke

  • Promptovi trebaju biti u repozitoriju ili kontroliranom storageu s verzijama.
  • Svaki agent run treba znati prompt version i model version.
  • Promjena prompta treba proći isti eval skup kao promjena modela.
  • Rollback mora biti brz i dokumentiran.

Kako primijeniti u praksi

Praktična provedba počinje malim opsegom: jedan agent, jedan zadatak, jasna ulazna polja, ograničeni alati, validiran izlaz i ljudska provjera gdje postoji rizik. Nakon toga se šire modeli, RAG, multi-agent orkestracija, routing i automatizirano izvršavanje.

Koraci provedbe

  • Izvući promptove iz ad hoc teksta u verzionirane definicije.
  • Dodati changelog za cilj promjene i očekivani efekt.
  • Pokrenuti regression eval prije aktivacije.
  • Uvesti canary rollout za novi prompt na manjem opsegu.

Najčešće pogreške

Najčešća pogreška je preveliko povjerenje u prompt i premalo povjerenje u backend kontrole. Prompt pomaže modelu, ali dozvole, validacija, idempotentnost, audit log, sandbox, evaluacija i rollback moraju biti dio sustava.

Na što treba paziti

  • Prompt se promijeni iz UI-ja bez traga.
  • Tool opis se izmijeni i slomi izbor alata.
  • Novi prompt riješi jedan slučaj, ali pokvari opt-out detekciju.
  • Nema mogućnosti vratiti staru verziju.

Mjerenje i kontrola

AI agent treba imati svoje metrike: točnost, schema pass rate, tool call greške, latenciju, trošak, prihvaćanje prijedloga, broj ručnih korekcija i incidente. Bez mjerenja se ne zna je li agent stvarno bolji od ručnog procesa.

Metrike koje imaju smisla

  • Prompt verzije u produkciji.
  • Regression pass rate.
  • Canary incidenti.
  • Rollback vrijeme.
  • Kvaliteta po prompt verziji.

AI-agent pristup

Pouzdan AI-agent pristup povezuje model, context builder, tool dispatcher, strukturirani izlaz, memoriju, retrieval, permission matricu, evaluacije i monitoring. Besplatni open-source framework može smanjiti ulazni trošak, ali produkcijski trošak modela, hostinga, GPU/CPU resursa, observabilityja i održavanja treba računati zasebno.

Što se provjerava prije produkcije

  • Je li agentov zadatak dovoljno uzak i mjerljiv.
  • Jesu li alati definirani kroz jasnu shemu i backend validaciju.
  • Postoji li ljudska provjera za rizične akcije.
  • Jesu li prompt, model, output schema i eval skup verzionirani.
  • Postoji li audit log, budget limit, fallback i testiran kill switch.

Česta pitanja

Je li tema "Prompt versioning i regresijski testovi" vezana samo uz OpenClaw?

Ne. Tema je objašnjena kao opći AI-agent koncept, a OpenClaw se koristi kao praktičan primjer CRM i automatizacijskog procesa u kojem se taj koncept može sigurno primijeniti.

Jesu li open-source AI agenti stvarno besplatni?

Framework može biti besplatan za self-hosting prema svojoj licenci, ali model API, lokalni GPU/CPU resursi, server, baza, monitoring, sigurnost i održavanje nisu automatski besplatni.

Može li AI agent samostalno mijenjati CRM?

Može samo ako mu backend to tehnički dopusti. Za produkciju je zdravije krenuti od prijedloga i nacrta, a write akcije pustiti tek nakon dozvola, validacije, evaluacija, audit loga i po potrebi ljudske potvrde.