Nielsen Norman Group: Jedan AI output je primer, ne evaluacija
O čemu je članak
Raluca Budiu, principais istraživač u Nielsen Norman Group, objavila je ovaj članak u avgustu 2026. godine kako bi ukazala na česta grešku produktnih i dizajn timova pri evaluaciji AI funkcija: testiranje funkcije jednom, videti da radi i zaključiti da radi pouzdano.
Suštinski argument je precizan. Jedan uspešan output pokazuje da sistem može izvršiti zadatak. Ne pokazuje koliko često ili konzistentno će to činiti. Ova distinkcija je važna jer su jezički modeli nedeterministički — uzorkuju iz distribucija verovatnoće umesto da prate fiksna pravila. Isti input može u različitim pokušajima dati outpute različitog kvaliteta.
Problem sa jednokratnim testiranjem
Produktni timovi obučeni na determinističkom softveru očekuju konzistentno ponašanje kroz pokušaje. Funkcija ili radi ili ne radi. AI sistemi ne funkcionišu na taj način, a njihova evaluacija kao da je tako dovodi do pogrešnih zaključaka.
Budiu opisuje dve vrste varijabilnosti koje evaluacije moraju meriti odvojeno. Varijabilnost test inputa zahvata performanse kroz različite inpute — da li sistem dobro radi na lakim slučajevima ali pada na rubnim, ili dobro obrađuje varijacije. Varijabilnost od pokušaja do pokušaja zahvata nekonzistentnost kada isti input u različito vreme daje outpute različitog kvaliteta.
Članak demonstrira da dva AI sistema sa identičnim stopama uspešnosti mogu imati fundamentalno različite obrasce grešaka. Jedan može biti nepredvidiv — radi dobro u nekim pokušajima, a loše u drugima bez prepoznatljivog obrasca. Drugi može biti predvidiv — dobro radi na većini tipova inputa ali konzistentno pada na specifičnoj kategoriji. Jedinstvena ukupna stopa uspešnosti prikriva ovu distinkciju, a ona je važna za odluku da li je funkcija spremna za produkciju.
Kako izgleda rigorozna evaluacija
Okvir koji predlaže članak primenjuje principe kvantitativnih istraživanja na evaluaciju AI:
- Više reprezentativnih inputa, a ne samo primeri za koje tim već zna da rade
- Ponovljeni pokušaji po inputu za merenje konzistentnosti kroz distribuciju verovatnoće
- Proseci sa intervalima poverenja umesto tačkastih stopa uspešnosti
Posledične odluke — lansiranje funkcije, odabir AI vendora, tvrdnje o poboljšanju kvaliteta — zahtevaju ovaj nivo rigoroznosti. Rana istraživanja razumno mogu da se oslone na pojedinačne pokušaje, ali produkcione odluke na to ne bi trebalo.
Za koga je korisno
Korisno za dizajnere i produktne menadžere odgovorne za kvalitet AI funkcija. Posebno relevantno za timove koji pripremaju lansiranje AI funkcija i za one koji sprovode evaluaciju AI vendora. Okvir se primenjuje i na korisničko istraživanje: testiranje AI interfejsa zahteva istu pažnju prema varijaciji inputa i konzistentnosti pokušaja koju članak preporučuje za tehničku evaluaciju.