Personalizirani AI asistenti koji znaju svog korisnika
Asistenti koji nastavljaju ondje gdje je prošli razgovor stao: pamte mjesecima, koriste više od 40 alata, odgovaraju tekstom ili glasom i primaju datoteke — a nude se kroz trgovinu persona, svaka sa svojim karakterom i glasom.
Izazov
Klijent je htio asistente koji s korisnikom grade odnos, a ne chatbote koji svaki put kreću ispočetka. To nije pitanje prompta nego sustava: memorija mora preživjeti mjesece razgovora, a da kontekst ne naraste toliko da svaki odgovor postane spor i skup; model mora smjeti djelovati, ali ne i napraviti štetu; i sve to mora biti dovoljno sigurno da se otvori korisnicima koji plaćaju.
Naš pristup
Memoriju smo razdvojili u slojeve umjesto u jedan kontekst koji samo raste: tekući razgovor, prošli razgovori grupirani u epizode i dugoročni sloj u kojem se činjenice sažimaju u graf znanja. Dohvat je semantički, uz filtre po metapodacima, u prompt ulazi samo nekoliko najvažnijih zapisa, a trajni reflection pipeline memoriju sažima i čisti po rasporedu, a ne tek kad zatreba. Asistent djeluje kroz ReAct petlju s više od 40 alata i čvrstom gornjom granicom broja iteracija, uz prompt caching i extended thinking da latencija i trošak ostanu predvidivi te eval skup na kojem se svaka promjena prompta ili alata ocijeni prije isporuke. Alati stoje iza vlastitog autentificiranog servera, a svaki asistent dobiva osobnost složenu iz slojevitih system promptova i vlastiti generirani glas.
Rezultati
Platforma je isporučena s trgovinom asistenata, probnim pretplatama i administratorskim sučeljem. Razgovori se nastavljaju kroz mjesece, a da trošak konteksta ne raste s njima; asistent odgovara tekstom ili glasom i prima datoteke, a sve izloženo prema van zaštićeno je prije nego što je platformu vidio prvi korisnik koji plaća.
Što smo napravili
- Memoriju smo posložili u slojeve — tekući razgovor, epizode, dugoročni sloj — da kontekst ostane malen i kad se razgovori nižu mjesecima
- Dugoročni sloj modelirali smo kao graf znanja sa semantičkim vektorskim dohvatom, pa asistent zna kako su činjenice povezane, a ne samo koje postoje
- Napravili smo sloj dohvata: semantička pretraga s filtrima po metapodacima, a u prompt ulaze samo najvažniji zapisi
- Sažimanje i čišćenje memorije stavili smo na trajne zakazane workflowe, pa se memorija održava sama, bez ručnog rada
- Postavili smo ReAct petlju s više od 40 alata, s čvrstom gornjom granicom broja iteracija, uz prompt caching i extended thinking
- Složili smo eval skup od stvarnih razgovora i na njemu ocjenjivali svaku promjenu prompta i alata prije isporuke
- Alate smo izdvojili u zaseban server s autentikacijom, na standardnom protokolu
- Osobnost svakog asistenta složili smo iz slojevitih system promptova i dali mu vlastiti generirani glas
- Sve što je izloženo prema van zaštitili smo po standardima za LLM sustave: obrana od prompt injectiona, najmanja moguća prava za svaki alat i zapis svakog poziva
- Isporučili smo trgovinu asistenata, probne pretplate i administratorsko sučelje