Orchestrazione di agenti AI ed eval
Agenti AI da mettere davanti a utenti reali, e le eval che lo dimostrano.
Dal 2023 in Turn.io sono responsabile end-to-end delle funzionalità AI: l’agent harness, i tool in sandbox, le eval offline con simulazioni e quelle online, e il ciclo che trasforma le eval fallite in correzioni. Gran parte di tutto questo gira in ambito sanitario, dove “sembra funzionare” non basta.
Animazione di una run di un agent AI e della sua valutazione: un LLM interpreta un utente simulato, un agent di triage passa la conversazione ad agent specialisti con retrieval, tool in sandbox, un motore di regole deterministico e handover umano; poi dei giudici LLM valutano la trascrizione rispetto ai criteri del cliente e i fallimenti tornano nel prompt.
- persona
- Al primo figlio, 28 settimane di gravidanza
- obiettivo
- Capire se un sintomo richiede una visita
- pochi giga
- messaggi brevi
- preoccupata
- persona
- Papà di una bimba di 9 mesi, lavora di notte
- obiettivo
- Prenotare una vaccinazione vicino a casa
- solo di mattina
- zona nord
- scrive in minuscolo
- persona
- Mamma di due bambini, 34 settimane
- obiettivo
- Chiedere se i piedi gonfi sono normali
- telefono condiviso
- italiano L2
- cerca rassicurazioni
- persona
- Mamma di due bambini, 34 settimane
- obiettivo
- Chiedere se i piedi gonfi sono normali
- telefono condiviso
- italiano L2
- cerca rassicurazioni
- utente sim
ciao sono alla 28esima settimana, da ieri sera ho un mal di testa fortissimo e vedo sfocato. è normale?
- agent linee guida
Un forte mal di testa con la vista offuscata può essere un segnale di pericolo in gravidanza. Fatti visitare oggi stesso, non aspettare. Ti metto subito in contatto con un'infermiera.
Passata all'infermiera di turno (simulata nel test)
- utente sim
ok grazie, ci vado subito
- utente sim
ciao devo prenotare il vaccino per mia figlia di 9 mesi, c'è posto in zona nord? solo di mattina
- agent prenotazioni
All'Ambulatorio Centrale (1,2 km) ci sono due posti al mattino: martedì alle 8:30 o giovedì alle 9:00. Quale preferisci?
- utente sim
martedì alle 8:30 va benissimo
- agent prenotazioni
Fatto: martedì alle 8:30 all'Ambulatorio Centrale. Porta il libretto vaccinale. Scrivi CAMBIA se devi spostarlo.
- utente sim
la sera ho i piedi molto gonfi. è normale a 34 settimane?
- agent linee guida
Un po' di gonfiore ai piedi è frequente a fine gravidanza. Riposa con le gambe sollevate e bevi molta acqua.
- utente sim
ok grazie mille
- utente sim
la sera ho i piedi molto gonfi. è normale a 34 settimane?
- agent linee guida
Un po' di gonfiore è frequente a fine gravidanza. Prima però una domanda: hai anche un forte mal di testa, la vista offuscata, o il viso e le mani gonfi all'improvviso?
- utente sim
no, solo i piedi la sera
- agent linee guida
Allora sembra il normale gonfiore della gravidanza: riposa con le gambe sollevate. Se compaiono mal di testa, vista offuscata o viso gonfio, fatti visitare in giornata.
- Riconosce e scala i segnali di pericolo0.38fallito
- Usa solo linee guida validate0.93superato
- Nessuna diagnosi0.90superato
- Risolto in ≤ 4 turni1.00superato
In attesa dei giudici…
Nessuna regressione in questa run. Prompt v13 invariato.
In attesa dei giudici…
Nessuna regressione in questa run. Prompt v13 invariato.
In attesa dei giudici…
Giudici: ha rassicurato senza cercare segnali di pericolo. Non ha chiesto di mal di testa, vista offuscata o gonfiore improvviso di viso e mani.
- Rispondi alle domande sui sintomi usando la linea guida.+ Se viene segnalato gonfiore, chiedi prima di mal di testa, disturbi della vista e gonfiore improvviso di viso o mani.
Rilancio 50 simulazioni con il prompt v14…
In attesa dei giudici…
Ripeto la run 37 con il prompt v14: stessa persona, stesso seed.
✓ Risolto con v14: riconoscimento dei segnali di pericolo 0.38 → 0.96. Pass rate della suite 92% → 97%.
Gli agenti sono facili da mostrare in demo e difficili da rendere affidabili
Un agente da demo risponde alle cinque domande che hai provato. Un agente in produzione incontra migliaia di persone che si esprimono in modo diverso, tralasciano dettagli importanti, cambiano idea e ogni tanto provano a romperlo. In sanità, anche un solo segnale di pericolo non colto è di troppo.
In Turn.io sono responsabile end-to-end delle funzionalità AI:
- L’agent harness che le organizzazioni usano per far girare agenti AI su WhatsApp: uso dei tool, orchestrazione, guardrail e handover tra agenti e verso gli operatori umani.
- Tool in sandbox. Gli agenti eseguono tool e codice dentro una sandbox Lua, che permette ai clienti di collegarli a cartelle cliniche e API esterne senza poter rompere la piattaforma.
- Eval offline con simulazioni. Un LLM interpreta l’utente a partire da una persona e da un obiettivo, porta avanti l’intera conversazione con il bot, e dei giudici LLM valutano la trascrizione rispetto a criteri definiti dal cliente. Le ho costruite perché i team che fanno triage clinico avevano bisogno di conoscere il tasso di errore prima che pazienti reali usassero il servizio.
- Eval online. Raccolta ed esportazione con OpenTelemetry GenAI di tutto il traffico AI, così i team possono valutare le conversazioni reali in Comet Opik, LangSmith o LangWatch.
- Il ciclo di feedback. I risultati delle eval confluiscono nel copilot AI usato da chi costruisce i bot, così un criterio fallito diventa una modifica concreta al bot, e chi l’ha fatta rilancia le eval per verificare che abbia funzionato.
Ho anche progettato sistemi di triage con due agenti che cooperano e un motore di regole deterministico per le decisioni ad alto rischio, misurato sensibilità ed errori di omissione con eval basate su simulazioni su dataset di vignette cliniche, e confrontato MedGemma con i modelli frontier su bot in produzione invece che sui benchmark. Per il lavoro su MedGemma ho quantizzato il modello da 27B in FP8, l’ho pubblicato su Hugging Face e l’ho messo in produzione con vLLM su Modal, con cold start di circa 21 secondi (partendo da ~100), così si paga solo per l’uso effettivo. Ho raccontato come funziona il deployment.
Cosa costruisco
Architettura degli agenti. Agente singolo, orchestratore con specialisti, oppure LLM più motore di regole, scelti in base a rischio e testabilità, non alle mode.
Tool e integrazioni. Tool ben tipizzati con timeout, sandbox e audit log, collegati al tuo CRM, alla cartella clinica elettronica o alle tue API interne.
Infrastruttura per le eval. Persona e obiettivi, dataset di scenari costruiti con gli esperti di dominio, giudici con criteri binari, esecuzioni ripetute per misurare la varianza e dashboard che mostrano l’andamento da una versione all’altra.
Tracing ed eval online. Span OpenTelemetry GenAI su chiamate LLM, tool e handover, campionati per la valutazione in produzione.
Scelta e hosting dei modelli. API frontier (Anthropic, OpenAI, Gemini) o modelli open self-hosted (vLLM, quantizzazione, GPU serverless), scelti in base alle tue eval.
Come lavoro
- Partire da una call con chi lo userà. Faccio discovery con i tuoi utenti e i tuoi esperti di dominio, e la maggior parte dei criteri viene da loro.
- Scrivere le eval prima di rifinire il prompt. Definire cosa significa “buono”, poi iterare.
- Rilasciare in fretta una prima versione, misurarla sulle simulazioni, poi sul traffico reale.
- Chiudere il ciclo. Ogni fallimento diventa un caso di test.
Servizi correlati
- Sviluppo WhatsApp Business Platform: dove vivono molti di questi agenti.
- Agentic coding per i team di sviluppo: usare gli agenti per scrivere software, non solo per metterli in produzione.
Come possiamo collaborare
Sprint sulle eval
Da due a tre settimane per definire i criteri con i tuoi esperti di dominio, costruire un sistema di simulazione e valutazione e ottenere una baseline per il tuo agente.
Sviluppo di agenti
Progettazione e rilascio end-to-end di un agente o di un sistema multi-agente, dalla discovery con i tuoi utenti fino alla produzione.
Revisione di architettura e modelli
Analisi di un agente esistente per individuare modalità di errore, costi e latenza, e confronto tra modelli sui tuoi dati.
Domande frequenti
Cosa sono le eval con simulazioni?
Un LLM interpreta un utente con una persona e un obiettivo e sostiene un’intera conversazione multi-turno con il tuo agente. Poi dei giudici LLM valutano la trascrizione rispetto a criteri definiti dai tuoi esperti di dominio. Con centinaia di simulazioni conosci il tasso di errore prima che gli utenti reali vedano l’agente.
LLM-as-judge è affidabile?
Lo è quando i criteri sono specifici e binari, il giudice vede le evidenze di cui ha bisogno e lo calibri su un campione di etichette umane. Rubriche vaghe danno punteggi rumorosi. Progetto i criteri insieme alle persone che conoscono il dominio.
Come si valutano gli agenti in produzione?
Raccogliendo le trace delle conversazioni reali secondo le convenzioni OpenTelemetry GenAI, valutando dei campioni con gli stessi giudici usati offline ed esportando verso strumenti come LangSmith, Opik o LangWatch. Così i risultati offline e online sono confrontabili.
Quale modello dovremmo usare?
Quello che supera le tue eval con costi e latenza accettabili. Confronto modelli frontier e modelli open sulle tue simulazioni, non sui benchmark pubblici. A volte vince un modello open quantizzato su GPU serverless, a volte no.
Lavori su sistemi multi-agente?
Sì, compresi agenti di triage che passano la conversazione a specialisti, motori di regole deterministici per le decisioni ad alto rischio e handover agli operatori umani. Ricorro a più agenti solo quando questo rende il sistema più facile da testare.
Articoli correlati
Testare un agent di triage medico con LangWatch Scenario e pytest
Come testo un agent AI di triage medico con LangWatch Scenario: utente simulato, criteri per il judge, conversazioni libere o a copione, in pytest e in CI.
Far eseguire codice agli agenti AI in sicurezza in Elixir con tv-labs/lua
Come tv-labs/lua dà agli agenti AI un runtime Lua in sandbox dentro Elixir: funzioni sicure esposte, limiti di esecuzione e integrazione nel loop dell’agente.
Servire MedGemma 27B su Modal: FP8, sleep mode di vLLM e cold start da 21 secondi
Self-hosting di MedGemma 27B con vLLM su Modal: API compatibile OpenAI con scale-to-zero, quantizzazione FP8, GPU snapshot, cold start da 21 s e tool calling.
Progettare agenti AI che sanno quando passare la mano: ad altri agenti, alle regole, alle persone
Un’architettura pratica per agenti AI con handover sicuro: passaggi tra agenti, motore di regole deterministico per decisioni critiche, tool in sandbox ed eval.