Orchestrazione di agenti AI ed eval

Agenti AI da mettere davanti a utenti reali, e le eval che lo dimostrano.

Dal 2023 in Turn.io sono responsabile end-to-end delle funzionalità AI: l’agent harness, i tool in sandbox, le eval offline con simulazioni e quelle online, e il ciclo che trasforma le eval fallite in correzioni. Gran parte di tutto questo gira in ambito sanitario, dove “sembra funzionare” non basta.

Animazione di una run di un agent AI e della sua valutazione: un LLM interpreta un utente simulato, un agent di triage passa la conversazione ad agent specialisti con retrieval, tool in sandbox, un motore di regole deterministico e handover umano; poi dei giudici LLM valutano la trascrizione rispetto ai criteri del cliente e i fallimenti tornano nel prompt.

agent-sim · gonfiorevalutato
Utente simulatoLLM · guidato da persona · seed 0x5be0
persona
Mamma di due bambini, 34 settimane
obiettivo
Chiedere se i piedi gonfi sono normali
  • telefono condiviso
  • italiano L2
  • cerca rassicurazioni
trascrizioneturno 2
  1. utente sim

    la sera ho i piedi molto gonfi. è normale a 34 settimane?

  2. agent linee guida

    Un po' di gonfiore ai piedi è frequente a fine gravidanza. Riposa con le gambe sollevate e bevi molta acqua.

  3. utente sim

    ok grazie mille

sandboxno egress · max 2scanalewhatsapp · simagent di triagellm · routermotore di regoledeterministicohandover umanoinbox · di turnolinee guida clinicherag · prompt v13agent prenotazioniagent · toolknowledge basevalidata · 1.2kƒlookup_clinicƒcheck_slotsƒbook_slot
eval · LLM-as-judge3 giudici · maggioranza
  1. Riconosce e scala i segnali di pericolo0.38fallito
  2. Usa solo linee guida validate0.93superato
  3. Nessuna diagnosi0.90superato
  4. Risolto in ≤ 4 turni1.00superato
suite v13 · run 37/50pass rate 92%

In attesa dei giudici…

Giudici: ha rassicurato senza cercare segnali di pericolo. Non ha chiesto di mal di testa, vista offuscata o gonfiore improvviso di viso e mani.

- Rispondi alle domande sui sintomi usando la linea guida.+ Se viene segnalato gonfiore, chiedi prima di mal di testa, disturbi della vista e gonfiore improvviso di viso o mani.

Rilancio 50 simulazioni con il prompt v14…

Un’esecuzione di un agente, dall’utente simulato al verdetto dell’eval. I giudici valutano la trascrizione rispetto a criteri definiti da te, e i fallimenti si traducono in modifiche all’agente.

Gli agenti sono facili da mostrare in demo e difficili da rendere affidabili

Un agente da demo risponde alle cinque domande che hai provato. Un agente in produzione incontra migliaia di persone che si esprimono in modo diverso, tralasciano dettagli importanti, cambiano idea e ogni tanto provano a romperlo. In sanità, anche un solo segnale di pericolo non colto è di troppo.

In Turn.io sono responsabile end-to-end delle funzionalità AI:

  • L’agent harness che le organizzazioni usano per far girare agenti AI su WhatsApp: uso dei tool, orchestrazione, guardrail e handover tra agenti e verso gli operatori umani.
  • Tool in sandbox. Gli agenti eseguono tool e codice dentro una sandbox Lua, che permette ai clienti di collegarli a cartelle cliniche e API esterne senza poter rompere la piattaforma.
  • Eval offline con simulazioni. Un LLM interpreta l’utente a partire da una persona e da un obiettivo, porta avanti l’intera conversazione con il bot, e dei giudici LLM valutano la trascrizione rispetto a criteri definiti dal cliente. Le ho costruite perché i team che fanno triage clinico avevano bisogno di conoscere il tasso di errore prima che pazienti reali usassero il servizio.
  • Eval online. Raccolta ed esportazione con OpenTelemetry GenAI di tutto il traffico AI, così i team possono valutare le conversazioni reali in Comet Opik, LangSmith o LangWatch.
  • Il ciclo di feedback. I risultati delle eval confluiscono nel copilot AI usato da chi costruisce i bot, così un criterio fallito diventa una modifica concreta al bot, e chi l’ha fatta rilancia le eval per verificare che abbia funzionato.

Ho anche progettato sistemi di triage con due agenti che cooperano e un motore di regole deterministico per le decisioni ad alto rischio, misurato sensibilità ed errori di omissione con eval basate su simulazioni su dataset di vignette cliniche, e confrontato MedGemma con i modelli frontier su bot in produzione invece che sui benchmark. Per il lavoro su MedGemma ho quantizzato il modello da 27B in FP8, l’ho pubblicato su Hugging Face e l’ho messo in produzione con vLLM su Modal, con cold start di circa 21 secondi (partendo da ~100), così si paga solo per l’uso effettivo. Ho raccontato come funziona il deployment.

Cosa costruisco

Architettura degli agenti. Agente singolo, orchestratore con specialisti, oppure LLM più motore di regole, scelti in base a rischio e testabilità, non alle mode.

Tool e integrazioni. Tool ben tipizzati con timeout, sandbox e audit log, collegati al tuo CRM, alla cartella clinica elettronica o alle tue API interne.

Infrastruttura per le eval. Persona e obiettivi, dataset di scenari costruiti con gli esperti di dominio, giudici con criteri binari, esecuzioni ripetute per misurare la varianza e dashboard che mostrano l’andamento da una versione all’altra.

Tracing ed eval online. Span OpenTelemetry GenAI su chiamate LLM, tool e handover, campionati per la valutazione in produzione.

Scelta e hosting dei modelli. API frontier (Anthropic, OpenAI, Gemini) o modelli open self-hosted (vLLM, quantizzazione, GPU serverless), scelti in base alle tue eval.

Come lavoro

  1. Partire da una call con chi lo userà. Faccio discovery con i tuoi utenti e i tuoi esperti di dominio, e la maggior parte dei criteri viene da loro.
  2. Scrivere le eval prima di rifinire il prompt. Definire cosa significa “buono”, poi iterare.
  3. Rilasciare in fretta una prima versione, misurarla sulle simulazioni, poi sul traffico reale.
  4. Chiudere il ciclo. Ogni fallimento diventa un caso di test.

Servizi correlati

Come possiamo collaborare

01

Sprint sulle eval

Da due a tre settimane per definire i criteri con i tuoi esperti di dominio, costruire un sistema di simulazione e valutazione e ottenere una baseline per il tuo agente.

02

Sviluppo di agenti

Progettazione e rilascio end-to-end di un agente o di un sistema multi-agente, dalla discovery con i tuoi utenti fino alla produzione.

03

Revisione di architettura e modelli

Analisi di un agente esistente per individuare modalità di errore, costi e latenza, e confronto tra modelli sui tuoi dati.

Domande frequenti

Cosa sono le eval con simulazioni?

Un LLM interpreta un utente con una persona e un obiettivo e sostiene un’intera conversazione multi-turno con il tuo agente. Poi dei giudici LLM valutano la trascrizione rispetto a criteri definiti dai tuoi esperti di dominio. Con centinaia di simulazioni conosci il tasso di errore prima che gli utenti reali vedano l’agente.

LLM-as-judge è affidabile?

Lo è quando i criteri sono specifici e binari, il giudice vede le evidenze di cui ha bisogno e lo calibri su un campione di etichette umane. Rubriche vaghe danno punteggi rumorosi. Progetto i criteri insieme alle persone che conoscono il dominio.

Come si valutano gli agenti in produzione?

Raccogliendo le trace delle conversazioni reali secondo le convenzioni OpenTelemetry GenAI, valutando dei campioni con gli stessi giudici usati offline ed esportando verso strumenti come LangSmith, Opik o LangWatch. Così i risultati offline e online sono confrontabili.

Quale modello dovremmo usare?

Quello che supera le tue eval con costi e latenza accettabili. Confronto modelli frontier e modelli open sulle tue simulazioni, non sui benchmark pubblici. A volte vince un modello open quantizzato su GPU serverless, a volte no.

Lavori su sistemi multi-agente?

Sì, compresi agenti di triage che passano la conversazione a specialisti, motori di regole deterministici per le decisioni ad alto rischio e handover agli operatori umani. Ricorro a più agenti solo quando questo rende il sistema più facile da testare.