# Orchestrazione di agenti AI e valutazione di LLM (simulazioni, LLM-as-judge, tracing)

> AI engineer freelance per orchestrazione e valutazione di agenti AI: handover, tool in sandbox, guardrail, simulazioni, LLM-as-judge e tracing OpenTelemetry.

URL: https://fedme.dev/it/services/ai-agents-evals
Fornito da: Federico Meini (federico.meini@gmail.com)

## Agenti AI da mettere davanti a utenti reali, e le eval che lo dimostrano.

Dal 2023 in Turn.io sono responsabile end-to-end delle funzionalità AI: l’agent harness, i tool in sandbox, le eval offline con simulazioni e quelle online, e il ciclo che trasforma le eval fallite in correzioni. Gran parte di tutto questo gira in ambito sanitario, dove “sembra funzionare” non basta.

## Cosa ottieni

- Un’architettura di agenti proporzionata al rischio: regole deterministiche dove le decisioni sono critiche, LLM dove la flessibilità aiuta, e un handover pulito verso gli operatori umani.
- Tool che gli agenti possono chiamare in sicurezza, dentro una sandbox, collegati ai tuoi sistemi reali.
- Eval offline con simulazioni che misurano il tasso di errore prima del lancio, ed eval online sulle trace di produzione dopo.
- Un ciclo di feedback in cui ogni criterio fallito diventa una modifica concreta e una nuova esecuzione.
- Scelte di modello supportate dalle tue eval, compresi modelli open ospitati da te quando costi o privacy sono importanti.

## Gli agenti sono facili da mostrare in demo e difficili da rendere affidabili

Un agente da demo risponde alle cinque domande che hai provato. Un agente in produzione incontra migliaia di persone che si esprimono in modo diverso, tralasciano dettagli importanti, cambiano idea e ogni tanto provano a romperlo. In sanità, anche un solo segnale di pericolo non colto è di troppo.

In Turn.io sono responsabile end-to-end delle funzionalità AI:

- **L’agent harness** che le organizzazioni usano per far girare agenti AI su WhatsApp: uso dei tool, orchestrazione, guardrail e handover tra agenti e verso gli operatori umani.
- **Tool in sandbox.** Gli agenti eseguono tool e codice dentro una sandbox Lua, che permette ai clienti di collegarli a cartelle cliniche e API esterne senza poter rompere la piattaforma.
- **Eval offline con simulazioni.** Un LLM interpreta l’utente a partire da una persona e da un obiettivo, porta avanti l’intera conversazione con il bot, e dei giudici LLM valutano la trascrizione rispetto a criteri definiti dal cliente. Le ho costruite perché i team che fanno triage clinico avevano bisogno di conoscere il tasso di errore prima che pazienti reali usassero il servizio.
- **Eval online.** Raccolta ed esportazione con OpenTelemetry GenAI di tutto il traffico AI, così i team possono valutare le conversazioni reali in Comet Opik, LangSmith o LangWatch.
- **Il ciclo di feedback.** I risultati delle eval confluiscono nel copilot AI usato da chi costruisce i bot, così un criterio fallito diventa una modifica concreta al bot, e chi l’ha fatta rilancia le eval per verificare che abbia funzionato.

Ho anche progettato sistemi di triage con **due agenti che cooperano e un motore di regole deterministico** per le decisioni ad alto rischio, misurato **sensibilità ed errori di omissione** con eval basate su simulazioni su dataset di vignette cliniche, e confrontato **MedGemma** con i modelli frontier su bot in produzione invece che sui benchmark. Per il lavoro su MedGemma ho quantizzato il modello da 27B in FP8, l’ho pubblicato su Hugging Face e l’ho messo in produzione con vLLM su Modal, con cold start di circa 21 secondi (partendo da ~100), così si paga solo per l’uso effettivo. Ho raccontato [come funziona il deployment](https://fedme.dev/it/blog/serving-medgemma-27b-on-modal-vllm).

## Cosa costruisco

**Architettura degli agenti.** Agente singolo, orchestratore con specialisti, oppure LLM più motore di regole, scelti in base a rischio e testabilità, non alle mode.

**Tool e integrazioni.** Tool ben tipizzati con timeout, sandbox e audit log, collegati al tuo CRM, alla cartella clinica elettronica o alle tue API interne.

**Infrastruttura per le eval.** Persona e obiettivi, dataset di scenari costruiti con gli esperti di dominio, giudici con criteri binari, esecuzioni ripetute per misurare la varianza e dashboard che mostrano l’andamento da una versione all’altra.

**Tracing ed eval online.** Span OpenTelemetry GenAI su chiamate LLM, tool e handover, campionati per la valutazione in produzione.

**Scelta e hosting dei modelli.** API frontier (Anthropic, OpenAI, Gemini) o modelli open self-hosted (vLLM, quantizzazione, GPU serverless), scelti in base alle tue eval.

## Come lavoro

1. **Partire da una call con chi lo userà.** Faccio discovery con i tuoi utenti e i tuoi esperti di dominio, e la maggior parte dei criteri viene da loro.
2. **Scrivere le eval prima di rifinire il prompt.** Definire cosa significa “buono”, poi iterare.
3. **Rilasciare in fretta una prima versione,** misurarla sulle simulazioni, poi sul traffico reale.
4. **Chiudere il ciclo.** Ogni fallimento diventa un caso di test.

## Servizi correlati

- [Sviluppo WhatsApp Business Platform](https://fedme.dev/it/services/whatsapp-business-platform): dove vivono molti di questi agenti.
- [Agentic coding per i team di sviluppo](https://fedme.dev/it/services/agentic-coding): usare gli agenti per scrivere software, non solo per metterli in produzione.

## Come possiamo collaborare

- **Sprint sulle eval**: Da due a tre settimane per definire i criteri con i tuoi esperti di dominio, costruire un sistema di simulazione e valutazione e ottenere una baseline per il tuo agente.
- **Sviluppo di agenti**: Progettazione e rilascio end-to-end di un agente o di un sistema multi-agente, dalla discovery con i tuoi utenti fino alla produzione.
- **Revisione di architettura e modelli**: Analisi di un agente esistente per individuare modalità di errore, costi e latenza, e confronto tra modelli sui tuoi dati.

## Stack

Anthropic Claude, OpenAI, Gemini, MedGemma, vLLM & Modal, OpenTelemetry GenAI, LangSmith / Opik / LangWatch, RAG & pgvector, Python, Elixir

## FAQ

### Cosa sono le eval con simulazioni?

Un LLM interpreta un utente con una persona e un obiettivo e sostiene un’intera conversazione multi-turno con il tuo agente. Poi dei giudici LLM valutano la trascrizione rispetto a criteri definiti dai tuoi esperti di dominio. Con centinaia di simulazioni conosci il tasso di errore prima che gli utenti reali vedano l’agente.

### LLM-as-judge è affidabile?

Lo è quando i criteri sono specifici e binari, il giudice vede le evidenze di cui ha bisogno e lo calibri su un campione di etichette umane. Rubriche vaghe danno punteggi rumorosi. Progetto i criteri insieme alle persone che conoscono il dominio.

### Come si valutano gli agenti in produzione?

Raccogliendo le trace delle conversazioni reali secondo le convenzioni OpenTelemetry GenAI, valutando dei campioni con gli stessi giudici usati offline ed esportando verso strumenti come LangSmith, Opik o LangWatch. Così i risultati offline e online sono confrontabili.

### Quale modello dovremmo usare?

Quello che supera le tue eval con costi e latenza accettabili. Confronto modelli frontier e modelli open sulle tue simulazioni, non sui benchmark pubblici. A volte vince un modello open quantizzato su GPU serverless, a volte no.

### Lavori su sistemi multi-agente?

Sì, compresi agenti di triage che passano la conversazione a specialisti, motori di regole deterministici per le decisioni ad alto rischio e handover agli operatori umani. Ricorro a più agenti solo quando questo rende il sistema più facile da testare.

## Contatti

Email federico.meini@gmail.com · https://fedme.dev/it/contact
