#ai-agents
Testare un agent di triage medico con LangWatch Scenario e pytest
Come testo un agent AI di triage medico con LangWatch Scenario: utente simulato, criteri per il judge, conversazioni libere o a copione, in pytest e in CI.
Far eseguire codice agli agenti AI in sicurezza in Elixir con tv-labs/lua
Come tv-labs/lua dà agli agenti AI un runtime Lua in sandbox dentro Elixir: funzioni sicure esposte, limiti di esecuzione e integrazione nel loop dell’agente.
Servire MedGemma 27B su Modal: FP8, sleep mode di vLLM e cold start da 21 secondi
Self-hosting di MedGemma 27B con vLLM su Modal: API compatibile OpenAI con scale-to-zero, quantizzazione FP8, GPU snapshot, cold start da 21 s e tool calling.
Progettare agenti AI che sanno quando passare la mano: ad altri agenti, alle regole, alle persone
Un’architettura pratica per agenti AI con handover sicuro: passaggi tra agenti, motore di regole deterministico per decisioni critiche, tool in sandbox ed eval.
Eval con simulazioni: far interpretare l’utente a un LLM per testare il tuo chatbot prima degli utenti reali
Come costruire eval con simulazioni per chatbot LLM: utenti simulati con persona, rubriche LLM-as-judge, tassi di errore nei flussi critici e ciclo di feedback.