← Tutti gli articoli
#llm-evals
Testare un agent di triage medico con LangWatch Scenario e pytest
Come testo un agent AI di triage medico con LangWatch Scenario: utente simulato, criteri per il judge, conversazioni libere o a copione, in pytest e in CI.
Progettare agenti AI che sanno quando passare la mano: ad altri agenti, alle regole, alle persone
Un’architettura pratica per agenti AI con handover sicuro: passaggi tra agenti, motore di regole deterministico per decisioni critiche, tool in sandbox ed eval.
Eval con simulazioni: far interpretare l’utente a un LLM per testare il tuo chatbot prima degli utenti reali
Come costruire eval con simulazioni per chatbot LLM: utenti simulati con persona, rubriche LLM-as-judge, tassi di errore nei flussi critici e ciclo di feedback.