Openai Devday 2024 | Spotlight de la communauté | Sierra
Openai Devday 2024 | Spotlight de la communauté | Sierra

Auteur: OpenAI – Durée: 00:09:52
Des références réalistes d’agent avec LLMS: Mesurer les performances et la fiabilité des agents de l’IA est difficile, en particulier dans les scénarios dynamiques du monde réel impliquant une interaction humaine telle que le service client. Sierra a utilisé les modèles GPT-4 et GPT-4O d’OpenAI pour générer des données synthétiques et des scénarios pour simuler les utilisateurs humains interagissant avec un agent du service client, entraînant la création de τ-bench. Cette session couvrira les défis techniques rencontrés lors de la création des données et de la référence, des résultats de l’évaluation de plusieurs agents basés sur LLM sur τ-bench, et une discussion sur la construction d’évaluations d’agents dynamiques avec des modèles de fondation.
Traduit en français à partir de cette source






