Eval-driven development: Lessons from evaluating GenAI at scale
Les équipes d'Airbnb partagent leurs pratiques d'évaluation des produits GenAI, construites autour de l'*eval-driven development* (EDD) — l'équivalent GenAI du TDD. La thèse : l'évaluation doit être traitée comme une discipline d'ingénierie de premier plan, pas comme une arrière-pensée, parce que les sorties de LLM sont non déterministes et que « correct » est subjectif. L'article détaille les trois méthodes d'évaluation (checks programmatiques, LLM-as-judge, évaluation humaine), la calibration indispensable des juges virtuels, et les spécificités des systèmes agentiques où il faut évaluer le step, la trajectoire et la session.
Lire l'analyse complète →