Webtestpilot
WebTestPilot (arxiv 2602.11724), tests E2E web pilotés par agent LLM à partir de specs en langage naturel. Approche neurosymbolique :
- une partie neurale extrait les éléments du GUI en variables symboliques structurées (schémas Pydantic) ;
- une partie symbolique génère des assertions formelles via un DSL Python (dépendances causales, données, temporelles) ;
- un mécanisme repère les pages logiques revisitées pour raisonner sur plusieurs états.
Annoncé à 99% de complétude, 96% de précision/rappel en détection de bugs, et ça généralise sur les formulations (typos, style) et les tailles de modèle (3B à 72B).
Pourquoi ça compte pour forge : valider un comportement à partir d’une spec en langage naturel, en passant par schémas + assertions formelles. Même geste que la couche sémantique, version test.
À creuser : récupérer le DSL d’assertions et l’idée d’oracle inféré pour la validation de forge ? Liés : intent-formalization, opa, cue
Évoqué dans