Webtestpilot

broussaille dernière retouche · 26 juin 2026

WebTestPilot (arxiv 2602.11724), tests E2E web pilotés par agent LLM à partir de specs en langage naturel. Approche neurosymbolique :

  • une partie neurale extrait les éléments du GUI en variables symboliques structurées (schémas Pydantic) ;
  • une partie symbolique génère des assertions formelles via un DSL Python (dépendances causales, données, temporelles) ;
  • un mécanisme repère les pages logiques revisitées pour raisonner sur plusieurs états.

Annoncé à 99% de complétude, 96% de précision/rappel en détection de bugs, et ça généralise sur les formulations (typos, style) et les tailles de modèle (3B à 72B).

Pourquoi ça compte pour forge : valider un comportement à partir d’une spec en langage naturel, en passant par schémas + assertions formelles. Même geste que la couche sémantique, version test.

À creuser : récupérer le DSL d’assertions et l’idée d’oracle inféré pour la validation de forge ? Liés : intent-formalization, opa, cue