Inference data tests

broussaille dernière retouche · 26 juin 2026

Reflexion en cours.

Les data tests se dérivent de l’IR + ontologie + policies + competency-questions + golden dataset. Avec un monde concret :

Alice memberOf Org A et Org B
Session activeOrg = Org A
A1, A2 belongsTo Org A ; B1 belongsTo Org B

la Forge exécute la relation expectedProjects = { p | p.belongsTo = session.activeOrg } et sort :

expected_visible: [A1, A2]
expected_hidden: [B1]
expected_empty_state: false

Le point qui compte : le LLM ne fait pas cette jointure. Il a compilé la règle, le moteur sémantique l’exécute. C’est toute la différence avec le système qui a accepté la liste vide, où le LLM jugeait au lieu de calculer. Ça rejoint l’idée des oracles inférés de webtestpilot, mais côté données plutôt que côté GUI.

À creuser : d’où viennent les mondes concrets quand le golden dataset ne couvre pas le cas discriminant ? Génération guidée par alloy-contre-modeles ? Liés : dsl-et-ir, alloy-contre-modeles, cue, compiler-intention-en-preuve