Solving Complex Problems using LLMs through Strategy Refinement and Reflection: The Case of Generalized Planning
Défense de mémoire - Yassine BOUNCER
Date : 04/09/2026 10:00 - 04/09/2026 12:00
Lieu : Salle académique
Orateur(s) : Yassine BOUNCER
Organisateur(s) : Sara Medugno
Ce mémoire étudie la capacité des modèles de langage (LLMs) open-weight à produire des algorithmes de planification généralisée corrects dans des domaines de difficulté variable. En s’appuyant sur le cadre de raffinement de stratégie proposé par Stein et al. (2026), deux modèles, Mistral Small 22B et Llama 3.3 70B, sont évalués sur trois domaines PDDL : Ferry, Gripper et Spanner. Les résultats montrent que le raffinement de stratégie améliore la fiabilité des solveurs dans les domaines simples et intermédiaires, faisant passer la précision de Mistral de 33 % à 67 % sur Ferry et Gripper, sans apporter de bénéfice mesurable sur le domaine plus difficile, Spanner. Un stress-test sur la généralisation montre que les solveurs qui réussissent sur le benchmark standard tiennent également sur des instances beaucoup plus grandes et jamais vues, ce qui suggère que le pipeline produit de véritables algorithmes plutôt que des heuristiques propres à une taille donnée. Une expérience multilingue suggère par ailleurs que la langue du prompt pourrait influencer la qualité des solveurs, les prompts en français surpassant l’anglais et l’espagnol sur Gripper, un résultat qui repose toutefois sur un seul domaine et un petit nombre d’exécutions, et qu’il convient de lire comme une tendance à approfondir plutôt que comme un résultat établi. Dans l’ensemble, ces résultats mettent en lumière à la fois le potentiel et les limites réelles de la planification généralisée basée sur les LLMs avec des modèles open-weight de petite taille.
Mots-clés : Planification IA, grands modèles de langage, raffinement de stratégie, auto-réflexion, PDDL, prompts multilingues
Contact :
Sara Medugno
-
sara.medugno@unamur.be
Télecharger :
vCal