BELLS-O (Benchmark for the Evaluation of LLM Supervision Systems – Operational) est le dernier volet de la série BELLS du CeSIA, une famille de benchmarks indépendants que l'équipe développe depuis 2024 pour évaluer la capacité des systèmes de sécurité à détecter des sorties d'IA nuisibles ou manipulées. Ce volet a été développé grâce au financement de l'UK AI Security Institute. Il s'appuie sur notre article précédent, The Bitter Lesson of Misuse Detection (arXiv:2507.06282), et a été accepté à l'atelier Trustworthy AI for Good de la conférence ICML 2026, présenté à Séoul le 10 juillet.
Les systèmes de supervision des LLM (filtres de modération des entrées/sorties et détecteurs de jailbreak) constituent le principal rempart contre les usages malveillants dans les applications d'IA déployées. Pourtant, les benchmarks existants sont souvent biaisés en faveur de leur propre éditeur, omettent le coût et la latence, et comparent rarement les garde-fous spécialisés aux modèles généralistes réaffectés à cet usage. BELLS-O est le premier benchmark opérationnel indépendant de ces systèmes : il évalue 28 systèmes issus de 17 fournisseurs, parmi lesquels tous les principaux garde-fous spécialisés (LlamaGuard-4, ShieldGemma-2, Lakera Guard, entre autres) ainsi que des modèles généralistes de pointe réaffectés à un rôle de superviseur, évalués conjointement selon le taux de détection, le taux de faux positifs, la latence et le coût.
Le benchmark couvre la modération des entrées/sorties sur 11 catégories de préjudices, et la détection de jailbreak sur 13 techniques d'attaque. La cartographie de la frontière de Pareto révèle des compromis qui dépendent fortement du cas d'usage. Sur la modération de contenu, les superviseurs spécialisés dominent sur le plan opérationnel : les meilleurs systèmes égalent les LLM de pointe en détection (environ 95 % contre 94 %) à des taux de faux positifs tout aussi bas (≤ 2 %), tout en étant 5 à 10 fois plus rapides et environ 10 fois moins coûteux. Sur la détection de jailbreak, le compromis s'inverse : les LLM de pointe atteignent une détection supérieure et des taux de faux positifs plus bas, mais à un coût 10 à 50 fois plus élevé et une latence 5 à 10 fois supérieure. Le benchmark, le framework, le classement (leaderboard) et les jeux de données sont publiés comme première base neutre, indépendante de tout fournisseur, pour choisir des garde-fous sous contraintes réelles de déploiement.