Audit ou étude · recherche · juillet à août 2026

Banc d’évaluation de modèles IA

Compare deux modèles d’IA sur des épreuves précises, avec des pièges qui doivent échouer.

Capture terminal du banc modèles et voix avec volumes de corpus, épreuves et cas témoins
Type de projet
Audits et études
État
recherche
Documents réunis
1
Outils utilisés
4

Pourquoi sur mesure.

Comparer deux IA « à l’impression », tout le monde a raison. Ici, les mêmes épreuves pour les deux, des pièges témoins, et un chiffre à la fin.

Construit et mis en ligne par un seul interlocuteur, du diagnostic au comportement en production. Parlons de votre cas.

Ce qui bloquait le travail.

Une réponse convaincante peut ignorer le registre, la preuve ou le changement de consigne. Une impression ne départage pas deux modèles.

Ce qui a été construit.

  1. 01

    Cinq épreuves

  2. 02

    Trois cas témoins

  3. 03

    Profil de voix mesuré

  4. 04

    Corpus oral et écrit

  5. 05

    Vérificateur exécutable

Ce qui peut être vérifié.

  • 35 vidéos analysées
  • 173 096 mots de corpus oral
  • 35 cas témoins volontairement défaillants, tous détectés par le vérificateur

Les outils utilisés.

  • Python
  • OMP
  • Markdown
  • Obsidian