Banc d’évaluation de modèles IA
Compare deux modèles d’IA sur des épreuves précises, avec des pièges qui doivent échouer.
- Type de projet
- Audits et études
- État
- recherche
- Documents réunis
- 1
- Outils utilisés
- 4
Pourquoi sur mesure.
Comparer deux IA « à l’impression », tout le monde a raison. Ici, les mêmes épreuves pour les deux, des pièges témoins, et un chiffre à la fin.
Construit et mis en ligne par un seul interlocuteur, du diagnostic au comportement en production. Parlons de votre cas.
Ce qui bloquait le travail.
Une réponse convaincante peut ignorer le registre, la preuve ou le changement de consigne. Une impression ne départage pas deux modèles.
Ce qui a été construit.
- 01
Cinq épreuves
- 02
Trois cas témoins
- 03
Profil de voix mesuré
- 04
Corpus oral et écrit
- 05
Vérificateur exécutable
Ce qui peut être vérifié.
- 35 vidéos analysées
- 173 096 mots de corpus oral
- 35 cas témoins volontairement défaillants, tous détectés par le vérificateur
Les outils utilisés.
- Python
- OMP
- Markdown
- Obsidian

