Benchmark de classification de sentiment — LLM-as-judge

3 modèles locaux (Llama 3.1, Mistral Nemo, Qwen 2.5) sont évalués contre une baseline (Gemini), avec Claude Haiku comme référence secondaire pour isoler les cas où les 2 "masters" se contredisent. Mêmes calculs que le script d'analyse de référence, exposés ici en JSON via GET /api/curation/benchmarks/{version}/analysis?baseline=gemini.

Juge actuel : Geminivoir avec Claude Haiku comme juge

Benchmark v1 — 1214 / 1216 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 2 0

Accord vs Gemini 2.5 Flash (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 75.54 % 0.61
Mistral Nemo (12B) 48.02 % 0.26
Qwen 2.5 (7B) 67.38 % 0.508

Gravité des erreurs vs Gemini 2.5 Flash

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 75.5 % 23.8 % 0.7 %
Mistral Nemo (12B) 48.0 % 51.2 % 0.7 %
Qwen 2.5 (7B) 67.4 % 31.1 % 1.6 %

Sens du biais vs Gemini 2.5 Flash

ModèleSous-noteSur-note
Llama 3.1 (8B)13.9 %10.5 %
Mistral Nemo (12B)32.5 %19.5 %
Qwen 2.5 (7B)27.8 %4.9 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Gemini 2.5 Flash23.6 %19.9 %56.5 %
Llama 3.1 (8B)15.7 %38.3 %46.0 %
Mistral Nemo (12B)6.3 %67.5 %26.1 %
Qwen 2.5 (7B)26.0 %38.8 %35.2 %

Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.9320.6220.746286
NEU0.4490.8640.591242
POS0.950.7730.852686
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1781008
réf NEU 1320920
réf POS 0156530

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.8050.2170.342286
NEU0.2680.9090.414242
POS0.950.4390.6686
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 622213
réf NEU 922013
réf POS 6379301

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.7630.8430.801286
NEU0.3570.6940.471242
POS0.9580.5960.735686
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 241414
réf NEU 6016814
réf POS 15262409

Zones de confiance (double référence)

Accord entre Gemini 2.5 Flash et Claude Haiku : 82.13 % (kappa=0.711). Zone de consensus : 997 lignes (82.1 %) — zone grise : 217 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)80.84 %0.693
Mistral Nemo (12B)54.06 %0.331
Qwen 2.5 (7B)74.32 %0.603
ModèleSuit Gemini 2.5 FlashSuit Claude Haiku
Llama 3.1 (8B)51.2 %42.9 %
Mistral Nemo (12B)20.3 %75.1 %
Qwen 2.5 (7B)35.5 %58.1 %

Benchmark v2 — 1206 / 1237 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 0 0

Accord vs Gemini 2.5 Flash (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 75.21 % 0.568
Mistral Nemo (12B) 48.26 % 0.261
Qwen 2.5 (7B) 70.23 % 0.512

Gravité des erreurs vs Gemini 2.5 Flash

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 75.2 % 21.4 % 3.4 %
Mistral Nemo (12B) 48.3 % 50.9 % 0.8 %
Qwen 2.5 (7B) 70.2 % 27.5 % 2.2 %

Sens du biais vs Gemini 2.5 Flash

ModèleSous-noteSur-note
Llama 3.1 (8B)9.8 %15.0 %
Mistral Nemo (12B)31.1 %20.6 %
Qwen 2.5 (7B)15.6 %14.2 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Gemini 2.5 Flash24.1 %16.6 %59.3 %
Llama 3.1 (8B)15.4 %26.4 %58.2 %
Mistral Nemo (12B)5.5 %64.2 %30.3 %
Qwen 2.5 (7B)14.5 %35.7 %49.8 %

Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.9090.5810.709291
NEU0.4090.650.502200
POS0.8660.850.858715
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1698735
réf NEU 1113059
réf POS 6101608

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.8790.1990.325291
NEU0.2330.90.37200
POS0.940.4810.636715
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 582276
réf NEU 418016
réf POS 4367344

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.9430.5670.708291
NEU0.3470.7450.473200
POS0.8870.7450.81715
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 16510323
réf NEU 614945
réf POS 4178533

Zones de confiance (double référence)

Accord entre Gemini 2.5 Flash et Claude Haiku : 76.78 % (kappa=0.622). Zone de consensus : 926 lignes (76.8 %) — zone grise : 280 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)83.37 %0.707
Mistral Nemo (12B)58.64 %0.386
Qwen 2.5 (7B)82.18 %0.695
ModèleSuit Gemini 2.5 FlashSuit Claude Haiku
Llama 3.1 (8B)48.2 %40.7 %
Mistral Nemo (12B)13.9 %81.1 %
Qwen 2.5 (7B)30.7 %61.4 %

Benchmark v3 — 1215 / 1235 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 0 0

Accord vs Gemini 2.5 Flash (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 60.91 % 0.416
Mistral Nemo (12B) 51.11 % 0.299
Qwen 2.5 (7B) 61.81 % 0.416

Gravité des erreurs vs Gemini 2.5 Flash

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 60.9 % 38.5 % 0.6 %
Mistral Nemo (12B) 51.1 % 47.8 % 1.1 %
Qwen 2.5 (7B) 61.8 % 37.3 % 0.9 %

Sens du biais vs Gemini 2.5 Flash

ModèleSous-noteSur-note
Llama 3.1 (8B)26.0 %13.1 %
Mistral Nemo (12B)32.2 %16.7 %
Qwen 2.5 (7B)22.1 %16.1 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Gemini 2.5 Flash24.0 %22.1 %53.9 %
Llama 3.1 (8B)16.0 %50.4 %33.6 %
Mistral Nemo (12B)10.1 %64.8 %25.1 %
Qwen 2.5 (7B)13.7 %47.8 %38.5 %

Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.8970.5990.719292
NEU0.3370.7690.468268
POS0.880.5480.675655
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1751107
réf NEU 2020642
réf POS 0296359

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.9020.380.535292
NEU0.3010.8840.449268
POS0.8950.4170.569655
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 11117110
réf NEU 923722
réf POS 3379273

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.8920.5070.646292
NEU0.3410.7390.466268
POS0.8650.6180.721655
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 14813311
réf NEU 1819852
réf POS 0250405

Zones de confiance (double référence)

Accord entre Gemini 2.5 Flash et Claude Haiku : 76.71 % (kappa=0.638). Zone de consensus : 932 lignes (76.7 %) — zone grise : 283 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)70.49 %0.549
Mistral Nemo (12B)61.7 %0.434
Qwen 2.5 (7B)74.57 %0.602
ModèleSuit Gemini 2.5 FlashSuit Claude Haiku
Llama 3.1 (8B)29.3 %66.4 %
Mistral Nemo (12B)16.3 %80.2 %
Qwen 2.5 (7B)19.8 %76.0 %

Benchmark v4 — 1270 / 1279 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 0 9

Accord vs Gemini 2.5 Flash (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 57.8 % 0.351
Mistral Nemo (12B) 47.72 % 0.221
Qwen 2.5 (7B) 65.12 % 0.447

Gravité des erreurs vs Gemini 2.5 Flash

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 57.8 % 42.1 % 0.1 %
Mistral Nemo (12B) 47.7 % 51.7 % 0.6 %
Qwen 2.5 (7B) 65.1 % 34.1 % 0.8 %

Sens du biais vs Gemini 2.5 Flash

ModèleSous-noteSur-note
Llama 3.1 (8B)25.4 %16.8 %
Mistral Nemo (12B)33.7 %18.6 %
Qwen 2.5 (7B)18.7 %16.2 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Gemini 2.5 Flash20.0 %28.3 %51.7 %
Llama 3.1 (8B)8.0 %60.8 %31.2 %
Mistral Nemo (12B)4.4 %74.3 %21.3 %
Qwen 2.5 (7B)11.0 %48.0 %40.9 %

Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.8330.3350.478254
NEU0.3860.830.527359
POS0.8860.5340.667657
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 851681
réf NEU 1729844
réf POS 0306351

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.8390.1850.303254
NEU0.3430.90.496359
POS0.8710.3590.509657
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 472016
réf NEU 732329
réf POS 2419236

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.850.4690.604254
NEU0.4390.7470.553359
POS0.8460.670.748657
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1191269
réf NEU 2026871
réf POS 1216440

Zones de confiance (double référence)

Accord entre Gemini 2.5 Flash et Claude Haiku : 72.68 % (kappa=0.572). Zone de consensus : 923 lignes (72.7 %) — zone grise : 347 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)67.93 %0.49
Mistral Nemo (12B)58.94 %0.364
Qwen 2.5 (7B)78.33 %0.646
ModèleSuit Gemini 2.5 FlashSuit Claude Haiku
Llama 3.1 (8B)30.8 %66.6 %
Mistral Nemo (12B)17.9 %79.0 %
Qwen 2.5 (7B)30.0 %65.7 %