Démo Flask pour aventuresdata.com — analyser et fiabiliser un ensemble de juges LLM qui notent le sentiment (négatif/neutre/positif) des entreprises mentionnées dans des articles financiers.
Un pipeline de collecte (hors périmètre de cette démo) surveille des flux RSS financiers, détecte automatiquement les entreprises et secteurs mentionnés dans chaque article, puis fait noter le sentiment associé à chaque mention par 5 modèles LLM différents (Claude Haiku, Gemini, Llama 3.1, Mistral Nemo, Qwen 2.5) — c'est le pattern LLM-as-judge. Les résultats sont stockés en base PostgreSQL (`article_companies`) puis exportés en CSV pour analyse.
Deux modèles ne sont jamais parfaitement fiables pris isolément : cette démo compare les 5 juges LLM entre eux (Claude Haiku comme baseline, Gemini comme référence secondaire) sur 3 versions successives du prompt d'évaluation, et fournit un outil pour trancher à la main les cas où même les deux références se contredisent.
Accuracy et kappa vs Claude Haiku, gravité des erreurs, biais de prudence, précision/rappel/F1 par classe, zones de confiance — pour les 3 versions de prompt (v1, v2, v3).
100 cas où Claude Haiku et Gemini ne sont pas d'accord. Lire les justifications et trancher à la main permet de départager laquelle des deux références est la plus juste.
GET /health — vérifie que l'API répondGET /api/curation/benchmarks — liste les versions de benchmarkGET /api/curation/benchmarks/{version}/analysis — analyse complète d'une versionGET /api/annotation/rows / POST /api/annotation/rows/{id} — lire/enregistrer les annotations manuelles