Page de recherche dans les notes du jardin numérique de Stéphane Klein

Recherche effectué dans :

Tous type de notes (5)

evergreen_note (3)

journal_note (2)

Filtre actif, cliquez pour en enlever un tag :

benchmark

Cliquez sur un tag pour affiner votre recherche :

Résultat de la recherche (5 notes) :

#JaiDécouvert terminal-bench from "Structured Context Engineering for File-Native Agentic Systems" de Simon Willison.

Dans Nouvelles sur l’IA de décembre 2025 #JaiDécouvert METR - Model Evaluation & Threat Research :

Claude Opus 4.5 rejoint la maintenant célèbre évaluation du METR. Il prend largement la tête (sachant que ni Gemini 3 Pro, ni ChatGPT 5.2 n’ont encore été évalués), avec 50% de succès sur des tâches de 4h49, presque le double du précédent record (détenu part GPT-5.1-Codex-Max, avec 50% de succès sur des tâches de 2h53). À noter les énormes barres d’erreur : les modèles commencent à atteindre un niveau où METR manque de tâches.

source

Article Wikipedia : https://en.wikipedia.org/wiki/MMLU

Article Wikipedia : https://en.wikipedia.org/wiki/Language_model_benchmark

Les LLM Benchmark sont utilisés par les leaderboard du type LLM-Stats.com.

Quelques exemples de LLM Benchmark :

METR is a research nonprofit which evaluates frontier AI models to help companies and wider society understand AI capabilities and what risks they pose.

source

Dernière page.