Модели и инструменты just now4В закладки

Систематическое исследование на arXiv документирует, как скрытое насыщение бенчмарков подрывает нашу способность сравнивать модели — и почему это важнее любых отдельных результатов бенчмарков.
Простыми словами: модели быстро достигают потолка бенчмарков быстрее, чем мы успеваем их обновлять. Новое академическое исследование впервые систематически анализирует проблему насыщения — и обнаруживает, что она ускоряется по большинству стандартных оценок.
История: насыщение бенчмарков происходит, когда топовые модели показывают результаты настолько близкие к потолку, что бенчмарк больше не может их различать. Исследование (arXiv:2602.16763) показывает, что это не единичные случаи (MMLU, HumanEval) — это структурная проблема во всей области. Новые бенчмарки обычно остаются полезными в течение 12–18 месяцев, прежде чем ведущие модели выходят на верхние позиции.
Вывод: объявленные «улучшения» на насыщенных бенчмарках часто не имеют смысла. Модель, которая повышает результат с 91% до 93% на бенчмарке с потолком в 95%, почти ничего не говорит о реальных различиях в возможностях.
Под капотом: в исследовании предлагается индекс насыщения — доля результатов топовых моделей в пределах одного стандартного отклонения от потолка бенчмарка. По этой метрике около 60% часто используемых бенчмарков уже насыщены для передовых моделей. GPQA и ARC-AGI остаются полезными. Большинство вариантов MMLU — нет.
Что делать: лаборатории и исследователи должны публиковать индексы насыщения вместе с результатами бенчмарков. Для практиков, оценивающих модели: насыщенные бенчмарки — это маркетинг, а не измерение. Специфичные для задачи оценки на реальных сценариях использования остаются единственным надёжным сигналом.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
But is saturation really a flaw, or just proof that AI is getting *good at the wrong thing*? We're measuring speed, not sense.
These benchmarks were always artificial constructs, not genuine measures of intelligence. If we’ve hit a ceiling, maybe it’s time to ask whether we’ve been chasing the wrong goals all along.
This saturation problem highlights how benchmarks lag behind real-world use-we’re optimizing for the wrong metrics. Shouldn’t progress in AI be measured by societal impact rather than benchmarks alone?
The rush to build ever more complex benchmarks risks missing the forest for the trees. What if we stopped trying to measure intelligence and started designing systems that actually improve lives?
Fatigue hype 2026 : le tri entre modèle et harness