Senior
Benchmark
Суть в одном предложении:
Экзамен для ИИ.
Развернутое определение
Стандартизированный тест для измерения производительности AI-моделей в конкретных задачах.
Пример из практики
MMLU (знания), HumanEval (код), SWE-Bench (реальные задачи).
Как говорят в чатах вайбкодеров
«По бенчмаркам Qwen почти догнал GPT»