Карта роста
Войти
Назад к глоссарию
Старший

Benchmark

💡 Экзамен для ИИ.
Определение
Стандартизированный тест для измерения производительности AI-моделей в конкретных задачах.
Пример
MMLU (знания), HumanEval (код), SWE-Bench (реальные задачи).
Как говорят вайбкодеры
««По бенчмаркам Qwen почти догнал GPT»»