Бенчмарки Мебиуса: зачем IBM учит ИИ проверять собственные вопросы

Для оценки эффективности ИИ уже давно и успешно используют самые разные бенчмарки. Берем модель/агента, выдаем им одинаковый набор задач, считаем долю успешных решений и получаем удобную цифру, по которой можно сравнивать системы между собой. По результатам используем ту, которая справилась с большим процентом задач. Звучит круто и даже удобно, но, как…
Читать на сайте источника ↗