ГлавнаяТехнологии
Хабр

Один харнесс, три модели: чего вам не расскажут публичные бенчмарки

Один харнесс, три модели: чего вам не расскажут публичные бенчмарки
Привет! Я Чичев Максим, работаю руководителем разработки платформенных решений в Петрович-Тех. В этой статье хочу рассказать о том, как я прогнал три LLM трёх весовых категорий через один и тот же харнесс на агентных задачах длиной 2, 3 и 15 шагов — и почему на длинных цепочках тезис «харнесс важнее модели» перестаёт работать. Читать далее
Читать на сайте источника ↗