AgenticFocus — пайплайн переработки любого видео от первого лица в датасет для обучения гуманоидных роботов

Развитие Physical AI сегодня уткнулось в отсутствие достаточного количества данных. Если для обучения VLM мы могли взять огромный объем текстовой информации, который годами копился в интернете, то VLA и world‑action-модели кормить практически нечем, создавать новые датасеты для обучения этих моделей оказалось чуть ли не сложнее, чем разработать конструкцию…
Читать на сайте источника ↗