1 месяц назад
Vision language action модель LingBot-VLA 2.0 вышла в открытый доступ: 6 млрд параметров, 20 типов роботов
Компания Robbyant (входит в Ant Group) выпустила LingBot-VLA 2.0, открытую vision language action модель на 6 млрд параметров, которая управляет роботами разных конструкций по текстовой команде и картинке с камеры, а один вызов инференса занимает около 130 мс на видеокарте RTX 4090. Vision language action модели до сих пор работали в лабораториях, но ломались при переносе на реальных роботов. LingBot-VLA 2.0 впервые публикует и код, и веса, и методологию фильтрации данных, что позволяет воспроизвести результат на своём оборудовании...