GitHub-радар

LingBot-VLA 2.0: открытая основа для роботов

Основная модель Vision-Language-Action для управления роботами, обученная на 60 000 часах данных на 20 конфигурациях роботов с разреженными MoE-слоями.

LingBot-VLA 2.0 — основная модель Vision-Language-Action для управления роботами, обученная на 60 000 часах данных на 20 конфигурациях роботов и на эгоцентричном видео людей. Единое 55-мерное представление действий и разреженные MoE-слои позволяют одной модели работать на самых разных роботах — задача, которую большинство робототехнических моделей обходит стороной. 311 звёзд за 48 часов — реакция сообщества на дефицит открытых робототехнических моделей такого масштаба.

Зачем это вайб-кодеру

Для тех, кто работает с робототехникой или кросс-воплощённым ИИ — одна из немногих открытых фундаментальных моделей, обученных на разнородных типах роботов, что даёт серьёзное преимущество для исследований.

Открыть на GitHub