GitHub-радар

LingBot Vision — Модели ViT с самообучением без учителя

Серия трансформеров для изображений (Vision Transformers), обученных на неразмеченных изображениях с помощью маскирования с учётом границ объектов — от маленькой ViT-S до монстра на 1,1 миллиарда параметров. Подключайте их прямо в свои системы оценки глубины, сегментации или трекинга объектов в видео.

LingBot-Vision предоставляет предобученные энкодеры Vision Transformer, которые умеют извлекать пространственную информацию из неразмеченных изображений, предсказывая границы объектов. Доступны модели от ViT-S до крупной модели на 1,1 млрд параметров, а веса можно скачать через Hugging Face и ModelScope.

Зачем это вайб-кодеру

Если вам нужен готовый к использованию визуальный энкодер для системы оценки глубины, семантической сегментации или трекинга объектов в видео — вы нашли то, что искали!

Открыть на GitHub