SenseTime открыла SenseNova-Vision — CV-модель, которая всё делает через генерацию…
SenseTime открыла SenseNova-Vision — CV-модель, которая всё делает через генерацию
SenseTime выложила веса SenseNova-Vision-7B-MoT — единой модели компьютерного зрения, которая пытается заменить зоопарк специализированных CV-систем одним генеративным интерфейсом.
Обычно для каждой задачи делают отдельный модуль: один ищет объекты, другой строит маски, третий оценивает глубину, четвёртый работает с текстом на изображении. SenseNova-Vision предлагает другой подход: всё это модель выдаёт как текст, картинку или смешанный ответ.
Например:
— рамки объектов и OCR — текстом с координатами
— карты глубины и нормалей — изображениями
— сложную сегментацию — текстовой легендой плюс цветной маской
— ключевые точки и детекцию — структурированным ответом
Авторы сравнивают это с тем, что GPT сделал для текста: вместо набора отдельных инструментов — один универсальный интерфейс, который понимает задачу по инструкции и генерирует нужный формат результата.
Под капотом — открытая мультимодальная Bagel-7B-MoT от ByteDance, дообученная без изменения архитектуры.
MoT — это смесь трансформеров: внутри два эксперта с разными весами. Один отвечает за понимание текста и изображений, второй — за генерацию картинок. При этом внимание у них общее, а токены распределяются жёстко по типу данных, а не через обучаемый роутер, как в MoE.
Для SenseNova-Vision это хорошо подходит: модель постоянно переключается между координатами, описаниями, масками и визуальными картами, а у каждой ветки есть свой «мозг» под нужный формат.
Что по тестам:
— сильна в детекции и плотных сценах с десятками объектов
— хорошо справляется с локализацией текста на изображении
— уверенно работает с ключевыми точками
— в глубине и нормалях близка к лучшим генеративным методам
— в сегментации держится на уровне конкурентов
Но без магии: в многовидовой 3D-геометрии модель уступает специализированным VGGT и Depth Anything 3, а русский текст распознаёт заметно слабее английского.
Вместе с моделью SenseTime открыла корпус SN-VC-50M — 50 млн обучающих примеров из открытых датасетов:
— 18,9 млн кадров для структурного понимания
— 17,3 млн для плотной геометрии
— 12,5 млн для многовидовой геометрии
— 1,3 млн для сегментации
https://github.com/OpenSenseNova/SenseNova-Vision
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
