LFM2.5-VL-3B Очередная компактная модель от Liquid AI Мультимодальная зрительно-языковая, работает…
Очередная компактная модель от Liquid AI
Мультимодальная зрительно-языковая, работает на самртфоне
Обходит заметно более крупные модели в задачах по экранам, привязке объектов и распознаванию текста.
• Понимание экранов мобильных, веб и настольных интерфейсов
• Grounding — привязка объектов к координатам по запросу на естественном языке
• Полностраничное OCR с разметкой макета — текст, таблицы, формулы, графики
• Вызов функций и инструментов
• Работа с несколькими изображениями сразу
• База LFM2.5-2.6B плюс визуальный энкодер SigLIP2 NaFlex 400M
• Контекст 32 768 токенов, 16 языков включая русский
• Около 3 ГБ памяти
• 20 ток/с на Galaxy S26 Ultra
Похожие записи
- Стартап Andon Labs передал Claude управление розничным магазином в Сан-Франциско — нейросеть игнорировала опоздания одного из сотрудников, но согласилась уволить его после «наводящего вопроса»
- Сокращение затрат на вывод RAG в 6 раз начинается с решения того, что никогда не доходит до LLM.
- 13 августа вышла Gemini 3.7 Flash. Забавно, что с релиза…
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
