Как мобильность позволяет языковым моделям глубже понимать место
Мы представляем динамическую, учитывающую мобильность среду, которая позволяет моделям ИИ понимать временные ритмы активности в различных местах и, таким образом, значительно улучшать прогнозы относительно реальных характеристик, таких как часы работы, уровень цен и загруженность.
Быстрые ссылки
- Бумага
- Делиться
- Скопировать ссылку ×
Искусственный интеллект добился невероятных успехов в понимании мира посредством текста. Однако для создания моделей ИИ, которые действительно понимают физический мир, им необходимо понимать не только слова: им нужно улавливать динамичную, реальную функциональность застроенной среды. Каждое место имеет две отличительные черты: его идентичность на бумаге и его реальный функциональный ритм.
Традиционные языковые модели обычно создают представления о местах (обычно называемых «точками интереса» или POI), будь то бизнес или место, например, парк или достопримечательность, в значительной степени опираясь на эти статические метаданные. Они успешно анализируют адреса, категории предприятий и текстовые описания. Хотя языковые модели мирового класса, такие как Gemini, невероятно эффективны в обработке текстовых данных, их геопространственные представления могут быть значительно обогащены за счет включения реальной функциональной динамики городской среды. Дополнение семантических меток данными о мобильности может позволить этим моделям эффективно улавливать уникальные временные ритмы активности POI в городе.
Для демонстрации этой взаимодополняющей возможности мы представляем Mobility-Embedded POIs (ME-POIs) — новую структуру, улучшающую текстовые представления мест, полученные с помощью языковых моделей. Используя общедоступные эталонные наборы данных, ME-POIs включают агрегированные и анонимизированные модели мобильности, такие как время прибытия, продолжительность пребывания и окружающие модели передвижения. Вместо того чтобы рассматривать место как застывший набор слов, ME-POIs используют самообучающийся подход для объединения текстовых описаний с крупномасштабными анонимизированными моделями мобильности из общедоступных эталонных наборов данных (фиксируя совокупные пространственные следы активности окружающей среды в течение дня). При этом модель строит числовое векторное представление (математическую «подпись», технически называемую встраиванием), которое кодирует как идентичность места, так и его динамическую функциональность. Интеграция ME-POI с передовыми текстовыми моделями обеспечила контекстное преимущество, которое привело к относительному увеличению точности прогнозирования намерений посещения до 81,9%, улучшению классификации уровней цен на 75,1% и повышению точности оценки загруженности на 24,7% в ранее не встречавшихся местах.
Как работает структура ME-POIs
Предоставляя предварительно обогащенное представление о месте, платформа ME-POIs значительно упрощает для моделей ИИ получение точных выводов о множестве различных атрибутов — таких как часы работы, целевые уровни цен и текущее состояние бизнеса — без необходимости каждый раз рассчитывать эти атрибуты с нуля.
Для построения модели с более глубоким пониманием мест необходимо различать идентичность места (его название и категорию) и его функцию (совокупный охват посещений). В предыдущих исследованиях в области геопространственного ИИ модели мобильности почти исключительно применялись для прогнозирования следующего объекта интереса, который посетит пользователь. В отличие от этого, структура ME-POIs переводит мобильность из задачи прогнозирования результатов в задачу определения входных данных, которые определяют само место.
Но как преобразовать исходные географические точки в чистую и численно полезную математическую сигнатуру (или векторное представление)? Мы достигаем этого с помощью трехэтапного процесса: выравнивание посещений, пространственное многомасштабное распространение посещений и синергия текста и мобильности.
Структура ME-POIs объединяет статические текстовые метаданные (идентификатор POI) с динамическими моделями посещений из общедоступных эталонных наборов данных (функция POI) для создания всестороннего представления о месте.
Выравнивание визита
Модель рассматривает совокупное количество посещений конкретного объекта интереса как основные точки данных. Она анализирует временные окна прибытия, тенденции отъезда и типичную продолжительность пребывания. Вместо вычисления простых средних значений, временной кодировщик отображает эти временные последовательности в плотное векторное пространство. Этот процесс устанавливает «функциональный центроид» — уникальную многомерную сигнатуру, которая отображает совокупные анонимизированные модели мобильности, связанные с этим конкретным местом, в течение годового цикла и в разные дни недели.
Решение проблемы «длинного хвоста» разреженности данных
Одной из постоянных проблем в геопространственной науке о данных является проблема «длинного хвоста». В то время как известные достопримечательности, огромные торговые центры и популярные сети в центре города генерируют огромное количество данных о посещениях, подавляющее большинство местных предприятий — небольшие районные бутики, специализированные ремонтные мастерские или недавно открывшиеся кафе — страдают от серьезной нехватки данных. Ранее, когда модель сталкивалась с местом, где было мало или совсем не было зафиксировано посещений, она ошибочно предполагала, что в этом месте нулевая активность, что приводило к неверным прогнозам.
ME-POIs решает эту проблему с помощью нового пространственного многомасштабного механизма распространения посещений. Архитектура учитывает, что посещения обычно ограничены региональными рамками; небольшой бутик на престижной торговой улице разделяет системные поведенческие особенности со своими соседями. Система анализирует соседние места в нескольких пространственных масштабах: непосредственную улицу, квартал и более широкий район. Затем она статистически переносит агрегированные модели посещений оживленных, богатых данными соседей на близлежащие, менее посещаемые места. Изучая региональный «ритм» активных зон, модель применяет интеллектуальную географическую базу предварительных знаний к небольшим магазинам, что позволяет ей узнавать о них что-то, даже если они редко или совсем не фигурируют в данных.
Синергия текста и мобильности
Вместо того чтобы отбрасывать текстовые описания, платформа ME-POIs обогащает их. Она делает это, сопоставляя высокоуровневые языковые представления (стандартные векторные представления, извлекаемые из продвинутых моделей, таких как Gemini) с вновь сгенерированными векторами мобильности путем максимизации их косинусного сходства. Мы накладываем сигнал мобильности непосредственно на языковое представление, создавая более целостное представление о месте или предприятии.
Этот гибридный подход гарантирует, что модель сохраняет структурную семантику (например, из текстового описания можно понять, что в заведении продают еду), одновременно учитывая его операционный контекст (например, из данных о мобильности можно определить, функционирует ли оно как место для обеда или как круглосуточная закусочная).
Эксперименты
Чтобы оценить, действительно ли ME-POIs обеспечивает обобщенное, не зависящее от атрибутов понимание физических мест, мы провели масштабное тестирование в двух крупных, культурно различных мегаполисах: Лос-Анджелесе и Хьюстоне.
Мы оценили разработанную систему на пяти различных задачах. Важно отметить, что для доказательства способности модели развивать общий интеллект, а не просто запоминать локальные закономерности, мы обучили систему на наборе наблюдаемых мест, а затем попросили ее предсказать характеристики совершенно невиданных мест.
Пять задач, выполняемых на последующих этапах, следующие:
- Прогнозирование времени открытия/закрытия: могут ли наши векторные представления местоположения помочь нам определить точное расписание работы предприятия?
- Классификация по уровню цен: Могут ли наши векторные представления местоположения помочь нам отличить элитный бутик от магазина подержанных вещей, основываясь только на контексте перемещения?
- Выявление окончательного закрытия: Зачастую предприятия «замолкают» и закрываются навсегда задолго до того, как владелец обновит свой онлайн-профиль или будет составлен отчет на основе данных от пользователей. Могут ли наши встроенные инструменты помочь нам выявлять такие закрывшиеся предприятия?
- Классификация намерений посещения: могут ли наши эмбеддинги помочь нам оценить совокупный интерес к поиску и навигации по месту? Эта задача служит косвенным показателем общей популярности места.
- Прогнозирование загруженности: предсказание будущей плотности скопления людей и динамики пиковых часов работы предприятий.
Для установления базового уровня мы сравнили структуру ME-POIs со стандартными моделями встраивания только текста (например, Gemini embeddings), существующими геопространственными моделями на основе траекторий (например, TrajGPT) и гибридными вариантами, чтобы точно определить, какую ценность модели мобильности добавляют к уравнению.
Результаты
Результаты эксперимента оказались поразительными, подтвердив, что добавление данных о реальной мобильности к существующим текстовым моделям обеспечивает заметное «контекстное преимущество». При оценке производительности модели на неизвестных тестовых локациях интеграция ME-POI привела к существенному повышению точности, неизменно превосходя как чисто текстовые, так и основанные на мобильности базовые модели во всех задачах прогнозирования.
Добавление ME-POIs неизменно повышает производительность модели во всех задачах, значительно улучшая ключевые показатели, такие как намерение посетить сайт и классификация уровня цены, по сравнению с базовыми моделями.
Помимо превосходства над стандартными базовыми моделями, один из наиболее примечательных результатов был получен при сравнении модели, обученной исключительно на данных о мобильности, с моделями, имеющими доступ только к текстовым метаданным . В нескольких случаях, например, при классификации уровня цен, модель, основанная только на данных о мобильности, превзошла языковые модели, использующие только текст. Это раскрывает захватывающую и часто недооцениваемую истину о динамике городов: наши коллективные действия в определенном физическом месте зачастую гораздо более информативны, чем формальные слова, используемые для его обозначения.
Заключение
Успешно выйдя за рамки статических цифровых меток, структура ME-POIs демонстрирует новый способ моделирования и понимания физического мира искусственным интеллектом. Важно подчеркнуть, что эта структура фокусируется на понимании вещей об мире в совокупности — она не может делать выводы об отдельных пользователях или о чем-либо персонализированном. То есть, структура ME-POIs может обеспечить целостное представление места или предприятия, отражая, как их посещают широкие группы населения и в разные периоды времени; она не может использоваться для индивидуальной персонализации. Вместо этого ее сила заключается в создании подробных агрегированных числовых характеристик мест, которые снижают вычислительную нагрузку на последующие системы, когда им необходимо делать выводы об этих местах.
В конечном итоге, ME-POIs закладывают основу для моделей искусственного интеллекта, которые действительно понимают ритм наших городов. Это также часть нашей более масштабной работы в рамках проекта Google Earth AI по созданию геопространственных моделей и наборов данных, которые преобразуют данные о планете в полезную информацию для принятия решений.
Благодарности
Мы благодарим наших соавторов этой статьи: Неху Арору (Google Research), а также профессора Сайруса Шахаби и аспирантку Шан Лин Сюй из Университета Южной Калифорнии (USC).
Источник: research.google
Похожие записи
Оцените материал:
Похожие записи
Высокий суд потребовал от британских юристов прекратить неправомерное использование ИИ после поддельных ссылок на судебные решения
07.06.2025
Эта «дешевая» модель ИИ с открытым исходным кодом на самом деле сжигает ваш вычислительный бюджет
29.08.2025
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
