Архив рубрики ~Лента новостей~

Разные команды, одна и та же проблема.

Разные команды, одна и та же проблема.
Разные команды, одна и та же проблема.

Комментарий к церемонии награждения от Кэндис Рафф, старшего менеджера по продуктам, OmicsHQ.

22 июля 2026 г. | Получение награды Bio-IT World Best of Show за OmicsHQ стало огромной честью. Что еще важнее, это дало возможность пообщаться с исследователями, специалистами по обработке данных и технологическими лидерами, от которых в конечном итоге зависит успех или провал таких продуктов, как наш.

Как и многие другие участники выставки, мы приехали подготовленными к обсуждению функций, возможностей и планов развития. Однако больше всего нас впечатлили сами беседы.

В ходе конференции я общался с командами из фармацевтических компаний, стартапов в области искусственного интеллекта, исследовательских организаций и поставщиков технологий. Их цели значительно различались. Некоторые создавали помощников для исследований на основе ИИ. Другие искали внешние наборы данных для проверки внутренних результатов. Одни разрабатывали новые аналитические платформы, а другие сосредоточились на ускорении программ разработки лекарств.

Однако, несмотря на эти различия, я постоянно слышал об одной и той же основной проблеме.

Дело не в нехватке данных, а в нехватке достоверных и пригодных для использования данных.

Проблема доступности данных сместилась.

За последнее десятилетие биомедицинское сообщество добилось необычайных успехов. В настоящее время в общедоступных хранилищах содержатся миллионы образцов, охватывающих практически все области заболеваний, типы тканей и экспериментальные методы, которые только можно себе представить.

Исследователи имеют доступ к GEO, SRA, CellxGene, ArrayExpress и бесчисленному множеству других источников данных. С каждым годом объем общедоступных данных продолжает расти.

Практически по всем показателям у нас нет недостатка в доступных данных.

Тем не менее, многие исследователи по-прежнему тратят недели (иногда месяцы) на поиск наборов данных, оценку качества метаданных, обзор публикаций, сравнение методов обработки и определение возможности осмысленного объединения исследований.

Проблема сместилась.

Задача состоит уже не в поиске данных. Задача состоит в поиске данных, которые являются достоверными, сопоставимыми и релевантными задаваемому вопросу.

Один из разговоров на конференции Bio-IT World прекрасно это проиллюстрировал.

Участник конференции из стартапа в области искусственного интеллекта рассказал о своих усилиях по созданию биомедицинского исследовательского помощника, работающего на основе общедоступных омиксных данных. Доступ к наборам данных не был ограничивающим фактором; общедоступных данных было предостаточно. Задача заключалась в том, чтобы собрать наборы данных, которые были бы достаточно последовательно обработаны и достаточно точно аннотированы, чтобы система искусственного интеллекта могла эффективно рассуждать на их основе.

Любой, кто сегодня работает с ИИ, понимает эту проблему. Системы ИИ обладают замечательными возможностями, но они в значительной степени зависят от качества получаемой информации. Несогласованные метаданные, отсутствие контекста, противоречивые аннотации и плохо структурированные данные могут вносить шум, снижать качество поиска и увеличивать вероятность неверных выводов.

Иными словами, ИИ повысил ценность общедоступных данных, но также выявил и издержки, связанные с противоречивыми данными.

Разные организации, одно и то же разочарование

Ещё один запоминающийся разговор состоялся с учёным, работающим в иммунологическом подразделении фармацевтической компании.

Их команда регулярно создает внутренние наборы данных, полученные методом массового секвенирования РНК, анализа отдельных клеток и пространственных данных. Они также в значительной степени полагаются на общедоступные данные для проверки результатов, установления биологического контекста и ответа на вопросы, на которые одни только внутренние исследования не могут дать ответа.

Их проблема показалась до боли знакомой.

Проблема заключалась не в поиске общедоступных наборов данных. Проблема состояла в определении того, каким наборам данных можно доверять, сопоставимы ли они друг с другом и содержат ли они биологические сигналы, необходимые для ответа на конкретный исследовательский вопрос.

Прежде чем ученые смогут задать вопрос: «Что говорят мне эти данные?», они часто тратят значительное время на ответ на более фундаментальный вопрос: «Можно ли доверять этим данным?»

Это мнение неоднократно высказывалось на протяжении всей конференции. Конкретные примеры использования различались. Но основная проблема оставалась неизменной.

Независимо от того, занимались ли команды разработкой приложений искусственного интеллекта, проведением трансляционных исследований, созданием биомаркеров или проверкой экспериментальных результатов, все они вкладывали значительные усилия в поиск, оценку и подготовку данных, прежде чем можно было начать какую-либо значимую научную работу.

Для многих организаций это превратилось в невидимый налог на производительность исследований.

Почему метаданные важны как никогда

Эти беседы подтвердили то, что мы все чаще наблюдаем в отрасли: метаданные перестали быть просто вспомогательным элементом. Они становятся стратегическим научным активом. По мере роста объемов данных качество метаданных все больше определяет, можно ли обнаружить, понять, повторно использовать и включить данные в последующие анализы. К сожалению, большая часть экосистемы биомедицинских данных была создана для человеческой интерпретации, а не для машинного мышления.

Одно и то же заболевание может быть описано несколькими способами. Аннотации типов клеток могут существенно различаться в разных исследованиях. Экспериментальные детали могут регистрироваться непоследовательно или вовсе опускаться. Исследователи часто вынуждены объединять информацию из репозиториев, публикаций, дополнительных файлов и личного опыта, чтобы просто понять, является ли тот или иной набор данных релевантным.

Эта проблема становится еще более актуальной по мере того, как организации инвестируют в искусственный интеллект.

На конференции Bio-IT World многие дискуссии были посвящены данным, готовым к использованию в ИИ, управлению знаниями и надежной научной информации. Хотя технологии продолжают стремительно развиваться, успех этих систем в конечном итоге зависит от качества и согласованности исходных данных. Ни одна модель не может полностью компенсировать неполную, противоречивую или плохо организованную информацию.

Почему мы создали OmicsHQ

Именно эти задачи вдохновили OmicsHQ.

Мы не ставили перед собой цель создать еще одно хранилище данных. Наша цель заключалась в создании более интуитивно понятного способа для ученых находить и оценивать омиксные наборы данных.

Наша убежденность проста: поиск данных должен начинаться с биологических аспектов, а не с навигации по репозиториям.

Ученые должны иметь возможность осуществлять поиск, используя интересующие их понятия: заболевание, ткань, тип клетки, организм, лечение и экспериментальный контекст, а затем быстро определять, насколько набор данных соответствует их исследованию.

Для реализации этой концепции требуется гораздо больше, чем просто объединение наборов данных в одном месте. Необходимы согласованные метаданные, выравнивание онтологий, стандартизированные аннотации и процессы проверки качества, которые упростят сравнение и понимание наборов данных.

Цель состоит не просто в том, чтобы сделать данные доступными для поиска. Цель состоит в том, чтобы сделать данные пригодными для использования.

С нетерпением жду

Одно высказывание с конференции особенно запомнилось мне.

После демонстрации OmicsHQ один из ведущих научных сотрудников сказал: «Если бы у меня был доступ к этому, я бы в первую очередь обращался к нему при поиске данных».

Я оценил комплимент, но больше всего меня зацепило то, что он означал. Исследователи не просят больше репозиториев. Они просят надежные отправные точки. Они хотят тратить меньше времени на поиск и подготовку данных и больше времени на ответы на научные вопросы.

Получение награды Bio-IT World Best of Show Award имело большое значение, поскольку показало, что эта проблема актуальна далеко за пределами круга наших клиентов. Организации, с которыми мы общались, различались по размеру, направленности и научным целям, но их послание было удивительно последовательным.

Следующая задача для биомедицинской информатики заключается не в генерации большего количества данных, а в том, чтобы сделать уже имеющиеся данные более доступными, достоверными и пригодными для повторного использования.

Судя по обсуждениям на конференции Bio-IT World, решение этой задачи может принести не меньшую пользу, чем само получение данных.

Источник: www.bio-itworld.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Бизнес готов защищать, но не решать за абонента В «Ведомостях»… Архив рубрики ~Обо всем~ Подводные нефтегазовые трубопроводы оказались неучтенным источником микропластика. В британскую часть Северного моря они могли приносить до 500 тонн ежегодно Архив рубрики ~Полезное~ Полная карта AI-помощников по промптам и кодингу: где брать готовые промты и навыки (2026) Архив рубрики ~Обо всем~ Apple, вслед за Google, приняла название «Озеро Америка», данное Трампом. Архив рубрики ~Коротко из Telegram~ ИИ ДИАГНОСТИРУЕТ БОЛЕЗНИ ПО ВИДЕОЗАПИСИ ЛИЦА Архив рубрики ~Коротко из Telegram~ 27 августа 2026 года Rockstar Games и Netflix устроили не… Архив рубрики ~Коротко из Telegram~ Anthropic ОТКРЫЛА БЕСПЛАТНУЮ ШКОЛУ ПО РАБОТЕ С ИИ. Архив рубрики ~Коротко из Telegram~ Anthropic устроила бой трём Claude — и они начали… Архив рубрики ~Коротко из Telegram~ «СУПЕРИНТЕЛЛЕКТ БУДЕТ В МИЛЛИН РАЗ УМНЕЕ НАС» Архив рубрики ~Коротко из Telegram~ AI СОЗДАЁТ НОВЫЕ РАБОЧИЕ МЕСТА: Реальность VS Страхи Архив рубрики ~Полезное~ АНГЛИЙСКИЙ С НУЛЯ БЕЗ ЗУБРЁЖКИ И РЕГИСТРАЦИИ Архив рубрики ~Коротко из Telegram~ Meta готовит к запуску Hatch — потребительскую версию OpenClaw… Новости робототехники ВСЕМИРНЫЕ ИГРЫ ГУМАНОИДНЫХ РОБОТОВ, проходящие прямо сейчас в Пекине Архив рубрики ~Коротко из Telegram~ Каким может быть юбилейный iPhone XX Инсайдер Джон Проссер показал… Архив рубрики ~Коротко из Telegram~ Бизнес готов защищать, но не решать за абонента В «Ведомостях»… Архив рубрики ~Обо всем~ Подводные нефтегазовые трубопроводы оказались неучтенным источником микропластика. В британскую часть Северного моря они могли приносить до 500 тонн ежегодно Архив рубрики ~Полезное~ Полная карта AI-помощников по промптам и кодингу: где брать готовые промты и навыки (2026) Архив рубрики ~Обо всем~ Apple, вслед за Google, приняла название «Озеро Америка», данное Трампом. Архив рубрики ~Коротко из Telegram~ ИИ ДИАГНОСТИРУЕТ БОЛЕЗНИ ПО ВИДЕОЗАПИСИ ЛИЦА Архив рубрики ~Коротко из Telegram~ 27 августа 2026 года Rockstar Games и Netflix устроили не… Архив рубрики ~Коротко из Telegram~ Anthropic ОТКРЫЛА БЕСПЛАТНУЮ ШКОЛУ ПО РАБОТЕ С ИИ. Архив рубрики ~Коротко из Telegram~ Anthropic устроила бой трём Claude — и они начали… Архив рубрики ~Коротко из Telegram~ «СУПЕРИНТЕЛЛЕКТ БУДЕТ В МИЛЛИН РАЗ УМНЕЕ НАС» Архив рубрики ~Коротко из Telegram~ AI СОЗДАЁТ НОВЫЕ РАБОЧИЕ МЕСТА: Реальность VS Страхи Архив рубрики ~Полезное~ АНГЛИЙСКИЙ С НУЛЯ БЕЗ ЗУБРЁЖКИ И РЕГИСТРАЦИИ Архив рубрики ~Коротко из Telegram~ Meta готовит к запуску Hatch — потребительскую версию OpenClaw… Новости робототехники ВСЕМИРНЫЕ ИГРЫ ГУМАНОИДНЫХ РОБОТОВ, проходящие прямо сейчас в Пекине Архив рубрики ~Коротко из Telegram~ Каким может быть юбилейный iPhone XX Инсайдер Джон Проссер показал…

Оставить комментарий