Почему биологические данные имеют большее значение в разработке лекарств с помощью ИИ
Искусственный интеллект в действии
Почему биологические данные имеют большее значение в разработке лекарств с помощью ИИ
Компания GSK заключила соглашение о сотрудничестве в области исследований с британской биотехнологической компанией Relation Therapeutics на сумму до 110 миллионов долларов, расширяя существующую работу компаний в области разработки лекарств с использованием искусственного интеллекта.
В соответствии с соглашением, компания Relation будет создавать крупномасштабные наборы данных, измеряющие реакцию клеток человека на генетические изменения и лекарственные препараты. Эти данные будут использоваться для обучения моделей искусственного интеллекта, предназначенных для выявления потенциальных мишеней для лекарственных препаратов, включая модели в рамках платформы MORGAN компании Relation.
Соглашение предусматривает генерацию биологических данных наряду с разработкой моделей искусственного интеллекта. Исследовательский подход компании Relation связывает вычислительный анализ с экспериментами, позволяющими получить новую информацию о клетках человека.
Это сотрудничество основано на ранее достигнутых соглашениях между GSK и Relation, посвященных фиброзным заболеваниям и остеоартрозу. Те проекты включали наблюдательные исследования, направленные на создание двух функциональных наборов данных о заболеваниях для анализа с использованием платформы Lab-in-the-Loop от Relation.
В более ранних работах были объединены методы генетики человека, мультиомиксные исследования отдельных клеток, полученные из тканей человека, функциональные анализы и машинное обучение для выявления и подтверждения потенциальных мишеней для лечения заболеваний.
Как отношения генерируют биологические данные
Компания Relation описывает свой подход «лаборатория в цикле» как сочетание лабораторных экспериментов и вычислительного анализа. Ее работа включает профилирование тканей, одноклеточную и пространственную транскриптомику, секвенирование и валидацию мишеней, а машинное обучение используется для идентификации, приоритизации, валидации мишеней и разработки экспериментов.
Компания также проводит эксперименты по изучению влияния генетических изменений на клеточные характеристики, связанные с заболеванием. Полученные результаты затем можно анализировать вместе с генетическими данными и биологическими данными, полученными от пациентов.
Общедоступные репозитории остаются важным источником учебных материалов для базовых моделей биологических исследований, хотя объединение информации, полученной в ходе различных исследований, может создавать технические сложности.
В обзоре 2025 года, опубликованном в журнале Experimental & Molecular Medicine, отмечалось, что такие хранилища данных, как CZ CELLxGENE, Human Cell Atlas и NCBI Gene Expression Omnibus, предоставляют исследователям доступ к большим объемам данных об отдельных клетках. Согласно обзору, только CZ CELLxGENE предоставляет доступ к более чем 100 миллионам стандартизированных клеток.
Методы отбора проб, протоколы секвенирования, экспериментальные процедуры и конвейеры обработки могут различаться в разных исследованиях. Данные отдельных клеток также могут содержать технический шум и другие артефакты, что требует тщательного отбора наборов данных, фильтрации, балансировки состава и контроля качества во время обучения базовой модели.
Перекрытие наборов данных представляет собой еще одну проблему. В обзоре отмечалось, что одни и те же или похожие ячейки могут встречаться в нескольких общедоступных ресурсах, потенциально оказывая на них непропорциональное влияние во время обучения и создавая риски утечки данных при пересечении обучающих и тестовых наборов данных.
В ходе обзора было установлено, что формирование высококачественного, не избыточного набора данных так же важно, как и архитектура модели, при построении надежных базовых моделей отдельных клеток.
Большие объемы биологических данных не гарантируют создания более качественных моделей.
В июне этого года в журнале Nature Methods было опубликовано исследование, в котором изучалось, как размер и разнообразие данных для предварительного обучения влияют на базовые модели на основе отдельных клеток, используя корпус из 22,2 миллионов клеток. Исследователи обучили 400 моделей и оценили их в 6400 экспериментах.
Исследование показало, что существующие модели, основанные на анализе отдельных клеток, как правило, достигают плато производительности после обучения лишь на небольшой части доступного корпуса. В отличие от больших языковых моделей, оцениваемые системы не демонстрировали четких законов масштабирования данных, при которых постоянное увеличение объема обучающих данных неизменно приводило бы к лучшим результатам.
Исследователи обнаружили, что возможности модели, размер набора данных и вычислительные ресурсы необходимо сбалансировать, а не просто увеличивать одновременно. Исследование не установило, что меньшие или запатентованные наборы данных по своей сути лучше, но показало, что добавление большего количества биологических обучающих данных не всегда приводит к дальнейшему повышению производительности.
В отдельном исследовании, опубликованном в журнале Genome Biology в 2025 году, оценивались две базовые модели для анализа отдельных клеток, Geneformer и scGPT, в нескольких задачах оценки без предварительного обучения. Модели не всегда превосходили более простые подходы, а исследователи также выявили проблемы, связанные с эффектами пакетной обработки данных, и предостерегли от предположения, что более крупные предварительно обученные модели автоматически обеспечивают лучшее биологическое представление.
Фармацевтические компании занимаются поиском специализированных наборов данных.
Компания Relation уже применила свой подход к генерации данных в остеомике, которую она описывает как собственный функциональный атлас костной ткани на уровне отдельных клеток. В проекте используются образцы, полученные от пациентов, и сочетаются данные одноклеточной и пространственной омиксики с данными визуализации, геномики, протеомики и клинического фенотипа.
По данным компании, остеомика используется для исследования биологии заболевания, терапевтических мишеней, биомаркеров и подгрупп пациентов с остеопорозом. В наблюдательном исследовании участвуют больницы и исследовательские партнеры в Великобритании и Австралии.
В исследовании, опубликованном в прошлом месяце в журнале Nature Genetics, также изучались клеточные и генетические факторы, определяющие заболевания скелета, с использованием анализа отдельных клеток, генетических данных и функциональной валидации. Несколько исследователей из организации Relation были среди авторов исследования.
В исследовании Nature Biotechnology 2025 года, посвященном сделкам в биофармацевтической отрасли, ориентированным на искусственный интеллект, было выявлено, что специализированные поставщики наборов данных являются одной из нескольких тенденций, возникающих в результате недавних партнерств. Другие тенденции включали более крупные авансовые платежи, новые терапевтические методы и более широкое участие крупных биотехнологических компаний.
В анализе говорится, что высококачественные, специфичные для конкретных заболеваний наборы данных становятся важным исходным материалом для причинно-следственных и генеративных моделей машинного обучения. В нем приводится пример отдельного соглашения GSK с Ochre Bio на сумму 37,5 миллионов долларов за лицензирование данных, касающихся отдельных клеток печени человека и данных перфузированных органов.
Другой пример — соглашение между AstraZeneca и Pathos AI, заключенное в 2025 году с компанией Tempus на сумму 200 миллионов долларов. В рамках соглашения Pathos должна была разработать базовые модели для онкологии, используя обезличенные клинические, геномные и визуализационные данные, охватывающие более 150 000 пациентов.
Доступ к достаточному количеству высококачественных данных остается ограничивающим фактором в разработке лекарств с использованием ИИ. В обзоре исследований журнала Nature, посвященном федеративному обучению в фармацевтических исследованиях, ограниченный доступ к подходящим обучающим данным был назван основным узким местом для применения ИИ, при этом отмечалось, что компании также могут сталкиваться с ограничениями на обмен конфиденциальной информацией.
Таким образом, соглашения между компаниями, работающими в сфере искусственного интеллекта и биофармацевтики, различаются по способу получения данных и вычислительных возможностей. Некоторые соглашения касаются доступа к платформам ИИ, в то время как другие охватывают совместную разработку, лицензирование данных или создание новых биологических наборов данных.
Соглашение между GSK и Relation включает в себя как генерацию данных, так и разработку моделей. В рамках сотрудничества Relation будет создавать наборы данных о клетках человека и использовать их для обучения моделей искусственного интеллекта с целью выявления потенциальных мишеней для лекарственных препаратов.
(Фото предоставлено Центром по контролю и профилактике заболеваний)
См. также: Как ИИ сокращает сроки разработки лекарств в Китае

Хотите узнать больше об искусственном интеллекте и больших данных от лидеров отрасли? Посетите выставку AI & Big Data Expo, которая пройдет в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими выставками, включая Cyber Security & Cloud Expo. Для получения дополнительной информации нажмите здесь.
AI News — это проект TechForge Media. Здесь вы можете ознакомиться с другими предстоящими мероприятиями и вебинарами, посвященными корпоративным технологиям.
Источник: www.artificialintelligence-news.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
