Компания Apheris объявила результаты своей инициативы по совместному обучению в рамках программы федеративного верстки — теперь четыре крупные фармацевтические компании делают ставку на более крупные проекты.
Автор: Эллисон Проффитт
22 сентября 2026 г. | Четыре крупнейшие фармацевтические компании — AbbVie, AstraZeneca, Bristol Myers Squibb и Johnson & Johnson — объединяют свои данные для обучения модели искусственного интеллекта, которая предсказывает, как молекулы связываются со своими мишенями. Компании надеются, что этот шаг ускорит процесс разработки лекарств.
Сегодня сеть AI Structural Biology (AISB) Network, отраслевой консорциум, созданный берлинской компанией Apheris и работающий в сотрудничестве с лабораторией Аль-Курайши в Колумбийском университете, объявила об инициативе под названием AISB Bind. AISB Bind — это следующий этап в стремлении сети AISB продемонстрировать возможности федеративного обучения. Обучение моделей начнется в этом месяце, а готовые модели ожидаются в начале 2027 года.
Цель AISB Bind — сделать модели машинного обучения действительно полезными для программ разработки лекарств фармацевтических компаний, — рассказал Bio-IT World соучредитель и генеральный директор Apheris Робин Роэм. — «Он анализирует, какие другие типы данных существуют в частных фармацевтических репозиториях, которые могут помочь нам создавать превосходные модели с более высокой производительностью».
Объединенная система складирования и фундаментных работ
Это не первая задача, которую поставила перед собой сеть AISB. Компания Apheris предлагает продукты для федеративных сетей в области разработки лекарств, позволяя своим клиентам присоединяться к федеративным сетям машинного обучения или создавать собственные, одновременно защищая конфиденциальные данные. Компания является опорой сети AISB (AI Structural Biology) и поддерживает сеть ADMET с помощью Recursion, специализирующейся на прогнозировании свойств малых молекул, а также сеть разработки антител с помощью Ginkgo Dataworks.
В начале этого месяца компания опубликовала на своем сайте статью, в которой изложены результаты проекта Federated OpenFold3. Хотя статья не прошла рецензирование, представитель Apheris отметил, что ее соавторами являются сотрудники лаборатории Аль-Курайши в Колумбийском университете, и назвал имена членов команды от каждого из фармацевтических партнеров.
Пять фармацевтических компаний — AbbVie, Astex Pharmaceuticals, Bristol Myers Squibb, Johnson & Johnson и Takeda — потратили почти год на доработку OpenFold3, общедоступной модели «совместного сворачивания», которая предсказывает трехмерную форму, которую образуют белок и низкомолекулярный лекарственный препарат при связывании, на основе более чем 20 000 собственных структур, полученных из их программ активного лекарственного применения. Члены группы обсудили результаты работы в мае прошлого года на конференции Bio-IT World Conference & Expo.
В рамках федеративного проекта никакие из этих данных никогда не покидали собственные среды компаний; вместо этого каждый партнер обучал модель локально и периодически отправлял обратно только полученные веса модели в центральный агрегатор, управляемый компанией Apheris.
Результат оказался существенным. При тестировании на 1056 известных структурах, специально отобранных партнерами для оценки, полученная модель — AISB-1-Fed — обеспечила высококачественное предсказание интерфейса в 52,1% случаев, по сравнению с 35,6% у общедоступной модели OpenFold3, с которой она начиналась, и правильно определила местоположение самой молекулы лекарственного препарата в 46,8% случаев, по сравнению с 28,9%. Она также превзошла все общедоступные альтернативы, с которыми ее сравнивала команда, включая Boltz-2 и две версии ProtenixV1 от ByteDance, примерно на 11 процентных пунктов по обоим показателям.
Чтобы исключить возможность того, что улучшение результатов было обусловлено просто использованием более новых общедоступных обучающих данных, а не собственными структурами компаний, команда создала контрольную модель, обученную на OpenFold3 и всех доступных общедоступных данных, но без использования частных структур пяти компаний. Эта контрольная модель значительно уступала AISB-1-Fed, подтверждая, что именно частные структуры, имеющие отношение к лекарственным препаратам, а не более новые общедоступные данные, обуславливали скачок в точности.
«Мы показали, что можем добиться существенного повышения производительности, — сказал Роэм. — Но мы не показали, что модель теперь решает все проблемы [разработки] лекарств. Мы значительно улучшили её — намного лучше, чем то, чего мы могли бы достичь благодаря инновациям в архитектуре модели, — но в хранилищах фармацевтических данных всё ещё много программ, которые даже федеративная модель не может правильно обработать».
Рём заявил, что полученные данные подчеркивают ценность разнообразных данных. «Это не инновация в архитектуре модели», — подчеркнул он. «Архитектура модели — это та же самая архитектура модели, которая существует, будь то Boltz, OpenFold… все они, по сути, похожи». По его словам, дефицитом является тот вид плотных, имеющих отношение к лекарственным препаратам структурных данных, которые существуют только в собственных архивах отдельных фармацевтических компаний, и которые они не решаются предоставлять конкурентам.
Хотя общедоступные данные ценны, в статье отмечается, что с момента последнего крупного обновления общедоступных наборов данных в Банк данных белков (Protein Data Bank) было добавлено около 70 000 новых структур, но менее 3000 из них относятся к реально одобренным или исследуемым лекарственным препаратам. Остальные в основном представляют собой кофакторы, метаболиты и другие молекулы, малополезные для обучения модели, позволяющей определять приоритетность реальных кандидатов в лекарственные препараты.
Роэм утверждал, что обучение моделей только на внутренних данных также не является столь же надежным решением. Каждая компания имеет свою собственную, естественно, искаженную часть проблемы, сформированную теми целями и химическими процессами, над которыми она работала. Роэм сказал, что объединение данных из нескольких компаний заставляет модель обобщать данные за пределы истории какой-либо одной группы. «Объединяя данные из нескольких фармацевтических компаний, вы заставляете модель изучать своего рода разнообразие, которого вы не сможете добиться, если будете рассматривать только исторические данные из хранилищ соответствующих отдельных фармацевтических компаний», — сказал он.
Чтобы компании вообще могли делиться этими данными, нужно было убедить их в их безопасности. Компания Apheris провела собственные внутренние атаки на федеративную модель, включая атаки с «выводом принадлежности», предназначенные для определения того, была ли данная структура частью обучающих данных, и сообщила, что даже в условиях, специально созданных для злоумышленника благоприятными, этот метод терпел неудачу в большинстве попыток и мог показать, в лучшем случае, использовалась ли в обучении уже имеющаяся у злоумышленника молекула, ничего о молекулах, которые ему еще не были известны.
Система управления зданием (BMS) с учетом мнения участника.
Компания Bristol Myers Squibb принимала участие в проекте по совместному сворачиванию белков и снова присоединится к нему для проекта AISB Bind. Паял Шет, старший вице-президент по терапевтическим исследованиям в Bristol Myers Squibb, обсудила мотивацию и цели фармацевтической компании с изданием Bio-IT World.
Компания BMS не была слепо уверена в федеративном обучении — или в Apheris — но понимала, что сложности предсказания структуры превосходят даже глубину их пула данных. «Ни одна компания не обладает достаточным объемом данных по химическому и биологическому пространству [для предсказания структуры]», — сообщил Шетх изданию Bio-IT World по электронной почте. «Федерация позволила нам проверить, помогает ли объединение данных разных компаний, не покидая при этом нашу среду, а управление и безопасность Apheris выдержали нашу проверку. Инициатива по совместному свертыванию представляла собой контролируемый эксперимент, который мы могли оценить на собственных данных, и результаты сделали присоединение к Bind логичным следующим шагом в этом процессе обучения».
Шетх рассказала о сложности сопоставления данных, накопленных за десятилетия, с общей структурой. «Это были настоящие инвестиции. Сопоставление структурированных данных, собранных за десятилетия, с общей схемой требует научного подхода, а не просто переформатирования», — сказала она. Но инвестиции в проект по объединению данных принесут дивиденды проекту Bind. «Мы рассматривали это как создание устойчивого потенциала, и многое из этого сохранилось: стандарты, инфраструктура и управление уже налажены. Данные об интересах и активности создают свои собственные проблемы, но мы начинаем с более сильной позиции и с учетом накопленного опыта».
Хотя проект пока приносит свои плоды — «Результаты, полученные на наших собственных объектах, обнадеживают по сравнению с базовым уровнем», — сказал Шет, — компания BMS стремится понять, в каких случаях модели действительно имеют значение.
«Успех выглядит как: „Измеримое улучшение в принятии решений в рамках реальных программ: более точная расстановка приоритетов перед экспериментами, более надежное ранжирование внутри серий“, — объяснил Шет. — „Мы рассматриваем это как непрерывное обучение, а не как финишную линию. Каждый цикл, внутренний и внутри консорциума, учит нас тому, где модели помогают, а где они дают сбой. Если команды регулярно используют эти модели для решения сложных задач, потому что доказательства заслужили доверие, это и есть успех“».
Новая модель, извлеченные уроки
AISB Bind разработан для применения того же федеративного подхода к сродству связывания. Если первая инициатива была узко сфокусирована на прогнозировании трехмерной структуры молекулы, то Bind добавляет данные о сродстве связывания и данные высокопроизводительного скрининга, включая большой объем подтвержденных не связывающихся молекул — своего рода отрицательный сигнал, который редко доступен в больших масштабах, — с целью ранжирования молекул в химической серии, заслуживающих дальнейшего изучения на этапе оптимизации ведущих соединений, и отделения истинных связывающихся молекул от шума во время виртуального скрининга.
Рём описал технический подход как отход от типичного метода построения подобных моделей в отрасли, который заключается в том, чтобы один раз предсказать структуру, а затем добавить отдельную модель для определения сродства связывания. Подход Apheris, напротив, использует данные о связывании для генерации синтетических структур, отбирая высококачественные предсказания, чтобы расширить пул структурных данных, на основе которых модель может обучаться. «Мы используем данные о связывании и генерируем синтетические структуры на основе этих данных о связывании», — сказал он, назвав это «самым инновационным подходом» нового проекта.
Примечательно, что состав участников изменился: Astex и Takeda, обе компании, участвовавшие в первом проекте, не входят в AISB Bind, а AstraZeneca присоединяется впервые. Роэм сказал, что подобная текучка кадров типична для сети и отражает рост собственных возможностей компаний в области ИИ, а не какой-либо подрыв доверия. Компании, которые не участвуют в инициативе, сохраняют ту модель, в создании которой они принимали участие, но перестают получать обновления по мере развития сотрудничества. Такая система поощрения призвана вознаграждать за дальнейшее участие, не наказывая никого за уход.
Шет сказала, что BMS продолжает применять те же критерии при оценке каждого нового федеративного проекта. «Наши данные и интеллектуальная собственность должны оставаться защищенными, система управления должна работать на благо всех участников, а федерация должна постоянно демонстрировать заметное улучшение производительности по сравнению с тем, чего мы могли бы достичь в одиночку, и по сравнению с лучшими доступными альтернативами», — пояснила она. «Часть того, что мы тестируем, — это определение пороговых значений данных, то есть, какой объем дополнительных данных и какого типа приводит к существенному изменению, а не к незначительному приросту. Если отдача стабилизируется до такой степени, что незначительные данные перестанут существенно влиять на модели, это побудит нас пересмотреть наши инвестиционные планы. Мы продолжаем рассматривать каждый цикл как эксперимент с четко определенными показателями успеха».
Если на создание модели для первого проекта ушло почти год, то, по словам Роэма, теперь компания планирует выпускать обновленную модель Bind каждые четыре-шесть недель, проводя сравнительный анализ и проверку каждой модели перед переходом к следующей. Он добавил: «В конечном итоге у нас еще много целей, и мы стремимся создать превосходную модель в рамках этой программы».
Источник: www.bio-itworld.com
Похожие записи
- Тенденции из окопов: переосмысление вычислительных рабочих процессов для современной геномики.
- Google DeepMind распустила команду AlphaFold, которая получила Нобелевскую премию за модель, предсказывающую структуры белков для поиска лекарств
- Заметки из окопов: взгляд вычислительного биолога на цифровую революцию в разработке лекарств.
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
