Архив рубрики ~Лента новостей~

Перенос обучения для геномного прогнозирования в недостаточно представленных популяциях

Перенос обучения для геномного прогнозирования в недостаточно представленных популяциях
Перенос обучения для геномного прогнозирования в недостаточно представленных популяциях

Мы оцениваем способы улучшения межпопуляционного прогнозирования генетического риска и обнаруживаем, что, хотя перенос знаний из европейских когорт улучшает прогнозирование в небольших, недостаточно представленных популяциях, он снижает точность по мере увеличения размера выборки целевой когорты, особенно для признаков со специфической для популяции генетической архитектурой.

Быстрые ссылки

Полигенные показатели риска (ПРР) используются для прогнозирования риска заболеваний на основе генетических вариантов. Обычно они учитывают влияние сотен или миллионов генетических вариантов. Однако в настоящее время их применение в клинической практике ограничено, отчасти потому, что исторические полногеномные ассоциативные исследования (GWAS) в подавляющем большинстве случаев оценивали европейские когорты, что приводило к значительному снижению точности при применении к неевропейским популяциям. Эти различия в точности возникают из-за межпопуляционных различий в генетической архитектуре, популяционной структуре и частоте аллелей вариантов.

Более того, проведение полногеномных ассоциативных исследований (GWAS) с участием сотен тысяч человек является непомерно дорогостоящим для большинства систем здравоохранения. Перенос опыта, полученного в ходе существующих европейских GWAS, с дополнением этих крупномасштабных результатов исследованиями GWAS, специфичными для целевой популяции, представляет собой потенциальное решение.

С этой целью в данной статье мы описываем исследование, оценивающее эффективность полигенных индексов риска (PRS) в целевой неевропейской популяции, варьируя при этом размер как целевой популяции, так и европейских популяций, используемых для создания прогностической модели по восьми клиническим признакам. В частности, мы оцениваем переносимость PRS, полученных от сотен тысяч европейских индивидов в рамках Британского биобанка (UKB), на образцы в Биобанке Японии (BBJ), представляющем собой тщательно фенотипированную когорту, насчитывающую почти 200 тысяч японцев. Наша основная цель — предоставить систематические эмпирические рекомендации о том, как следует проводить межпопуляционное обучение моделей GWAS и PRS для оптимизации прогностической эффективности в целевой популяции.

Влияние размера популяции в исследовании GWAS на эффективность PRS целевого происхождения

Наличие двух крупномасштабных, тщательно генотипированных и фенотипированных наборов данных (UKB и BBJ) позволяет проводить эксперименты по исключению наборов данных для систематической оценки эффективности PRS в зависимости от размера выборки. Для оценки мы выбрали восемь клинически значимых признаков, измеренных в обеих популяциях: индекс массы тела (ИМТ), систолическое артериальное давление, диастолическое артериальное давление, количество эритроцитов, количество лейкоцитов, холестерин липопротеинов высокой плотности (ЛПВП), холестерин липопротеинов низкой плотности (ЛПНП) и уровень глюкозы в крови. В UKB оценочная доля дисперсии признака, объясняемая измеренными генетическими вариантами (наследуемость однонуклеотидных полиморфизмов), варьировалась от 0,07 до 0,28.

Для оценки возможности переноса характеристик PRS использовались три метода:

  1. UKB — Discovery GWAS + elastic net : Исследует возможность прямой переносимости вариантов между европейской и японской популяциями. Для каждого признака мы сначала выявили специфические для Европы генетические ассоциации, проведя GWAS на полной европейской популяции UKB, отфильтровав результаты по независимым вариантам, также присутствующим в японском наборе данных BBJ. Используя эти варианты в качестве входных данных, мы рассчитали полигенные индексы риска (PRS) для целевой популяции, обучив модели elastic net на различных комбинациях выборок BBJ и UKB. В частности, мы сопоставили 12–13 размеров выборок BBJ с семью размерами выборок UKB. Это позволило получить 96–104 модели PRS для каждого признака.
  2. Мета-анализ + эластичная сеть: исследование влияния смешивания данных японской популяции на процесс обнаружения вариантов. Сначала мы провели полногеномное ассоциативное исследование (GWAS) на полной европейской популяции UKB и выборке японских данных BBJ. Затем мы объединили эти генетические ассоциации с помощью мета-анализа для создания окончательного набора вариантов. Используя эти варианты, мы обучили модели эластичной сети на смешанном наборе данных UKB/BBJ для определения полигенных индексов риска (PRS) целевой популяции.
  3. PRS-CSx : Исследуется модель PRS-CSx, разработанная для учета разнообразия неравновесия сцепления между популяциями. Мы применили PRS-CSx к полным европейским образцам UKB и образцам японских BBJ для каждого признака. Поскольку модели PRS-CSx предоставляют два разных показателя для каждой популяции из одного образца, мы также разделили набор данных для валидации, чтобы найти оптимальные линейные комбинации между двумя показателями.

Во всех экспериментах модели PRS оценивались на одном и том же отложенном наборе образцов BBJ.

Разработка экспериментальной модели для межэтнического геномного прогнозирования. а) Основные эксперименты исследуют влияние различного количества европейских и японских образцов на эффективность модели эластичной сети применительно к вариантам, обнаруженным в ходе крупномасштабного европейского GWAS. б) Эксперименты по метаанализу интегрируют результаты GWAS, специфичные для каждой популяции, в процесс генерации вариантов, используемых для разработки модели эластичной сети. в) Эксперименты PRS-CSx подгоняют модель PRS-CSx на выборках различного размера, специфичных для каждой популяции.

В таблице приведены размеры выборок по восьми физическим и гематологическим показателям из наборов данных UKB и BBJ.

Размеры выборок в UKB и BBJ для восьми признаков, исследованных в данном исследовании.

Большее количество данных не всегда означает лучшее прогнозирование полигенного риска в разных популяциях.

Для каждого эксперимента мы количественно оценивали производительность модели с помощью коэффициента корреляции Пирсона. Как и ожидалось, европейские данные для обнаружения обеспечивают полезную базовую оценку, когда данные о целевой популяции ограничены или отсутствуют. Однако модели, специфичные для целевой популяции, показывают лучшие результаты при размерах выборки 15 000 и более, поскольку, по-видимому, совместное обучение с внешними европейскими данными ограничивает повышение точности целевой популяции, достигаемое за счет большей выборки.

Линейный график, показывающий улучшение и пересечение корреляции прогнозирования уровня ЛПВП по мере увеличения размеров выборок BBJ и UKB.

Эффективность PRS для холестерина ЛПВП в образцах BBJ в зависимости от размеров выборок BBJ и UKB: эта кривая титрования демонстрирует, как включение данных, не входящих в выборку, может фактически ухудшить точность прогнозирования в целевой популяции. После точки пересечения при 15 000 образцах BBJ включение более 5000 образцов UKB снижает точность прогнозирования по сравнению с обучением исключительно на данных целевой популяции.

Это удивительное наблюдение подтвердилось для всех исследованных нами фенотипов. Когда целевой размер выборки чрезвычайно мал (например, 5000 образцов), объединение европейских данных UKB во время обучения обеспечивает ценное статистическое преимущество. По мере увеличения целевого размера выборки, используемой для обучения модели PRS, польза от объединения данных извне популяции уменьшается.

Хотя эта тенденция сохраняется для всех фенотипов, точка пересечения, в которой успех использования европейских данных снижается, в значительной степени зависит от конкретного изучаемого признака. Мы можем количественно оценить степень «общей генетики», используя генетическую корреляцию одного и того же признака между популяциями. Мы наблюдаем, что «консервативные» признаки, или признаки с более высокой генетической корреляцией между двумя популяциями, сохраняют преимущества объединения европейских обучающих данных UKB до гораздо больших целевых размеров выборки (25-40 тыс.+ образцов), прежде чем обучающие данные, специфичные для целевой популяции, достигнут паритета.

Пять тепловых карт, демонстрирующих точность прогнозирования общих генетических признаков при различных размерах выборок UKB и BBJ.

Эффективность PRS в выборках BBJ в зависимости от размеров выборок BBJ и UKB для признаков с общей генетической архитектурой в разных популяциях: по мере того, как размер выборки BBJ превышает 40 тыс., оптимальный размер выборки UKB уменьшается по сравнению с максимальным.

В отличие от этого, для уровней липидов (ЛПВП, ЛПНП) и уровня глюкозы в крови размеры выборки BBJ значительно меньше, чем оптимальные размеры выборки UKB, а оптимальные размеры выборки также меньше. Эти сильно специфичные для популяции признаки не так сильно выигрывают от данных UKB, поскольку эти данные находятся дальше от границ распределения.

Три тепловые карты, демонстрирующие точность прогнозирования уникальных генетических признаков при различных размерах выборок UKB и BBJ.

Показатели PRS в выборках BBJ в зависимости от размеров выборок BBJ и UKB для признаков с уникальной генетической архитектурой в разных популяциях: в отличие от консервативных признаков, эти более специфичные для популяций фенотипы демонстрируют ранние точки скрещивания.

Влияние метаанализа и PRS-CSx

В ходе описанных выше экспериментов варианты, используемые в качестве входных данных для модели PRS, были ограничены теми, которые были обнаружены в европейской популяции UKB, за исключением любых вариантов, связанных с признаками и уникальных для образцов BBJ. Для расширения анализа и включения этих вариантов мы создали два дополнительных метода прогнозирования.

Сначала мы провели GWAS для каждого размера выборки BBJ. Первый новый метод выполнил межпопуляционный метаанализ, используя полный GWAS UKB и GWAS BBJ, специфичный для каждого размера выборки, для выявления вариантов-кандидатов, а затем применил эластичную сеть к этим вариантам. Второй метод использовал PRS-CSx для объединения двух наборов сводных статистических данных GWAS.

Отслеживая чистое повышение эффективности метаанализа и PRS-CSx при различных размерах выборки для исследования, мы выявили различия в эффективности в зависимости от размера выборки BBJ.

Влияние метаанализа на консервативные признаки невелико, в основном из-за снижения статистической мощности в выборках BBJ GWAS гораздо меньшего размера. Однако для популяционно-специфических признаков, таких как HDL и LDL, и в меньшей степени уровень глюкозы в крови, метаанализ существенно превосходит поиск на уровне одной популяции. Преимущества в основном обусловлены модификацией входных данных для метода эластичной сети: включение европейских образцов UKB в процесс обучения немного улучшило прогнозирование при использовании 10 000 или менее образцов BBJ. Этого улучшения не наблюдалось при использовании более крупных выборок BBJ.

Поскольку PRS-CSx динамически взвешивает модели, специфичные для каждой популяции, его производительность теоретически менее чувствительна к консервативным признакам по сравнению с признаками, специфичными для каждой популяции. Однако мы заметили, что для хорошей работы модели требуется больше данных, чем моделям с эластичной сетью. При целевом размере выборки менее 25 тыс. PRS-CSx показывает худшие результаты, чем соответствующая модель с эластичной сетью, по всем фенотипам, кроме ИМТ. При размере выборки, приближающемся к 100 тыс., PRS-CSx сравнялась или превзошла лучшую модель по всем фенотипам, за исключением уровня глюкозы в крови.

Восемь линейных графиков, сравнивающих коэффициент корреляции Пирсона для трех прогностических моделей при различных размерах выборки признаков.

Относительная эффективность моделей UKB discovery, meta-analysis и PRS-CSx в зависимости от размера выборки BBJ: результаты GWAS, специфичные для BBJ и используемые в мета-анализе и PRS-CSx, определены в субвыборочном наборе данных BBJ. Результаты GWAS UKB, используемые всеми моделями, основаны на всем европейском наборе данных UKB.

Заключение

Систематическая оценка межпопуляционного геномного прогнозирования показывает, что большие внепопуляционные наборы данных не всегда полезны при применении полигенных оценок риска (PRS) к недостаточно представленным этническим группам. В частности, хотя перенос обучения из большой европейской когорты UK Biobank обеспечил статистический прирост при малых размерах целевой популяции (менее 15 000 образцов в Biobank Japan), он фактически снизил точность прогнозирования по мере увеличения размера выборки BBJ. Это различие в эффективности зависит от признака: генетически консервативные признаки (такие как ИМТ) сохраняют преимущества объединения внешних данных до больших размеров выборки, в то время как популяционно-специфические признаки (такие как липиды и уровень глюкозы в крови) демонстрируют меньшую эффективность при меньшем количестве образцов. Важно отметить, что продвинутые методы, учитывающие несколько этнических групп, такие как PRS-CSx, требуют значительных выборок целевой популяции, чтобы превзойти более простые подходы, в то время как межпопуляционный метаанализ предлагает существенные преимущества для популяционно-специфических признаков при меньших размерах выборки. В конечном итоге, эти результаты подчеркивают, что для оптимизации прогностической эффективности в различных популяциях потребуется как расширение местных, разнообразных биобанков, так и тщательный выбор стратегии моделирования, учитывающей как наследуемость признаков, так и размер выборки.

Благодарности

Мы выражаем искреннюю благодарность Biobank Japan и нашим сотрудникам из RIKEN и Института медицинских наук Токийского университета за предоставленную возможность проведения этого исследования, а также другим сотрудникам Google: Бабаку Бехсазу, Эндрю Кэрроллу, Фархаду Хормоздиари и Тэдонгу Юну. Мы также благодарим Хироки Каяму и Джо Ледсама за институциональную поддержку, а также Майкла Бреннера и Кэтрин Чоу за их лидерскую поддержку.

Источник: research.google

❌ Нет похожих статей с такими тегами

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Как ИИ перестраивает разработку, инфраструктуру и продукты — 5 сентября… Архив рубрики ~Коротко из Telegram~ Проверяем файлы на следы Claude — Anthropic запустили отдельный чекер…. Архив рубрики ~Коротко из Telegram~ OpenAI отключает модели в Cursor после сделки со SpaceX С… Архив рубрики ~Коротко из Telegram~ Продажи книг на маркетплейсах могут упасть почти на 10% Продажи… Новости робототехники Стартап «крёстной матери» нейросетей Фэй-Фэй Ли World Labs представил «модель мира» Atlas — она позволяет генерировать 3D-сцены с управляемой камерой и симуляции для обучения роботов Архив рубрики ~Коротко из Telegram~ Этому гаджету НЕ НУЖЕН интернет — техноютубер собрал полностью офлайн-нейропереводчик…. Архив рубрики ~Коротко из Telegram~ Suno AI — все С сегодняшнего дня нейросеть для создания… Архив рубрики ~Коротко из Telegram~ Nvidia забирает команду Poolside без классической покупки Nvidia готовит сделку… Архив рубрики ~Коротко из Telegram~ Представлена флагманская серия смартфонов Poco: F9 Ultra и F9 Pro…. Архив рубрики ~Коротко из Telegram~ Роб из CircleCI: типичный PR сегодня — 104 файла Архив рубрики ~Коротко из Telegram~ Google довела Gemini Omni 1.1 Flash до релиза Google выпустила… Архив рубрики ~Коротко из Telegram~ 🎨 Google выпустила Pics — ИИ-редактор картинок внутри Workspace Теперь прямо… Архив рубрики ~Коротко из Telegram~ Почему длинный детальный промпт не всегда лучше короткого Интуиция подсказывает:… Архив рубрики ~Коротко из Telegram~ Google переводит выпуск чипов на темп выпуска LLM Амин Вахдат,… Архив рубрики ~Коротко из Telegram~ Как ИИ перестраивает разработку, инфраструктуру и продукты — 5 сентября… Архив рубрики ~Коротко из Telegram~ Проверяем файлы на следы Claude — Anthropic запустили отдельный чекер…. Архив рубрики ~Коротко из Telegram~ OpenAI отключает модели в Cursor после сделки со SpaceX С… Архив рубрики ~Коротко из Telegram~ Продажи книг на маркетплейсах могут упасть почти на 10% Продажи… Новости робототехники Стартап «крёстной матери» нейросетей Фэй-Фэй Ли World Labs представил «модель мира» Atlas — она позволяет генерировать 3D-сцены с управляемой камерой и симуляции для обучения роботов Архив рубрики ~Коротко из Telegram~ Этому гаджету НЕ НУЖЕН интернет — техноютубер собрал полностью офлайн-нейропереводчик…. Архив рубрики ~Коротко из Telegram~ Suno AI — все С сегодняшнего дня нейросеть для создания… Архив рубрики ~Коротко из Telegram~ Nvidia забирает команду Poolside без классической покупки Nvidia готовит сделку… Архив рубрики ~Коротко из Telegram~ Представлена флагманская серия смартфонов Poco: F9 Ultra и F9 Pro…. Архив рубрики ~Коротко из Telegram~ Роб из CircleCI: типичный PR сегодня — 104 файла Архив рубрики ~Коротко из Telegram~ Google довела Gemini Omni 1.1 Flash до релиза Google выпустила… Архив рубрики ~Коротко из Telegram~ 🎨 Google выпустила Pics — ИИ-редактор картинок внутри Workspace Теперь прямо… Архив рубрики ~Коротко из Telegram~ Почему длинный детальный промпт не всегда лучше короткого Интуиция подсказывает:… Архив рубрики ~Коротко из Telegram~ Google переводит выпуск чипов на темп выпуска LLM Амин Вахдат,…

Оставить комментарий