Собственные материалы, источники всегда указаны

Исследование 1,9 млн медицинских карт подчеркивает ограничения больших данных в медицинских исследованиях

Крупный анализ, в котором электронные медицинские карты 1,9 млн человек сравнивались с данными мировых биобанков, показывает, что увеличение размера набора данных не может устранить проблемы с качеством данных и ошибки фенотипирования.

The Global Wire Newsroom ·

Link preview · horizonglobalnews.com

Исследование 1,9 млн медицинских карт подчеркивает ограничения больших данных в медицинских исследованиях

Крупный анализ, в котором электронные медицинские карты 1,9 млн человек сравнивались с данными мировых биобанков, показывает, что увеличение размера набора данных не может устранить проблемы с качеством данных и ошибки фенотипирования.

Share

Эта статья переведена автоматически нашим редакционным ИИ с английского оригинала. Читать на английском

Медицинское исследование, в рамках которого были изучены электронные медицинские карты 1,9 млн человек, пролило новый свет на возможности и структурные ограничения использования массивных популяционных данных в медицинских исследованиях. В исследовании, о котором было сообщено 14 сентября 2026 года, проводилось систематическое сравнение определений заболеваний, применения лекарственных препаратов и распространенности онкологических заболеваний на основе повседневных клинических записей с данными крупных международных биобанков. Хотя увеличение размера когорты обеспечивает высокую статистическую мощность для выявления редких медицинских событий, результаты показывают, что увеличение объема выборки само по себе не устраняет систематические пропуски данных, ошибки диагностической классификации или систематическую ошибку отбора, присущие ежедневной клинической документации.

## Главные факты - В популяционном медицинском исследовании были проанализированы электронные медицинские карты (EHR) 1,9 млн человек с целью оценки связи между размером выборки и эпидемиологической надежностью. - Исследователи сравнили показатели здоровья, распространенность онкологических заболеваний и использование рецептурных препаратов на основе данных EHR с наборами данных известных международных биобанков. - Анализ показал, что увеличение масштаба выборки не может компенсировать структурные неточности, отсутствие клинических переменных или непоследовательное кодирование диагнозов. - Методы электронного фенотипирования, основанные на административных системах кодирования, продемонстрировали различную степень соответствия валидированным биологическим маркерам в разных категориях заболеваний. - Исследование подчеркивает необходимость сочетания масштабных клинических данных реальной практики с глубоко охарактеризованными проспективными когортами для предотвращения ошибочных выводов в медицинских исследованиях.

## Что произошло В новом исследовании был проведен всеобъемлющий сравнительный анализ набора данных электронных медицинских карт 1,9 млн человек, чтобы изучить, как масштаб выборки влияет на точность выводов медицинских исследований. Как сообщает News-Medical.net, исследователи оценили отдельные заболевания, определенные с помощью электронных записей, и сопоставили их распространенность, прогрессирование и схемы лечения с данными международных биобанков.

Исследование было сосредоточено на трех основных направлениях клинических данных: надежности электронных определений заболеваний, характерах назначения лекарственных средств и зарегистрированной распространенности онкологических заболеваний. Чтобы определить заболевания в наборах клинических данных реальной практики, исследователи обычно создают электронные фенотипы, используя комбинацию кодов Международной классификации болезней (ICD), результатов лабораторных анализов и записей врачей. Однако при оценке этих электронных определений на популяции почти в два миллиона человек исследователи выявили стойкие расхождения между практикой клинического кодирования и зафиксированным статусом заболевания.

При оценке использования лекарств в исследовании изучалось, насколько записи об отпуске рецептурных препаратов и назначениях врачей отражают реальное потребление лекарств. Сравнительный анализ показал, что, хотя огромные объемы выборок позволяют исследователям наблюдать редкие побочные эффекты и редкие комбинации назначений, в административных записях часто отсутствуют данные о приеме безрецептурных препаратов, нюансах применения не по показаниям (off-label) и несоблюдении пациентами режима лечения.

Аналогичным образом, оценивая распространенность онкологических заболеваний, исследователи сравнили документацию об опухолях в обычных электронных картах с данными специализированных канцер-регистров и проспективного отслеживания в биобанках. Сравнение подчеркнуло, что обычные административные записи часто страдают от задержек в отчетности, неверно указанной локализации первичной опухоли и неполной информации о стадии заболевания по сравнению со специализированными онкологическими базами данных. Результаты показывают, что хотя увеличение исследуемой популяции до миллионов записей повышает статистическую точность, оно одновременно усиливает неслучайный административный шум, если базовая система сбора данных остается нескалиброванной.

## Почему это важно Полученные результаты имеют прямые последствия для структуры биомедицинских исследований, процессов разработки лекарств и внедрения искусственного интеллекта в системах здравоохранения. За последнее десятилетие учреждения здравоохранения, фармацевтические корпорации и биотехнологические компании инвестировали миллиарды долларов в приобретение и анализ массивных наборов данных реальной клинической практики. Основная предпосылка этих инвестиций заключается в том, что один лишь объем данных может преодолеть шум, присущий неструктурированным клиническим административным записям.

Это исследование показывает, что статистическая мощность, полученная за счет больших объемов выборки, не может заменить качество данных и строгий подход к фенотипированию. Когда исследователи обучают прогностические алгоритмы или оценивают эффективность лекарств на невалидированных наборах данных миллионов пациентов, систематические ошибки не сглаживаются — напротив, они усиливаются. Ошибочная классификация статуса заболевания или неполное отслеживание соблюдения режима приема лекарств могут привести к тому, что модели машинного обучения выявят ложные корреляции, что потенциально может направить по ложному пути планирование клинических исследований или исказить рекомендации в сфере здравоохранения.

Кроме того, для специалистов по экономике здравоохранения и регулирующих органов, таких как U.S. Food and Drug Administration (FDA) и European Medicines Agency (EMA), результаты подчеркивают ограничения использования исключительно данных реальной клинической практики (RWE) для пострегистрационного наблюдения за лекарствами или расширения показаний к их применению. Хотя данные реальной клинической практики остаются необходимыми для охвата различных групп населения за пределами структурированных клинических исследований, регуляторные решения требуют валидированных диагностических определений, которые крупные административные наборы данных не предоставляют автоматически.

## Предыстория Развитие исследований на базе биобанков и аналитики данных реальной клинической практики за последние два десятилетия изменило эпидемиологическую методологию. Исторически медицинские исследования опирались на проспективные когортные исследования, такие как Framingham Heart Study, начатое в 1948 году, или Nurses' Health Study, стартовавшее в 1976 году. В эти классические когорты включались тысячи участников, у которых через регулярные промежутки времени собирались стандартизированные физикальные измерения, биологические образцы и подробные опросники об образе жизни. Обладая высокой точностью, проспективные когорты дороги в поддержке, ограничены по размеру выборки и медленно дают результаты при редких заболеваниях.

Чтобы преодолеть эти ограничения, мировые научные институты создали популяционные биобанки в сочетании с цифровым отслеживанием показателей здоровья. Известными примерами являются UK Biobank, созданный в 2006 году, который привлек 500 000 взрослых участников по всей Великобритании и связал их генетические профили с электронными картами National Health Service (NHS). В США National Institutes of Health запустили в 2018 году программу All of Us Research Program с целью привлечения одного миллиона и более различных участников, а Department of Veterans Affairs в 2011 году основал Million Veteran Program (MVP) для анализа генетических и клинических данных ветеранов военной службы. В Европе такие инициативы, как FinnGen в Финляндии, объединили геномные данные с общенациональными регистрами здравоохранения, охватывающими более 500 000 человек.

Параллельно с этим широкое внедрение электронных медицинских карт, подкрепленное законодательными актами, такими как HITECH Act 2009 года в США, привело к созданию огромных хранилищ повседневных клинических данных. Исследователи разработали автоматизированные алгоритмы электронного фенотипирования для преобразования сложных медицинских карт в стандартизированные классификации болезней с использованием таких систем кодирования, как ICD-9, ICD-10 и SNOMED CT. Полнофеномные исследования ассоциаций (PheWAS) стали популярным методом скрининга миллионов карт пациентов на предмет генетических связей с сотнями заболеваний одновременно.

Однако эпидемиологи уже давно предупреждают о фундаментальных структурных различиях между исследовательскими биобанками и административными данными здравоохранения. Клинические электронные медицинские карты создаются в первую очередь для ухода за пациентами и финансового расчета, а не для научных изысканий. В результате ввод данных зависит от финансовых стимулов выставления счетов, специфических традиций ведения документации в конкретных больницах, смены диагнозов и отсутствия клинических деталей, когда пациенты обращаются за помощью за пределы данной сети медицинских учреждений.

## Реакция Хотя официальные институциональные заявления после публикации исследования остаются ограниченными, его результаты подкрепляют давние дискуссии среди специалистов по медицинской информатике, эпидемиологов и директоров биобанков. Ведущие исследователи в области количественных методов неоднократно призывали к осторожности в отношении слепого доверия к огромным базам данных электронных медицинских карт без параллельной проспективной валидации.

Ожидается, что эпидемиологи и вычислительные биологи выступят за гибридные исследовательские структуры, сочетающие статистическую широту масштабных электронных медицинских карт с глубокой стандартизированной характеристикой, присущей проспективным биобанкам. Академические институты и исследовательские консорциумы, занимающиеся гармонизацией международных медицинских данных, вероятно, используют эти результаты для продвижения более строгих стандартов электронного фенотипирования.

Кроме того, поставщики аналитических услуг в сфере здравоохранения и разработчики биофармацевтических препаратов сталкиваются с растущим давлением со стороны научных рецензентов и регулирующих органов с требованием доказать, что их крупномасштабные аналитические модели учитывают пропуски данных и ошибки диагностической классификации, а не исходят из того, что один лишь размер популяции гарантирует достоверность.

## Что пока неизвестно Некоторые критически важные детали, касающиеся точной методологии исследования и его эмпирических результатов, остаются неуточненными в предварительном резюме. Конкретная институциональная принадлежность основной группы исследователей и специализированное рецензируемое издание не были подробно описаны в доступных материалах.

Кроме того, в публикациях не уточняется, в каких именно категориях заболеваний наблюдался наибольший уровень диагностических расхождений при сравнении с эталонными записями биобанков. На данный момент неизвестно, продемонстрировали ли хронические метаболические состояния, такие как сахарный диабет 2 типа и артериальная гипертензия, более высокое соответствие между электронными медицинскими картами и данными биобанков, чем сложные неврологические, аутоиммунные или психиатрические расстройства.

В отчете также не указывается точный географический состав исследуемой популяции численностью 1,9 млн человек и не уточняется, были ли клинические карты взяты из единой централизованной системы здравоохранения или агрегированы от нескольких независимых медицинских организаций. Понимание этих демографических и структурных параметров необходимо для определения того, насколько широко результаты исследования применимы к международным системам здравоохранения.

## За чем следить Ключевые события после этого исследования будут сосредоточены вокруг методологических обновлений в науке о медицинских данных и развивающихся регуляторных стандартов. Исследователи и специалисты по данным будут ждать полной рецензируемой публикации исследования, чтобы оценить его конкретные статистические модели, уровень ошибок и алгоритмы фенотипирования.

В государственном секторе органы здравоохранения и медицинские исследовательские сети будут отслеживать обновления общих моделей данных, разрабатываемых такими организациями, как консорциум Observational Health Data Sciences and Informatics (OHDSI) и Patient-Centered Outcomes Research Network (PCORnet). Принятие стандартизированных протоколов электронного фенотипирования в этих сетях станет практической проверкой того, как исследовательское сообщество реагирует на выявленные ограничения качества данных.

Наблюдателям также следует отслеживать предстоящие руководящие документы регуляторов от FDA и EMA, касающиеся стандартов предоставления данных реальной клинической практики. Введут ли регулирующие органы более строгие требования к валидации наборов данных реальной практики, используемых для мониторинга безопасности лекарств и расширения показаний к их применению, станет важнейшим показателем влияния исследования на политику в этой сфере.

Этот отчет основан на оригинальном новостном материале, опубликованном News-Medical.net.

Источник: news-medical.net

Похожие материалы