IT - неотъемлемая частью новой медицины
Информационные технологии становятся неотъемлемой частью новой медицины
Сегодня формируется абсолютно новая отрасль, которая становится точкой притяжения различных методов работы с информацией - это индустрия биологических и медицинских информационных технологий (биоИТ). Даже если просто посмотреть на объем данных, которые начинают в ней возникать, то эту сферу можно поставить на одно из первых мест среди всех источников данных, существующих сейчас. И главной задачей становится правильным образом интерпретировать эти данные для научных и медицинских целей, использовать их для лечения больных.
Московский центр исследований и разработок EMC по облачным вычислениям и большим данным в Сколково принимает активное участие в становлении индустрии биоИТ и в решении основных ее задач. Сейчас центр работает над проектом, направленным на создание удобной информационной инфраструктуры, которая поможет врачу и исследователю найти потенциально ценную для лечения информацию гораздо эффективнее и интеллектуальнее, чем позволяют доступные сегодня средства.
Впервые медицинское исследование принципиально зависит от ИТ
Новая медицина серьезно зависит от достигнутого прогресса в области информационных технологий. Можно даже сказать, что она полностью базируется на технологиях обработки, анализа и инженерии новых, молекулярных данных (объединенных с «традиционной» медицинской информацией - описанием проявлений болезни, результатами анализов и др.).
Для врача имеют ценность не сами гигантские массивы информации, полученной в результате секвенирования ДНК или РНК, а только результаты их сложной математической обработки, а также сопоставления с аналогичными данными других больных, полученными исследователями и врачами во всем мире. Только в этом случае анализ этих данных поможет в лечении и прогнозировании заболеваний конкретного больного. В первую очередь это касается онкологических, редких и инфекционных болезней.
Сегодня все больше научных и медицинских организаций для лучшей эффективности своей работы связываются между собой в сети, которые позволяют им объединять и использовать геномный материал, накапливаемый каждым из них. Это влечет за собой потребность в создании информационных и технологических средств, позволяющих грамотно объединять геномные данные в мире. В частности, нужен эффективный механизм анализа и поиска информации в хранилищах, находящихся в разных госпиталях и университетах в разных концах Земли.
Геномика - крупный источник больших данных
Молекулярные данные становятся одним из главных и наиболее быстро растущих источников больших данных в мире. Уже в ближайшем будущем геномика будет производить несколько зеттабайт данных в год.
Сейчас в мире есть множество центров, клинических, исследовательских, которые уже генерируют большой объем данных, полученных в результате секвенирования. Хотя определенная концентрация есть (чем ближе к красному - тем больше плотность этих центров), тем не менее видно, что они достаточно сильно рассеяны по миру.
В Европе можно отметить серьезные центры в Великобритании, Испании, Франции, Швейцарии. Также выделяется восточное и западное побережья США. Огромный объем геномных данных получают в Китае, Южной Корее. Россия на этой карте оказывается чуть ли не белым пятном - отчетливо видны только центры в Москве, Петербурге и в Екатеринбурге (в реальности установок для секвенирования в Росси больше, чем показано на карте, но качественную картину карта передает верно)
Центры являются источником сырых данных, которые порождаются различными исследованиями - выявлением последовательности нуклеотидов ДНК, анализом уровня экспрессии генов, анализом белков, которые присутствуют в клеточном и межклеточном пространстве, сбором эпигенетических данных. С сырыми данными обычно не работают, но уже на этапе первичной обработки начинают анализировать их значение.
Поэтому критично важными становятся правила, форматы и стандарты, по которым происходит сбор и публикация данных. Для того, чтобы преодолеть разрыв между исследованием и клинической практикой возникает необходимость в создании свода правил и рекомендаций для работы со всеми данными, так называемая воронка, начиная от сырых данных и протоколов работы с ними, заканчивая рекомендациями врачей.
Масштаб индустрии БиоИТ определяется тем, что такой гигантский объем данных требует создания инфраструктуры, информационных и технологических средств, позволяющих хранить, объединять, проводить правильный поиск, анализировать всю эту информацию и обмениваться ей для исследовательского и медицинского использования.
На сегодняшний день, к сожалению, даже самые крупные международные клиники говорят о такой объединенной структуре потока данных и работе с ней, как о мечте. На уровне инженерии данных эта задача довольно сложна.
Проблемы индустрии БиоИТ
Существуют три основных проблемы работы с данными в БиоИТ - это плохая доступность данных, их растущий объем, а также несовершенства ПО для работы с ними.
Плохая доступность данных выражается в следующем:
• данные имеют разные форматы, структуру и разметку, они рассеяны по многочисленным базам данных мира
• характеристики данных становятся все более сложными: они описывают, как эти данные получены, и как они между собой связаны, содержат множество ссылок друг на друга и на внешние источники; эти описания («метаданные») тоже пока не унифицированы
• отсутствуют рекомендации и регламенты для клинической практики работы с данными, а также для публикации результатов.
• отсутствие единой модели данных для обмена: отсутствует единый протокол обмена данными, единая схемы построения запросов к базам
Размеры данных:
• существует проблема роста данных и скорости изменения данных: увеличивается скорость секвенирования, увеличивается объем, добавляются новые технологии секвенирования (а с ними и новые форматы сырых данных)
• в то время, как удельная цена хранения данных уменьшается, скорость пересылки данных между хранилищами не становится дешевле
• перемещение данных для их объединения и анализа в одном центре из различных источников часто требует неприемлемого времени; локальность вычислений (приближение вычислений к данным) становится критическим фактором.
• растут и размер, и сложность метаданных (при работе с большими коллекциями данных различной природы). Требуются новые эффективные приложения для работы с ними.
Устаревающая технологическая инфраструктура:
• информация хранится в традиционных базах данных, плохо приспособленных к омиксной специфике, что приводит к отсутствию гибкости, серьезным потерям времени и усложняет процесс
• многие популярные библиотеки приложений для анализа геномной информации разрабатывались учеными для собственных нужд. Такие приложения плохо приспособлены для новых задач промышленного масштаба, они требуют редизайна и существенного времени на разработку необходимого функционала.
В частности, многие популярные программы геномного анализа плохо поддаются параллелизации, то есть не позволяют использовать возможности вычислительных кластеров и суперкомьютеров. (Сейчас есть крупные проекты по разработке эффективных параллельных версий таких программных инструментов) .
Международные инициативы
Для того, чтобы решить такие проблемы, и в первую очередь связанные с публичными данными (открытыми источниками данных), около четырёх лет назад был создан Глобальный альянс по геномике и здравоохранению (GA4GH). Основная его задача состоит в создании общих протоколов работы с геномной информацией, общей модели для предоставления результатов поиска и описания структуры запроса. Огромная проблема остается все еще с согласием на обработку данных и передачей их между странами. Уже сейчас в рамках Альянса реализованы несколько успешных международных проектов, среди них Beacon project, Match Maker Exchange, создан стандарт для обработки и для обмена геномными данными, а также составлены рекомендации по использованию семейной истории в клинической практике. Успешно движется проект по работе с описанием модели метаданных - Metadata Team, проектная группа Genotype to phenotype (G2P) начинает проект «Раковый геном» (Cancer Genome Project), нацеленный на поиск мутаций, которые ведут к развитию раковых заболеваний человека.
Проект R&D Центра EMC в Сколково
Московский центр исследований и разработок EMC по облачным вычислениям и большим данным в Сколково сотрудничает проектной группой G2P Глобального альянса, которая призвана описать, как строить системы хранения ассоциаций, связывающие между собой генотипы и фенотипы, как собирать такие данные, как хранить, как их запрашивать, как возвращать результат. В частности Центр работает над созданием системы на основе проиндексированной многофункциональной базы данных. Она будет объединять массивы данных из самых разных источников, анализировать их и выявлять связи. Сейчас работает ее пилотная версия, она позволяет специалисту отправить запрос ко всему массиву, находить данные за доли секунды и получить развернутый ответ с учетом всех возможных связей, и что важно - контекста, даже если прямого указания на него нет. Так, врач может посмотреть, например, какие лекарства использовались при конкретных или сходных болезнях при разных вариантах геномных параметров, и получить ответ не только на свой прямой вопрос, но и на близкие вопросы, которые могут ему помочь в принятии решения.
Система поможет медицинским специалистам самого разного уровня:
• она ускорит работу врачей, которые до сих пор самостоятельно ищут информацию в многочисленных источниках.
• она создаст нужную инфраструктуру для клиник.
Система архивирует информацию в многофункциональной базе данных, в которой сохраняются и сами документы, и связи между ними. В результате у клиник будет возможность собрать накопленные знания, удобно укомплектовать и эффективно в них ориентироваться, пользуясь лишь ноутбуком.
Проект, над которым работает команда российских специалистов вместе с иностранными коллегами из компании EMC, уже получил положительные отзывы на выставке-конференции в области информационных технологий, биоинформатики и геномной медицины BioIT World, прошедшей в начале апреля 2016 года.
Параллельно налаживается сотрудничество с крупной американской клиникой, которое позволит проверить работу системы в приложении к клинической практике.
В российских реалиях эта система также может быть применена, и Московский центр исследований и разработок EMC по облачным вычислениям и большим данным открыт к сотрудничеству.
Создание сайтов NewMark