Наука

Самоадаптивні графи клітин покращують кластеризацію scRNA-seq


Підписуйтеся на нас в Гугл Новини, а також читайте в Телеграм і Фейсбук


Нова глибока модель SaDGAE для аналізу одинично-клітинного секвенування РНК (scRNA-seq) пропонує спосіб точніше групувати клітини за типами, долаючи шум, розрідженість та технічні артефакти в даних. Про розробку повідомляє видання Scienmag.

Самоадаптивні графи клітин покращують кластеризацію scRNA-seq

Кожна клітина людини має той самий геном, але, наприклад, нейрон, імунна клітина та бета‑клітина підшлункової залози поводяться по‑різному через те, які гени в них активні. Технологія scRNA‑seq дає змогу зчитувати цю активність окремо в кожній клітині, проте генерує гігантські та «діряві» матриці даних, де безліч нулів виникають не через біологію, а через збої секвенування.

Чому кластеризація одиничних клітин така складна

Ключове завдання, яке розв’язує SaDGAE, — кластеризація типів клітин. Щоб зрозуміти, що відбувається у тканині, спочатку потрібно розбити її на групи схожих клітин. У неспрямованих експериментах ці клітини не мають попередніх міток, тому алгоритм повинен знаходити групи лише за профілями експресії генів.

Дані scRNA‑seq створюють три головні труднощі:

  • дуже висока розмірність — кожна клітина описується тисячами генів;
  • сильна розрідженість — більшість генів у більшості клітин не експресуються;
  • dropout‑події — ген є активним, але через технічний збій його рівень фіксується як нуль.

Через це дві клітини одного типу можуть виглядати більш відмінними одна від одної, ніж клітини різних ліній. Класичні методи кластеризації погано справляються з такою структурою помилок.

Глибокий графовий автоенкодер із самоочищенням даних

SaDGAE, розроблена Сянхуй Лю (Xianghui Liu), Яньмей Ху (Yanmei Hu), Шенглінь Яном (Shenglin Yang), Цзе Веєм (Jie Wei) та Сянтао Лі (Xiangtao Li) з університетів Ченду та Цзілінь, побудована як графовий автоенкодер, що одночасно моделює і профілі експресії генів, і взаємозв’язки між клітинами.

Архітектура складається з кількох модулів, кожен з яких компенсує певну ваду сирих даних. Перший етап — денойзинговий автоенкодер на основі розподілу «zero‑inflated negative binomial» (ZINB). Ця статистична модель враховує як перенадлишкову дисперсію експресії, так і надлишок нулів через dropout.

Навчаючи автоенкодер відновлювати дані під ZINB‑моделлю, SaDGAE отримує зменшені за розмірністю представлення клітин, де технічний шум приглушений, а відмінності, важливі для розмежування типів клітин, зберігаються.

Самоадаптивний граф клітин замість фіксованої мережі

Найоригінальніший елемент підходу — самоадаптивний механізм побудови графа клітин. У графових методах кожна клітина — це вузол, а подібні клітини з’єднуються ребрами, що дозволяє нейромережі поширювати інформацію між «сусідами».

У більшості попередніх рішень граф будують один раз на початку з шумних або погано нормалізованих даних. Якщо на цьому етапі стосунки між клітинами встановлені неправильно, помилки «передаються» на всі наступні кроки.

SaDGAE трактує граф як динамічну структуру. Під час навчання модель одночасно:

  • удосконалює вбудовування (ембеддинги) клітин;
  • перебудовує граф зв’язків між ними;
  • оптимізує саму кластеризацію.

Кращі представлення клітин ведуть до кращого графа, а вдосконалений граф, у свою чергу, дає моделі більш точну структурну інформацію. Такий зворотний зв’язок допомагає виявляти тонкі, контекстно залежні зв’язки, які статичний граф на основі сирої експресії проігнорував би.

Подвійно посилений графовий автоенкодер та самонавчальна кластеризація

Над цим адаптивним графом працює подвійно посилений графовий автоенкодер (DeGAE), що й дало назву всьому фреймворку. Зазвичай графовий автоенкодер кодує ознаки вузлів через граф і намагається відновити матрицю суміжності з отриманих ембеддингів.

У SaDGAE сигнал відновлення посилюється з двох боків. Модель реконструює граф клітин:

  • і з прихованих ембеддингів;
  • і з відновлених декодером ознак.

Таким чином мережа змушена «домовитися» про структуру зв’язків між клітинами з двох незалежних напрямків. Це дає багатший навчальний сигнал і спрямовує ембеддинги до одночасної відповідності і експресійним даним, і топології сусідства клітин, забезпечуючи чіткіше розділення популяцій.

Фінальна стадія — самооптимізувальний кластеризаційний модуль у режимі самонавчання. Замість одноразового призначення клітин кластерам, модуль формує цільовий розподіл над кластерами і поетапно наближає ембеддинги до нього, посилюючи впевнені призначення та коригуючи неоднозначні. Такий підхід, типовий для глибокої кластеризації, дає змогу одночасно покращувати і представлення, і самі кластери.

Тести на різноманітних наборах даних і біологічна інтерпретація

Для оцінки SaDGAE команда перевірила її на тринадцяти загальнодоступних наборах scRNA‑seq, що охоплюють різні тканини та технології. Серед них — нейронні клітини (Pollen), підшлункова залоза (Muraro, Xin), гіпоталамус (Romanov), легені (Wang), ранні ембріони (Yan, Goolam), мозок (Zeisel), сечовий міхур і діафрагма (Quake), а також популярний набір PBMC‑3k з мононуклеарних клітин крові.

Ці дані суттєво різняться за розміром (від сотень до десятків тисяч клітин), платформою секвенування та біологічною складністю, тому слугують жорстким тестом універсальності. За словами авторів, розширені експерименти, тематичні кейси та окреме дослідження масштабованості показали, що SaDGAE забезпечує сильну й конкурентну якість кластеризації на всій цій панелі.

Важливо й те, що отримані кластери є біологічно осмисленими: метод точно відтворює відомі патерни маркерних генів. Це означає, що виявлені групи клітин можна співвіднести з уже описаними типами на основі того, які гени їх визначають.

Окремий масштабний тест продуктивності демонструє, що алгоритм здатен працювати з великими наборами даних, тоді як багато методів «застиґають» при переході від тисяч до мільйонів клітин. Автори також виклали оброблені дані та метадані наборів у відкритому репозиторії на GitHub, що полегшує відтворення результатів іншими групами.

Значення для одинично-клітинної біології

Робота вписується у ширшу тенденцію використання графових нейромереж у одинично‑клітинній обчислювальній біології, оскільки клітини у тканинах дійсно формують локальні «райони» та мережі взаємодій. Уже існує низка методів, які комбінують графові згортки, контрастивне навчання й автоенкодери для аналізу scRNA‑seq.

У цьому ландшафті внесок SaDGAE — наголос на тому, що граф клітин не повинен бути зафіксованим. Самоадаптивний граф, який відновлюється двома паралельними шляхами, зменшує ризик того, що випадкові помилки початкової побудови мережі будуть непомітно посилюватися на кожному наступному етапі аналізу.

Для ширшої наукової спільноти покращена некерована кластеризація є базовою можливістю. Виявлення типів клітин лежить в основі атласів, що прагнуть описати всі клітинні типи в організмі людини, досліджень хвороб, які шукають рідкісні патогенні стани клітин у пухлинах чи запалених тканинах, та скринінгів ліків, де відстежують, як терапії змінюють клітинні популяції.

Усі ці завдання починаються з питання, для якого і створювали SaDGAE: маючи тисячі немаркованих клітин, які з них справді належать до однієї групи? Якщо підхід із самоадаптивним графом підтвердиться на різних платформах і в різних лабораторіях, він може стати стандартним інструментом у наборі засобів для аналізу scRNA‑seq, перетворюючи шумні, розріджені дані секвенування на зрозумілі карти клітинної ідентичності.


Підписуйтеся на нас в Гугл Новини, а також читайте в Телеграм і Фейсбук


Back to top button