Нова модель для аналізу одинично-клітинного секвенування РНК пропонує точніший спосіб розподіляти клітини за біологічними типами. Метод SaDGAE поєднує глибокий автоенкодер, статистичне очищення даних і графову нейромережу, яка здатна самостійно змінювати зв’язки між клітинами під час навчання. Такий підхід допомагає подолати одну з головних проблем scRNA-seq — значний рівень шуму та велику кількість нульових значень у матрицях експресії.
Технологія одинично-клітинного секвенування дає змогу вивчати активність генів не усереднено для всієї тканини, а окремо для кожної клітини. Це особливо важливо для дослідження мозку, імунної системи, пухлин, ембріонального розвитку та регенеративної медицини. Водночас отримані масиви даних надзвичайно складні для інтерпретації: одна клітина може описуватися тисячами генів, але більшість із них у конкретному вимірюванні матимуть нульове значення.
Нуль у такій матриці не завжди означає, що ген не працює. Часто сигнал втрачається через недостатню кількість молекул, особливості підготовки зразка або обмеження секвенування. Явище отримало назву dropout. Через нього клітини одного типу можуть здаватися алгоритму дуже різними, а клітини з різних популяцій — навпаки, надто схожими. Саме тому традиційна кластеризація не завжди правильно відтворює реальну структуру тканини.
Чому дані scRNA-seq складно розділити на клітинні типи
Кластеризація є одним із перших і найважливіших етапів аналізу одинично-клітинних даних. Дослідник прагне об’єднати клітини, які мають подібні профілі експресії, а потім визначити їхню біологічну ідентичність за маркерними генами. На відміну від керованого навчання, алгоритм часто не отримує наперед заданих міток. Він має самостійно виявити приховані групи у великій і неоднорідній вибірці.
Ситуацію ускладнює висока розмірність даних. У профілі кожної клітини можуть бути присутні показники для десятків тисяч генів, однак лише невелика частина з них має інформативний сигнал. Крім того, експресія генів характеризується надлишковою дисперсією: навіть клітини однієї популяції можуть демонструвати помітні відмінності через природну мінливість або технічні фактори.
Якщо побудувати карту схожості клітин без попереднього очищення, випадкові шуми здатні сформувати помилкових сусідів. У результаті клітини можуть потрапити не до тієї групи, а невеликі, але важливі популяції залишаться непоміченими. Особливо небезпечно це під час пошуку рідкісних клітин у пухлинній тканині, аналізу перехідних станів або вивчення клітин, що реагують на лікування.
SaDGAE створена для того, щоб враховувати специфіку таких даних, а не розглядати нульові значення як звичайні пропуски. На першому етапі модель використовує денойзинговий автоенкодер. Він стискає вихідну матрицю до компактнішого представлення, намагаючись зберегти біологічно важливі закономірності та послабити вплив технічних артефактів.
Для цього застосовується модель zero-inflated negative binomial, або ZINB. Вона враховує одразу дві властивості scRNA-seq: надлишок нульових значень і нерівномірність розподілу рівнів експресії. Автоенкодер навчається відновлювати дані з урахуванням цієї статистичної структури, завдяки чому приховане представлення клітин стає стабільнішим для подальшої кластеризації.
Граф клітин, який змінюється під час навчання
Ключова особливість SaDGAE полягає у використанні самоадаптивного графа. У такій моделі кожна клітина представлена як вузол, а ребра між вузлами позначають схожість або близькість клітин у просторі ознак. Графові нейромережі використовують ці зв’язки, щоб передавати інформацію між сусідніми вузлами та краще відновлювати локальну структуру даних.
У багатьох підходах граф будують один раз на початку аналізу. Для цього використовують початкові профілі експресії або зменшені вектори ознак. Однак якщо вихідні дані містять багато шуму, первинна мережа може бути неточною. Помилкові зв’язки тоді зберігаються протягом усього навчання й впливають на фінальне розділення клітин.
SaDGAE не вважає початковий граф остаточним. Під час оптимізації модель одночасно покращує приховані представлення клітин, уточнює їхні взаємозв’язки та коригує межі кластерів. Це створює замкнений цикл: точніші ембеддинги допомагають побудувати кращий граф, а вдосконалений граф забезпечує нейромережу кориснішою інформацією про структуру популяцій.
Такий механізм особливо важливий для клітин, які перебувають у проміжних станах. Наприклад, під час диференціації клітина може поступово змінювати профіль експресії й не належати однозначно до одного з уже сформованих типів. Статичний граф здатен розірвати важливий ланцюжок подібності, тоді як адаптивна структура може зберегти зв’язок між послідовними станами.
У моделі також використовується подвійно посилений графовий автоенкодер. Він відновлює структуру графа не лише з прихованих векторів клітин, а й із ознак, реконструйованих декодером. Два джерела сигналу змушують систему узгоджувати інформацію про експресію та топологію клітинної мережі. Завдяки цьому модель менше залежить від випадкових помилок, які могли виникнути на початку аналізу.
У практичному сенсі це означає, що модель не просто шукає клітини з подібними наборами генів. Вона намагається відновити цілісну картину локального оточення, у якому кожен вузол пов’язаний з іншими клітинами через багатовимірну схожість. Такий підхід може бути корисним для тканин зі складною організацією та великою кількістю близьких клітинних станів.
Результати перевірки та потенційне застосування
Розробники протестували SaDGAE на тринадцяти наборах одинично-клітинних даних, що представляють різні тканини, біологічні процеси та експериментальні платформи. До аналізу входили зразки нервової системи, підшлункової залози, легень, мозку, ембріональних клітин, сечового міхура, діафрагми та мононуклеарних клітин периферичної крові.
Таке різноманіття дає змогу перевірити, наскільки метод залежить від конкретного типу тканини або технології секвенування. Набори відрізнялися кількістю клітин, рівнем шуму та складністю біологічних популяцій. За результатами оцінювання, SaDGAE продемонструвала конкурентну якість кластеризації на всій панелі тестів і в багатьох випадках точніше розділяла клітини за відомими типами.
Важливим критерієм стала не лише математична точність, а й біологічна зрозумілість отриманих груп. Кластери повинні підтверджуватися набором маркерних генів, характерних для певної клітинної лінії. У тестах модель змогла відтворити відомі закономірності експресії, завдяки чому сформовані групи можна було пов’язати з нейронами, імунними клітинами, клітинами епітелію, бета-клітинами та іншими популяціями.
Окрему увагу приділили масштабованості. Сучасні експерименти можуть охоплювати від кількох тисяч до мільйонів клітин, і не кожен складний алгоритм однаково добре працює на таких обсягах. Здатність обробляти великі масиви має практичне значення для створення клітинних атласів, у яких потрібно порівнювати багато тканин, пацієнтів або умов експерименту.
Потенційні сфери застосування методу охоплюють дослідження онкологічних захворювань, імунних реакцій, розвитку органів і дії лікарських препаратів. Точніша кластеризація допомагає виявляти рідкісні клітини, відстежувати перехідні стани та визначати, які популяції змінюються під впливом терапії. У пухлинах це може полегшити пошук клітин, пов’язаних із резистентністю до лікування або прогресуванням хвороби.
Водночас SaDGAE не скасовує потреби у біологічній перевірці результатів. Алгоритмічний кластер має бути підтверджений маркерними генами, додатковими експериментами та знаннями про досліджувану тканину. Самоадаптивний граф зменшує вплив шуму, але не може повністю компенсувати низьку якість зразка, неповне покриття транскриптів або помилки під час підготовки матеріалу.
Робота над SaDGAE демонструє загальну тенденцію в обчислювальній біології: моделі дедалі частіше переходять від статичного аналізу до динамічного навчання структури даних. Для scRNA-seq це особливо перспективно, адже взаємозв’язки між клітинами не завжди можна точно визначити за початковою, зашумленою матрицею.
Якщо ефективність підходу підтвердиться на нових наборах і в різних лабораторіях, самоадаптивні графи можуть стати важливою частиною інструментарію для аналізу одинично-клітинних експериментів. Вони допомагають перетворити розріджені та неоднорідні вимірювання на більш точні карти клітинної ідентичності, відкриваючи шлях до глибшого розуміння того, як організовані тканини та як вони змінюються під час хвороби або лікування.
Мерц у Києві оголосить нові рішення щодо військової допомоги Україні