Пробирка как процессор или как молекулы ДНК научились решать задачи. Алгоритмы.. Алгоритмы. биоинформатика.. Алгоритмы. биоинформатика. днк.. Алгоритмы. биоинформатика. днк. Машинное обучение.. Алгоритмы. биоинформатика. днк. Машинное обучение. нейронные сети.. Алгоритмы. биоинформатика. днк. Машинное обучение. нейронные сети. нестандартные вычисления.

Пробирка как процессор или как молекулы ДНК научились решать задачи - 1

Есть белок — рестриктаза ЭкоРИ. Она плавает в клетке, натыкается на двойную спираль ДНК и ищет конкретную последовательность из шести нуклеотидов (ГААТТЦ). Нашла — разрезает цепь ровно между первой и второй буквой. В стандартных лабораторных условиях никакой другой последовательности она не трогает. 

Прим. автора: при высоком содержании глицерина или нестандартном pH у ЭкоРИ проявляется так называемая звёздная активность — фермент начинает резать похожие, но не идентичные последовательности. Это известный артефакт, с которым борются в любом молекулярном протоколе.

Форма активного центра белка оптимизирована именно под эти шесть нуклеотидов — точное структурное соответствие обеспечивает во много раз большее сродство, чем к любой другой комбинации. Биохимики называют это специфичностью.

Леонард Эдлман — тот самый, чья буква «А» стоит в конце аббревиатуры RSA. Профессор Университета Южной Калифорнии, в 2002 году получил премию Тьюринга — высшую награду в информатике. В 1993 году, читая учебник Уотсона по молекулярной биологии, он задумался — а если фермент узнаёт последовательность и выполняет действие, это ведь и есть вычисление. Спустя год опубликовал эксперимент.

Как молекулы решали задачи

Статья вышла в ноябре 1994 года в журнале Science. Эдлман решал задачу о гамильтоновом пути. Дан граф с городами и дорогами между ними, нужно найти маршрут, проходящий через каждый город ровно один раз. Не задачу коммивояжёра — та требует ещё и кратчайший из таких маршрутов, что принципиально сложнее.

Граф был совсем небольшой. Семь городов, четырнадцать дорог.

Каждому городу Эдлман назначил случайную последовательность из 20 нуклеотидов. Каждой дороге — молекулу‑мост. Конец молекулы‑моста подобран так, чтобы химически соответствовать началу одного города и концу другого. Нуклеотиды спариваются по строгому правилу Уотсона‑Крика: А встаёт напротив Т, Г — напротив Ц. Молекула‑мост с высокой вероятностью присоединяется к правильному городу — неправильная пара термодинамически невыгодна. Но полностью исключить ошибки спаривания нельзя, и это один из главных источников шума в ДНК‑вычислениях.

Дальше в пробирку добавили лигазу — фермент, сшивающий молекулы с совпавшими концами. В растворе за несколько часов собрались все возможные маршруты одновременно: правильные, тупиковые, кольцевые. Потом начался отсев: полимеразная цепная реакция копирует только цепочки нужной длины — от стартового до финального города. Затем аффинное разделение на магнитных шариках с биотин‑авидиновой меткой оставляет только те, что содержат все обязательные узлы.

Что осталось в конце — и есть ответ.

Весь цикл занял около недели ручной работы. Параллелизм молекул — настоящий: около 3×1013 штук одновременно. Скорость лабораторных операций — человеческая.

Но.. почему это не масштабируется

Пробирка как процессор или как молекулы ДНК научились решать задачи - 2

Ци Оуян — физик, работавший в группе Альберта Либхабера. В 1997 году, опять же, в журнале Science опубликовал статью, где ДНК‑компьютер решил задачу о максимальной клике — доказательство того, что подход Эдлмана работает и на других NP‑задачах.

Равиндерджит Браич работал под руководством Эдлмана в Университете Южной Калифорнии. В 2002 году опубликовал решение задачи выполнимости на 20 переменных — наибольший экземпляр, который ДНК‑компьютер когда‑либо решал перебором.

Оба результата корректные и воспроизводимые. И оба упёрлись в одну и ту же стену.

Число маршрутов в задаче о гамильтоновом пути растёт факториально. С каждым новым городом умножается на следующее число. Один город — 1 вариант. Десять городов — уже 10!=3628800 вариантов. Двести городов — 200!, то есть примерно 10374.

Чтобы все эти варианты физически присутствовали в растворе в виде молекул ДНК, масса реагентов должна была бы превысить массу Земли примерно в 10328 раз.

И это не технологическая проблема. Факториальный рост — математика, а не вопрос размера колбы.

Молекулярный логический вентиль

Милан Стоянович — профессор Колумбийского университета, один из основателей направления молекулярного программирования. Его группа изучает автономные ДНК‑машины как основу для умных терапевтических агентов и биосенсоров.

В 2003 году в журнале Nature Biotechnology Стоянович с коллегами описал автомат MAYA — «Молекулярный массив вентилей ДА и И». Он играл в крестики‑нолики против человека и не проигрывал. Ход игрока задавался синтетической нитью ДНК с нужной последовательностью. Ответный ход вычислялся цепочкой молекулярных реакций. Выход — световой сигнал от флуоресцентной метки.

Основной элемент MAYA — ДНКзим. Это одноцепочечная молекула ДНК, которая при связывании с нужной входной последовательностью меняет трёхмерную форму и разрезает целевую молекулу. Без белков, без энергии извне. Вошёл нужный сигнал — реакция прошла.

Ограничение выяснилось быстро — ДНКзимы иногда срабатывали на посторонние молекулы. Больше десяти вентилей в одной надёжной цепочке собрать не получалось — шум накапливался.

Где молекулы выиграли

Пробирка как процессор или как молекулы ДНК научились решать задачи - 3

Яниф Эрлих — вычислительный биолог, профессор Колумбийского университета. Его называют «геномным хакером» за работы по приватности генетических данных — он показал, как деанонимизировать участников генетических баз данных через публичные родословные. В области хранения данных известен разработкой метода «ДНК‑фонтан».

Дина Зелиньский — биоинформатик, соавтор работы по ДНК‑фонтану. Её вклад — адаптация цифровых алгоритмов кодирования к реальным ограничениям молекулярной биологии.

В 2017 году в журнале Science они записали в ДНК 2.14 мегабайта — операционную систему Kolos, французский фильм 1896 года, пластинку зонда «Пионер», компьютерный вирус и работу Клода Шеннона. Прочитали без единой ошибки. Плотность записи — 215 петабайт на грамм.

Для понимания масштаба: флеш‑память нового поколения хранит 1–10 терабайт на кубический сантиметр. ДНК плотнее как минимум в 105 раз. Теоретический предел — около экзабайта на кубический миллиметр.

Практическое ограничение сейчас одно: записать мегабайт стоит сотни долларов, прочитать занимает несколько часов. Для архива, который пишется один раз и ждёт десятилетиями, это уже работает.

Ли Органик — исследователь Лаборатории молекулярных информационных систем Вашингтонского университета, созданной в партнёрстве с Microsoft. В 2018 году в Nature Biotechnology опубликовала результат, который решил главную практическую проблему ДНК‑хранилищ: произвольный доступ к конкретным файлам без чтения всего объёма. Из пула в 200 мегабайт команда извлекала любой из 35 файлов по запросу.

С 2010-х годов основная активность сместилась в биомедицину. Молекулярные схемы работают там, куда кремниевый чип не попадёт — внутри живой клетки.

Ключевой механизм здесь — вытеснение нити. Входная молекула ДНК прикрепляется к короткому свободному участку двойной цепочки и выталкивает одну из существующих нитей. Переключение состояния без ферментов — только за счёт термодинамики спаривания оснований. Надёжность по сравнению с ДНКзимами выросла, глубина схем — тоже.

Лулу Цянь — профессор биоинженерии Калифорнийского технологического института, специалист по молекулярному программированию. В 2011 году в соавторстве разработала одни из первых масштабируемых ДНК‑логических схем. Её лаборатория изучает автономных ДНК‑роботов и биологические вычислительные системы.

В 2018 году в журнале Nature группа Цянь опубликовала молекулярную нейронную сеть на основе вытеснения нити. Полностью без электроники. Сеть классифицировала рукописные цифры из набора MNIST, закодированные как паттерны 10×10 пикселей (100 бит на образ), и выдавала результат световым сигналом. Одно вычисление занимало около восьми часов.

Понятное дело, что восемь часов — не конкурент видеокарте. Но такая сеть помещается в клетку. Да и задачу коммивояжёра ДНК‑компьютер не решил. Математика не позволяет. Зато та же молекула хранит данные плотнее любой памяти, которую мы умеем делать и умеет вычислять внутри живого организма.

Автор: Paybeam

Источник