Oto „genetyczny ChatGPT”. Tak wygląda potężna broń naukowców

Oto "genetyczny ChatGPT". Tak wygląda potężna broń naukowców

Autor:

w

Czy genetycy posiadają swoje wersje „ChatGPT”? Tak, i to nie tylko jedną. Jednym z takich narzędzi jest GPN-Star, które pomaga w identyfikacji wariantów DNA mogących wpływać na cechy organizmu oraz ryzyko wystąpienia różnych chorób. Testy przeprowadzone przez Uniwersytet Kalifornijski w Berkeley wykazały, że GPN-Star znacząco przewyższa konkurencyjne metody, a trenowanie tego mechanizmu opartego na sztucznej inteligencji wymagało znacznie mniej zasobów niż uczenie największych, wiodących modeli genomowych.


Badacze z Uniwersytetu Kalifornijskiego w Berkeley opracowali niezwykle istotne narzędzie do oceny biologicznego znaczenia zmian w DNA. W jednym z artykułów opublikowanych w czasopiśmie Nature, GPN-Star zyskuje przewagę nad wcześniejszymi metodami w wielu zadaniach związanych z wariantami. Model ten obejmuje zarówno fragmenty kodujące białka, jak i inne obszary sekwencji. GPN-Star wskazuje konkretne zmiany, które zasługują na dokładniejszą analizę: DNA jest tak złożoną strukturą, że sprawdzenie wszystkich wariantów jest z ekonomicznego punktu widzenia praktycznie niemożliwe.

Odczyt DNA to nie to samo, co czytanie książki

Wyjaśnia to fakt, że jedynie około 1-2% ludzkiego DNA zawiera sekwencje kodujące białka. Pozostała część to między innymi elementy regulacyjne, które decydują o tym, kiedy, gdzie i z jaką intensywnością geny są aktywne – nie są one „śmieciami”, jak niektórzy sądzą. Manipulowanie takim elementem może zmieniać niektóre cechy organizmu, nie modyfikując jednak samej instrukcji budowy konkretnego białka. W związku z tym, poszukiwania wariantów związanych z chorobami muszą przebiegać w inny sposób. I przebiegają.

Modele językowe dostosowane do DNA rozpoznają wzorce w sekwencjach czterech liter: A, C, G i T. Tak przedstawiana jest informacja genetyczna u ludzi, jak i innych organizmów, w tym naszego naczelnika Grzegorza. Każdy z nas ma swoją unikalną sekwencję, które są do siebie podobne, ale jednocześnie różnią się, co czyni je niepowtarzalnymi. GPN-Star odtwarza ukryte litery na podstawie otaczających je sekwencji oraz odpowiadających im fragmentów genomów innych gatunków. W ten sposób nauczył się rozpoznawać, jakie zmiany odpowiadają obserwowanym wzorom i które mogą naruszać delikatną równowagę biologiczną organizmu. A modele językowe, które działają jak „maszyny statystyczne”, są tutaj niezwykle skuteczne.

Porównania z uwzględnieniem ewolucji

Ogólnie rzecz biorąc, zbiór sekwencji nie mówi modelowi wprost, które fragmenty DNA różnych gatunków są sobie równoważne. Dlatego zastosowano dopasowania całych genomów. Algorytmy porównują w nich fragmenty, które są ze sobą powiązane, ujawniając miejsca, które przetrwały proces ewolucji oraz te, które uległy zmianom. GPN-Star potrafi także uwzględnić „drzewo genealogiczne” gatunków, co pozwala modelowi na analizę podobieństw w kontekście zapisanym w historii ewolucji.

Czytaj dalej poniżej


To przerażające, co potrafią te roboty. Uczą się prosto od ludzi

To ogromna przewaga modelu: ponieważ dobór naturalny zwykle eliminuje zmiany, które są szkodliwe dla organizmu, co jest istotą tego procesu. Długotrwałe utrzymanie fragmentu DNA może wskazywać, że pełni on ważną funkcję. Jednak sama zgodność sekwencji nie mówi nam, czy konkretny wariant powoduje jakąś chorobę. Model wykorzystuje informacje na ten temat i zestawia je z kontekstem danego miejsca w genomie, aby dokładniej oszacować możliwe skutki takiej zmiany.

Jak model został przetestowany w praktyce?

Naukowcy opracowali trzy wersje modelu dla ludzkiego genomu, korzystając oddzielnie z porównań: kręgowców, ssaków i naczelnych. Każdy z zestawów uwzględniał inną „głębię” historii ewolucyjnej. Dane pochodzące z odleglejszych „gałęzi” ewolucyjnych skuteczniej pomagały w ocenie rzadkich wariantów zmieniających białka. Są to sekwencje, które często pozostają podobne nawet u gatunków, które w wyniku ewolucji mocno się od siebie oddaliły. W testach wariantów podejrzewanych o wywoływanie chorób spoza regionów kodujących, opisanych w bazach OMIM i HGMD, najlepiej wypadła wersja oparta na genomach ssaków.

Z kolei w przypadku cech zależnych od dużej liczby wariantów genetycznych lepiej sprawdził się model oparty na genomach naczelnych. Similarne wyniki uzyskano w analizach związanych z ryzykiem schizofrenii. Różnice te związane są z różnym tempem ewolucji poszczególnych elementów genomu, w tym obszarów regulacyjnych.

Krótkie szkolenie

Najpotężniejsze modele GPN-Star miały po 200 mln parametrów i były szkolone przez kilka dni na ośmiu układach NVIDIA A100. Dla porównania, dotychczas wiodący model Evo 2 wymagał ponad 2000 układów H100 oraz kilku miesięcy treningu. Są to jednak modele przeznaczone do innych zastosowań, dlatego lepszym porównaniem byłoby zestawienie ich według zasady „jabłka do jabłek, gruszki do gruszek”. Potencjalnie niższe wymagania GPN-Star mogą ułatwić innym zespołom dostosowanie narzędzia do swoich specyficznych pytań badawczych.

Czytaj także: Bakterie z… mamutów? Badacze przekraczają granice paleogenetyki.

Istnieją już nawet wersje tego modelu dla myszy, kur, muszki owocowej, nicienia Caenorhabditis elegans oraz rzodkiewnika pospolitego. Zespół udostępnił także warianty przewidujące dotyczące genomu ludzkiego, które biologowie mogą używać podczas wyboru genów i elementów regulacyjnych w kontekście dalszych badań, np. nad chorobami. Czy naukowcy są w stanie „czytać i edytować” całą sekwencję DNA, tak jak robi to się z kodem w ChatGPT? Absolutnie nie. DNA pozostaje niezwykle złożonym i tajemniczym mechanizmem, a nie spodziewam się, że to się zmieni w najbliższej przyszłości. Mamy dostępne modele, które pomagają w badaniach, niemniej jednak nie są one w stanie „stworzyć” człowieka od zera, jak ma to miejsce w Xcode, Canvie, ChatGPT czy Claude. To jeszcze nie nadszedł ten czas, a takie porównania są zbyt trywialne w odniesieniu do skomplikowanej natury DNA.