Dwa parametry, które wybierasz
Zatem, ile danych wybrać? W zależności od celu badania, kluczowymi parametrami są:
01
Ilość danych
w gigabajtach lub liczbie odczytów
02
Pokrycie (coverage)
czyli średnia liczba razy, jaką każdy nukleotyd w genomie zostanie odczytany/zsekwencjonowany
Ilość danych
Czym jest ilość danych w sekwencjonowaniu i kiedy ją stosujemy?
W sekwencjonowaniu dane są zwykle wyrażane w dwóch formach:
01
Liczba odczytów (np. 30 M reads, czyli 30 milionów odczytów)
Odczyty (ang. reads) to fragmenty DNA wygenerowane przez sekwenator. W zależności od technologii mogą to być np. odczyty 1×50 bp, 2×150 bp itp, co oznacza odczyt jednostronny o długości 50 nukleotydów, lub odczytów dwustronny (paired end) o długości 150 nukleotydów każdy.
02
Ilość danych w Gb/GB (np. 10 GB)
To całkowita liczba zsekwencjonowanych zasad (nukleotydów) - im dłuższe odczyty i ich więcej, tym większa ilość danych.
PRZYKŁAD · 30 M ODCZYTÓW PAIRED-END 2×150 BP
Liczba odczytów × 2 × długość odczytu
PODSTAWIENIE
30 000 000 × 2 × 150 = 9 000 000 000 nukleotydów
WYNIK
~9 GB surowych danych
Końcowa liczba oczyszczonych GB zależy również od jakości danych i filtracji odczytów.
Jednostki i dane oczyszczone
JEDNOSTKI
Gb
gigabaza, czyli miliard nukleotydów
GB
gigabajt, jednostka pamięci komputerowej
Gb ≈ GB
w praktyce sekwencjonowania 1 Gb ≈ 1 GB w plikach surowych (FASTQ)
Dane surowe vs oczyszczone
Dane surowe to wszystkie odczyty bezpośrednio z sekwenatora. Dane oczyszczone to odczyty po:
01
Usunięciu adapterów
02
Filtracji niskiej jakości
Q-score < 20-30
03
Usunięciu zbyt krótkich fragmentów
Typowa strata: 5-15% danych podczas kontroli jakości.
Przykład: z 9 Gb danych surowych (tzw. raw reads), po filtracji pozostanie ~8-8.5 Gb danych oczyszczonych (tzw. clean read) do analizy.
Zalecenia dla typów projektów
Miara i zalecana ilość danych zależą od typu projektu. W projektach bez jednej referencji nie stosuje się klasycznego pokrycia, tylko liczbę odczytów.
TYP PROJEKTU
MIARA
ZALECENIE
liczba odczytów na próbkę
~30 M reads dla analizy ekspresji genów (DEGs)
~50-100 M dla genów o niskiej ekspresji, long non-coding RNA lub gatunków o bardzo dużej liczbie genów
~10 M reads dla
RNA-seq bakterii
liczba odczytówbrak jednej referencji, nie ma klasycznego „coverage"
5-20 M reads dla niskiej złożoności
≥ 30 M reads lub więcej dla próbek środowiskowych
liczba odczytówbrak jednej referencji, nie ma klasycznego „coverage"
50 000 reads/tags na próbkę dla podstawowej identyfikacji
> 100 000 reads dla bardzo dokładnej taksonomii
pokrycie (coverage)
standardowe pokrycie to 30×
pokrycie (coverage)
zwykle 100-150×
Pokrycie (coverage)
Coverage (pokrycie) to średnia liczba razy, jaką każdy nukleotyd w genomie został odczytany/zsekwencjonowany.
PRZYKŁAD · GENOM LUDZKI, 90 Gb DANYCH
Ilość danych ÷ wielkość genomu
PODSTAWIENIE
90 Gb ÷ 3 Gb
WYNIK
pokrycie 30×
Każdy nukleotyd zostanie średnio odczytany 30 razy. Ilość zsekwencjonowanych danych można obliczyć z wzoru: liczba odczytów × długość odczytu, czyli np. 30M x 2 x 150.
Jak dobrać ilość danych
01
Określ cel projektu
Czy sekwencjonujesz genom, eksom, transkryptom, czy mikrobiom? Każdy typ projektu wymaga innej ilości danych.
02
Uwzględnij jakość próbki
Fragmentacja, degradacja czy niski input DNA mogą wymagać większego pokrycia (nawet +20-30% dodatkowych danych).
03
Zdefiniuj dodatkowe aspekty mogące mieć wpływ na wymaganą ilość danych
Im bardziej wymagająca analiza (np. wykrywanie wariantów somatycznych o niskim udziale), tym większe pokrycie będzie potrzebne. Dodatkowo jeżeli planowane jest porównanie wyników z innym, już przeprowadzonym projektem warto zachować tę samą specyfikację usługi aby móc łatwiej porównywać wyniki.
Wpływ na cenę projektu
Tak, ilość danych ma ogromny wpływ na cenę usługi, dlaczego?
01
Więcej danych = więcej czasu pracy sekwenatora
02
Więcej danych = większe zużycie odczynników
03
Więcej danych = dłuższa analiza bioinformatyczna i większe pliki do przechowywania
Dlatego nie zawsze więcej oznacza lepiej, istotne jest znalezienie złotego środka biorąc pod uwagę rodzaj projektu oraz jego cel jak również budżet.
Podsumowanie
Złote zasady
01
Nie zawsze więcej oznacza lepiej
02
Dobierz parametry do konkretnego celu projektu
03
Uwzględnij jakość próbki
04
Zaplanuj bufor na straty podczas kontroli jakości
Wybór ilości danych to balans między jakością wyników, celem badania i budżetem.
Rozpocznij uzupełniając nasz inteligentny formularz, który przeprowadzi Cię przez badanie potrzeb, pamiętaj, że jeśli napotkasz na jakąś wątpliwość to zaznacz w formularzu, że potrzebujesz pomocy i wyślij go do nas. Będziemy mieli już obraz sytuacji i podczas rozmowy będziemy mogli Ci pomóc.