Przejdź do treści
Baza wiedzy/ Wycena i zamówienie/ Ilość danych z sekwencjonowania

Ilość danych z sekwencjonowania

Sprawdź, jak dobrać ilość danych i pokrycie dla projektu, czym różnią się dane surowe i oczyszczone oraz jak czytać jednostki.

KATEGORIA
Usługi NGS
ETAP PROJEKTU
02 · Wycena i zamówienie
CZAS CZYTANIA
4 min
AKTUALIZACJA
29 lipca 2026
OPRACOWANIE
Zespół Techniczny weSEQ.IT
Wyceń projekt

Dwa parametry, które wybierasz

Zatem, ile danych wybrać? W zależności od celu badania, kluczowymi parametrami są:

01 Ilość danych w gigabajtach lub liczbie odczytów
02 Pokrycie (coverage) czyli średnia liczba razy, jaką każdy nukleotyd w genomie zostanie odczytany/zsekwencjonowany

Ilość danych

Czym jest ilość danych w sekwencjonowaniu i kiedy ją stosujemy?

W sekwencjonowaniu dane są zwykle wyrażane w dwóch formach:

01 Liczba odczytów (np. 30 M reads, czyli 30 milionów odczytów) Odczyty (ang. reads) to fragmenty DNA wygenerowane przez sekwenator. W zależności od technologii mogą to być np. odczyty 1×50 bp, 2×150 bp itp, co oznacza odczyt jednostronny o długości 50 nukleotydów, lub odczytów dwustronny (paired end) o długości 150 nukleotydów każdy.
02 Ilość danych w Gb/GB (np. 10 GB) To całkowita liczba zsekwencjonowanych zasad (nukleotydów) - im dłuższe odczyty i ich więcej, tym większa ilość danych.
PRZYKŁAD · 30 M ODCZYTÓW PAIRED-END 2×150 BP
Liczba odczytów × 2 × długość odczytu
PODSTAWIENIE 30 000 000 × 2 × 150 = 9 000 000 000 nukleotydów WYNIK ~9 GB surowych danych
Końcowa liczba oczyszczonych GB zależy również od jakości danych i filtracji odczytów.

Jednostki i dane oczyszczone

JEDNOSTKI
Gb
gigabaza, czyli miliard nukleotydów
GB
gigabajt, jednostka pamięci komputerowej
Gb ≈ GB
w praktyce sekwencjonowania 1 Gb ≈ 1 GB w plikach surowych (FASTQ)

Dane surowe vs oczyszczone

Dane surowe to wszystkie odczyty bezpośrednio z sekwenatora. Dane oczyszczone to odczyty po:

01 Usunięciu adapterów
02 Filtracji niskiej jakości Q-score < 20-30
03 Usunięciu zbyt krótkich fragmentów
ZAPAMIĘTAJ

Typowa strata: 5-15% danych podczas kontroli jakości.

Przykład: z 9 Gb danych surowych (tzw. raw reads), po filtracji pozostanie ~8-8.5 Gb danych oczyszczonych (tzw. clean read) do analizy.

Zalecenia dla typów projektów

Miara i zalecana ilość danych zależą od typu projektu. W projektach bez jednej referencji nie stosuje się klasycznego pokrycia, tylko liczbę odczytów.

TYP PROJEKTU
MIARA
ZALECENIE
RNA-Seqtranskryptomika
liczba odczytów na próbkę
~30 M reads dla analizy ekspresji genów (DEGs)
~50-100 M dla genów o niskiej ekspresji, long non-coding RNA lub gatunków o bardzo dużej liczbie genów
~10 M reads dla RNA-seq bakterii
Metagenomikashotgun sequencing
liczba odczytówbrak jednej referencji, nie ma klasycznego „coverage"
5-20 M reads dla niskiej złożoności
≥ 30 M reads lub więcej dla próbek środowiskowych
Amplicon sequencingnp. 16S rRNA
liczba odczytówbrak jednej referencji, nie ma klasycznego „coverage"
50 000 reads/tags na próbkę dla podstawowej identyfikacji
> 100 000 reads dla bardzo dokładnej taksonomii
pokrycie (coverage)
standardowe pokrycie to 30×
pokrycie (coverage)
zwykle 100-150×

Pokrycie (coverage)

Coverage (pokrycie) to średnia liczba razy, jaką każdy nukleotyd w genomie został odczytany/zsekwencjonowany.

PRZYKŁAD · GENOM LUDZKI, 90 Gb DANYCH
Ilość danych ÷ wielkość genomu
PODSTAWIENIE 90 Gb ÷ 3 Gb WYNIK pokrycie 30×
Każdy nukleotyd zostanie średnio odczytany 30 razy. Ilość zsekwencjonowanych danych można obliczyć z wzoru: liczba odczytów × długość odczytu, czyli np. 30M x 2 x 150.

Jak dobrać ilość danych

01 Określ cel projektu Czy sekwencjonujesz genom, eksom, transkryptom, czy mikrobiom? Każdy typ projektu wymaga innej ilości danych.
02 Uwzględnij jakość próbki Fragmentacja, degradacja czy niski input DNA mogą wymagać większego pokrycia (nawet +20-30% dodatkowych danych).
03 Zdefiniuj dodatkowe aspekty mogące mieć wpływ na wymaganą ilość danych Im bardziej wymagająca analiza (np. wykrywanie wariantów somatycznych o niskim udziale), tym większe pokrycie będzie potrzebne. Dodatkowo jeżeli planowane jest porównanie wyników z innym, już przeprowadzonym projektem warto zachować tę samą specyfikację usługi aby móc łatwiej porównywać wyniki.

Wpływ na cenę projektu

Tak, ilość danych ma ogromny wpływ na cenę usługi, dlaczego?

01 Więcej danych = więcej czasu pracy sekwenatora
02 Więcej danych = większe zużycie odczynników
03 Więcej danych = dłuższa analiza bioinformatyczna i większe pliki do przechowywania

Dlatego nie zawsze więcej oznacza lepiej, istotne jest znalezienie złotego środka biorąc pod uwagę rodzaj projektu oraz jego cel jak również budżet.

Podsumowanie

Złote zasady

01
Nie zawsze więcej oznacza lepiej
02
Dobierz parametry do konkretnego celu projektu
03
Uwzględnij jakość próbki
04
Zaplanuj bufor na straty podczas kontroli jakości
ZAPAMIĘTAJ

Wybór ilości danych to balans między jakością wyników, celem badania i budżetem.

Rozpocznij uzupełniając nasz inteligentny formularz, który przeprowadzi Cię przez badanie potrzeb, pamiętaj, że jeśli napotkasz na jakąś wątpliwość to zaznacz w formularzu, że potrzebujesz pomocy i wyślij go do nas. Będziemy mieli już obraz sytuacji i podczas rozmowy będziemy mogli Ci pomóc.

SŁOWA KLUCZOWE
coveragedepthGbgłębokość sekwencjonowaniailość odczytówM readsoutputpokrycie
Czy ten artykuł był pomocny?
Twoja odpowiedź pomaga nam poprawiać bazę wiedzy.

Szukasz innego artykułu?

Wróć do wszystkich tematów →

Porozmawiajmy o Twoim projekcie.

Ofertę przygotowujemy w ciągu 48 godzin od zapytania.