Sequencing Data Formats

One-Sentence Definition

Sequencing data formats are the standardized file types that carry reads, alignments, variants, and annotations through a bioinformatics pipeline.

Simple Explanation

Each pipeline step speaks a specific file dialect. Knowing which file holds what makes debugging possible.

Detailed Scientific Explanation

FormatHoldsTypical step
FASTASequences (no quality)Assemblies, references, genes
FASTQReads + per-base quality (Phred)Raw output, QC
SAM / BAM / CRAMAlignments to a referenceMapping, variant calling
VCF / BCFVariants (SNPs, indels)Variant Calling in Bacteria
GFF3 / GTF / GenBankAnnotations (genes, features)Genome Annotation
BEDGenomic intervalsCoverage, regions
Newick / NexusTreesPhylogenetic Tree Building
PDB / mmCIF3D structuresStructural Bioinformatics
BIOM / TSVCount tables16S Amplicon Analysis, Metagenomics

Phred quality: Q20 = 1% error, Q30 = 0.1% error.

Mechanism

Text or compressed binary containers with defined headers; indexing (.bai, .tbi, .fai) enables random access on huge files.

Clinical Importance

  • Reports must be traceable to a specific BAM/VCF + reference version for audits

Research Importance

  • Interoperability across tools; submission requirements for public archives

Diagnostic Relevance

  • Data retention policy for clinical WGS (raw reads vs assemblies)

AMR Relevance

  • Gene calls in a report should be traceable back to contigs/coordinates

Active Recall Questions

  1. Difference between FASTA and FASTQ?
  2. What does Q30 mean?
  3. Which file holds SNPs?

Connections