Modular Bioinformatics Toolkit for Sequence Analysis, Parsing, ML, and Visualization
pip install genomehouse- Sequence Analysis: Reverse complement, motif search, GC content, translation
- Data Parsing: FASTA/FASTQ, VCF, GFF/GTF, memory-efficient streaming
- Machine Learning: Feature extraction, classification, clustering, cross-validation
- Visualization: Alignment plots, phylogenetic trees, statistical charts, interactive visualizations
- Statistical Analysis: Hypothesis testing, correlation, distribution fitting, significance testing
- Extensible API: Modular architecture, plugin system, custom workflows
- Python ≥3.8
- NumPy, Pandas
- Matplotlib, Seaborn
- Scikit-learn
from genomehouse import sequence_tools
# Calculate GC content
seq = "ATGCGTACGGCTA"
gc_content = sequence_tools.gc_content(seq)
print(f"GC Content: {gc_content}%")
# Get reverse complement
rev_comp = sequence_tools.reverse_complement(seq)
print(f"Reverse Complement: {rev_comp}")
# Find motifs
motifs = sequence_tools.find_motifs(seq, "GC")
print(f"GC motifs found at: {motifs}")# Parse FASTA file
genomehouse-cli parse-fasta data/sample.fasta
# Calculate GC content
genomehouse-cli gc-content ATGCGTAC
# Convert FASTQ to FASTA
genomehouse-cli convert reads.fastq output.fasta
# Generate sequence statistics
genomehouse-cli stats genome.fastaBuilt with ❤️ for the bioinformatics community by Mubashir Ali and CelloByte Team
