Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

10 Commits
 
 
 
 
 
 
 
 

Repository files navigation

GenomeHouse Logo

GenomeHouse

Modular Bioinformatics Toolkit for Sequence Analysis, Parsing, ML, and Visualization

PyPI Version Python Versions License GitHub Stars


🚀 Installation

pip install genomehouse

🧬 Features

  • Sequence Analysis: Reverse complement, motif search, GC content, translation
  • Data Parsing: FASTA/FASTQ, VCF, GFF/GTF, memory-efficient streaming
  • Machine Learning: Feature extraction, classification, clustering, cross-validation
  • Visualization: Alignment plots, phylogenetic trees, statistical charts, interactive visualizations
  • Statistical Analysis: Hypothesis testing, correlation, distribution fitting, significance testing
  • Extensible API: Modular architecture, plugin system, custom workflows

📦 Requirements

  • Python ≥3.8
  • NumPy, Pandas
  • Matplotlib, Seaborn
  • Scikit-learn

📝 Quick Start

from genomehouse import sequence_tools

# Calculate GC content
seq = "ATGCGTACGGCTA"
gc_content = sequence_tools.gc_content(seq)
print(f"GC Content: {gc_content}%")

# Get reverse complement
rev_comp = sequence_tools.reverse_complement(seq)
print(f"Reverse Complement: {rev_comp}")

# Find motifs
motifs = sequence_tools.find_motifs(seq, "GC")
print(f"GC motifs found at: {motifs}")

💻 CLI Usage

# Parse FASTA file
genomehouse-cli parse-fasta data/sample.fasta

# Calculate GC content
genomehouse-cli gc-content ATGCGTAC

# Convert FASTQ to FASTA
genomehouse-cli convert reads.fastq output.fasta

# Generate sequence statistics
genomehouse-cli stats genome.fasta

📚 Documentation & Resources


Built with ❤️ for the bioinformatics community by Mubashir Ali and CelloByte Team

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages