付録H: プログラム・ツール・データベース一覧
付録H: プログラム・ツール・データベース一覧
概要
本付録は、バイオインフォマティクス研究で使用される主要なプログラム、ツール、データベースを体系的に整理した総合リファレンスです。日常的な研究活動における実践的なガイドとして使い、必要に応じて概念の理解確認やツール選定の見直しにも活用できます。
更新日・選定基準
- 最終更新日: 2026-07-17
- 選定基準:
- 本文で登場する主要概念・手法に直接関係する
- 実務での利用頻度が高い
- 公式ドキュメント/論文等の一次情報に到達できる
- 最新トピック(2024–2026):
- AlphaFold 3 / AlphaFold Server
- Chai-1 / Boltz / RoseTTAFold All-Atom
- AlphaFold DB 2025
- scGPT / Geneformer / Nicheformer / Nucleotide Transformer
- AlphaMissense
- AlphaGenome / Evo 2
- T2T-CHM13 / ヒト・パンゲノム
- DeepVariant
- Long-read WGS / RNA-seq(PacBio HiFi / Oxford Nanopore)
- RNA velocity の解釈注意
- SpatialData / spatialdata-io / spatial proteomics
- GA4GH VRS / Beacon v2
- HL7 FHIR Genomics Reporting
- ClinVar classification / CPIC / ClinPGx
- NBDC controlled-access data
- Nextclade / Nextstrain
- AMRFinderPlus
- GTDB / GTDB-Tk / MetaPhlAn 4
- 質量分析 proteomics / metabolomics の標準、ツール、repository
H.1 配列解析ツール
H.1.1 配列類似性検索
| ツール名 |
開発元 |
主な機能 |
入力形式 |
出力形式 |
URL |
学習優先度 |
| BLAST |
NCBI |
配列類似性検索 |
FASTA |
XML/テキスト |
https://blast.ncbi.nlm.nih.gov/ |
★★★ |
| BLAST+ |
NCBI |
BLASTのコマンドライン版 |
FASTA |
各種形式 |
https://blast.ncbi.nlm.nih.gov/Blast.cgi?CMD=Web&PAGE_TYPE=BlastDocs&DOC_TYPE=Download |
★★★ |
| DIAMOND |
Buchfink et al. |
高速タンパク質類似性検索 |
FASTA |
BLAST形式 |
https://github.com/bbuchfink/diamond |
★★ |
| USEARCH |
Edgar |
高速配列検索・クラスタリング |
FASTA |
各種形式 |
https://drive5.com/usearch/ |
★★ |
| HMMER |
Eddy Lab |
HMMベース配列検索 |
FASTA |
テキスト |
http://hmmer.org/ |
★★ |
| PSI-BLAST |
NCBI |
反復的プロファイル検索 |
FASTA |
XML/テキスト |
NCBIサイト内 |
★★ |
| FASTA |
Pearson |
配列類似性検索の元祖 |
FASTA |
テキスト |
https://fasta.bioch.virginia.edu/ |
★ |
H.1.2 配列アライメント
| ツール名 |
開発元 |
主な機能 |
適用範囲 |
アルゴリズム |
学習優先度 |
| ClustalW |
Thompson et al. |
多重配列アライメント |
DNA/タンパク質 |
プログレッシブ法 |
★★★ |
| ClustalX |
Thompson et al. |
ClustalWのGUI版 |
DNA/タンパク質 |
プログレッシブ法 |
★★ |
| Clustal Omega |
Sievers et al. |
高速多重配列アライメント |
DNA/タンパク質 |
HMM + guide tree |
★★★ |
| MUSCLE |
Edgar |
高精度多重配列アライメント |
DNA/タンパク質 |
Progressive + refinement |
★★ |
| MAFFT |
Katoh et al. |
高速多重配列アライメント |
DNA/タンパク質 |
FFT-based |
★★ |
| T-Coffee |
Notredame et al. |
一貫性ベースアライメント |
DNA/タンパク質 |
Consistency-based |
★ |
| Needleman-Wunsch |
- |
グローバルアライメント |
ペア配列 |
動的計画法 |
★★★ |
| Smith-Waterman |
- |
ローカルアライメント |
ペア配列 |
動的計画法 |
★★★ |
H.1.3 配列マッピング・アライメント
| ツール名 |
開発元 |
主な機能 |
特徴 |
適用データ |
学習優先度 |
| BWA |
Li & Durbin |
ショートリードマッピング |
高精度 |
Illumina reads |
★★★ |
| BWA-MEM |
Li |
長いショートリードマッピング |
BWAの改良版 |
>70bp reads |
★★★ |
| Bowtie2 |
Langmead & Salzberg |
高速リードマッピング |
メモリ効率 |
Paired-end reads |
★★★ |
| HISAT2 |
Kim et al. |
スプライシング対応マッピング |
RNA-seq特化 |
RNA-seq reads |
★★★ |
| STAR |
Dobin et al. |
高速RNAマッピング |
2-pass mode |
RNA-seq reads |
★★★ |
| TopHat2 |
Kim et al. |
スプライシング検出マッピング |
非推奨 |
RNA-seq reads |
★ |
| minimap2 |
Li |
長いリードマッピング |
PacBio/ONT対応 |
Long reads |
★★ |
| pbmm2 |
Pacific Biosciences |
PacBio long-read alignment |
minimap2 SMRT wrapper |
PacBio HiFi/CLR |
★★ |
H.2 ゲノム解析ツール
H.2.1 ファイル操作・品質管理
| ツール名 |
開発元 |
主な機能 |
対象ファイル |
主要コマンド例 |
学習優先度 |
| SAMtools |
Li et al. |
SAM/BAMファイル操作 |
SAM/BAM/CRAM |
view, sort, index |
★★★ |
| BCFtools |
SAMtools team |
VCFファイル操作 |
VCF/BCF |
call, view, stats |
★★ |
| VCFtools |
Danecek et al. |
VCF解析・操作 |
VCF |
–freq, –het |
★★ |
| BEDTools |
Quinlan & Hall |
ゲノム領域操作 |
BED/GTF/GFF |
intersect, merge |
★★ |
| FASTQC |
Babraham Inst. |
FASTQ品質評価 |
FASTQ |
- |
★★ |
| Trimmomatic |
Bolger et al. |
リード品質フィルタリング |
FASTQ |
- |
★★ |
| Picard |
Broad Institute |
SAM/BAM操作ツール集 |
SAM/BAM |
MarkDuplicates |
★★ |
| mosdepth |
Pedersen / Quinlan lab |
coverage計算 |
BAM/CRAM |
mosdepth prefix input.bam |
★★ |
H.2.2 変異検出・解析
| ツール名 |
開発元 |
主な機能 |
変異タイプ |
特徴 |
学習優先度 |
| GATK |
Broad Institute |
変異検出統合環境 |
SNV/Indel |
ベストプラクティス |
★★★ |
| HaplotypeCaller |
Broad Institute |
GATK変異検出エンジン |
SNV/Indel |
Local assembly |
★★★ |
| Mutect2 |
Broad Institute |
体細胞変異検出 |
Somatic mutation |
がん研究 |
★★ |
| VarScan |
Koboldt et al. |
変異・CNV検出 |
SNV/Indel/CNV |
統計ベース |
★★ |
| FreeBayes |
Garrison & Marth |
ベイジアン変異検出 |
SNV/Indel |
Population-based |
★★ |
| Strelka2 |
Illumina |
高精度変異検出 |
SNV/Indel |
Somatic/Germline |
★ |
| DeepVariant |
Google |
深層学習による変異検出 |
SNV/Indel |
Deep learning |
★★ |
| Clair3 |
HKU-BAL |
long-read small variant calling |
SNV/Indel |
PacBio/ONT models |
★★ |
| Sniffles2 |
Sedlazeck lab |
long-read SV calling |
SV |
PacBio/ONT germline/somatic/population |
★★ |
| pbsv |
Pacific Biosciences |
PacBio SV calling |
SV |
PacBio SMRT workflow |
★ |
| cuteSV |
Jiang et al. |
long-read SV detection |
SV |
sensitive/scalable SV signatures |
★ |
| WhatsHap |
CWI / contributors |
read-based phasing |
phased VCF |
long-read phasing support |
★★ |
H.2.3 ゲノムアセンブリ
| ツール名 |
開発元 |
主な機能 |
対象リード |
アルゴリズム |
学習優先度 |
| SPAdes |
Bankevich et al. |
ゲノムアセンブリ |
Illumina |
de Bruijn graph |
★★★ |
| Velvet |
Zerbino & Birney |
ショートリードアセンブリ |
Illumina |
de Bruijn graph |
★★ |
| ABySS |
Simpson et al. |
大規模ゲノムアセンブリ |
Illumina |
Parallel assembly |
★★ |
| Canu |
Koren et al. |
長いリードアセンブリ |
PacBio/ONT |
OLC approach |
★★ |
| Flye |
Kolmogorov et al. |
長いリードアセンブリ |
PacBio/ONT |
Repeat resolution |
★ |
| Trinity |
Grabherr et al. |
RNA-seqアセンブリ |
RNA-seq |
de novo transcriptome |
★★ |
H.3 RNA-seq解析ツール
H.3.1 発現量定量
| ツール名 |
開発元 |
主な機能 |
定量単位 |
特徴 |
学習優先度 |
| featureCounts |
Liao et al. |
遺伝子発現カウント |
Raw counts |
高速・軽量 |
★★★ |
| HTSeq |
Anders et al. |
発現量カウント |
Raw counts |
Python実装 |
★★ |
| Cufflinks |
Trapnell et al. |
転写産物定量 |
FPKM/RPKM |
非推奨 |
★★ |
| StringTie |
Pertea et al. |
転写産物アセンブリ・定量 |
TPM/FPKM |
Reference-guided |
★★ |
| Salmon |
Patro et al. |
高速転写産物定量 |
TPM |
k-mer based |
★★★ |
| Kallisto |
Bray et al. |
超高速転写産物定量 |
TPM |
Pseudoalignment |
★★★ |
| RSEM |
Li & Dewey |
転写産物定量 |
FPKM/TPM |
EM algorithm |
★★ |
| IsoQuant |
ablab |
long-read transcript discovery / quantification |
isoform counts/TPM |
PacBio/ONT long RNA reads |
★★ |
| FLAIR |
Brooks Lab / UCSC |
full-length alternative isoform analysis |
isoform table |
long-read RNA-seq |
★★ |
| bambu |
Göke lab / Bioconductor |
long-read isoform reconstruction / quantification |
counts/CPM |
reference-guided long-read RNA-seq |
★★ |
H.3.2 発現差分解析
| ツール名 |
開発元 |
主な機能 |
統計手法 |
実装言語 |
学習優先度 |
| DESeq2 |
Love et al. |
発現差分解析 |
Negative binomial |
R/Bioconductor |
★★★ |
| edgeR |
Robinson et al. |
発現差分解析 |
Negative binomial |
R/Bioconductor |
★★★ |
| limma |
Ritchie et al. |
線形モデル解析 |
Linear modeling |
R/Bioconductor |
★★ |
| NOISeq |
Tarazona et al. |
ノンパラメトリック解析 |
Non-parametric |
R/Bioconductor |
★ |
| ballgown |
Frazee et al. |
転写産物レベル解析 |
Linear modeling |
R |
★ |
H.3.3 single-cell / spatial解析
| ツール名 |
開発元 |
主な機能 |
特徴 |
URL |
学習優先度 |
| scGPT |
University of Toronto / UHN / Vector Institute |
single-cell foundation model |
注釈/摂動予測支援 |
https://pubmed.ncbi.nlm.nih.gov/38409223/ |
★ |
| Squidpy |
scverse |
空間解析 |
近傍解析・共局在 |
https://squidpy.readthedocs.io/ |
★ |
| SpatialData |
scverse |
multimodal spatial omics データ構造 |
images / labels / points / shapes / tables と座標変換 |
https://spatialdata.scverse.org/ |
★★ |
| spatialdata-io |
scverse |
空間オミクス reader |
Visium / Visium HD / Xenium / CosMx / MERSCOPE / CODEX / Stereo-seq 等 |
https://spatialdata.scverse.org/projects/io |
★★ |
| Seurat v5 spatial vignettes |
Satija Lab |
single-cell / spatial 解析ワークフロー |
Visium / Xenium / CosMx / CODEX 等の導入例 |
https://satijalab.org/seurat/articles/get_started_v5_new |
★★ |
| Nicheformer |
Technical University of Munich / Helmholtz Munich |
空間/細胞間相互作用解析 |
空間コンテキスト活用 |
https://www.nature.com/articles/s41592-025-02814-z |
★ |
H.4 系統解析・進化解析ツール
H.4.1 系統樹構築
| ツール名 |
開発元 |
主な機能 |
手法 |
プラットフォーム |
学習優先度 |
| MEGA |
Kumar et al. |
統合系統解析環境 |
NJ/ML/MP |
Windows/Mac/Linux |
★★★ |
| PHYLIP |
Felsenstein |
系統解析パッケージ |
多様な手法 |
Command line |
★★ |
| RAxML |
Stamatakis |
最尤法系統解析 |
Maximum likelihood |
Command line |
★★ |
| IQ-TREE |
Nguyen et al. |
高速最尤法解析 |
Maximum likelihood |
Command line |
★★ |
| FastTree |
Price et al. |
高速近似最尤法 |
Approximate ML |
Command line |
★ |
| MrBayes |
Ronquist et al. |
ベイジアン系統解析 |
Bayesian MCMC |
Command line |
★★ |
| BEAST |
Drummond et al. |
分子時計解析 |
Bayesian MCMC |
GUI/Command line |
★ |
H.4.2 病原体ゲノミクス・メタゲノム解析
| ツール名 |
開発元 |
主な機能 |
入力/対象 |
出力・確認すること |
学習優先度 |
| Nextclade |
Nextstrain |
viral genome alignment / mutation calling / clade assignment / QC / phylogenetic placement |
SARS-CoV-2 等の viral consensus FASTA |
dataset version、QC flag、mutation、clade、placement。感染経路の証明ではない |
★★ |
| Nextstrain / Auspice |
Nextstrain |
pathogen evolution の tree / metadata 可視化 |
aligned sequences、tree、metadata |
日付・地域・host 属性の粒度、公開可否、サンプリング偏り |
★★ |
| AMRFinderPlus |
NCBI |
AMR gene、resistance-associated point mutation、stress / virulence gene 検出 |
bacterial assembly FASTA、protein annotation |
software/database version、organism option、AMR genotype。phenotype ではない |
★★ |
| GTDB / GTDB-Tk |
Australian Centre for Ecogenomics 等 |
genome phylogeny に基づく microbial taxonomy / genome classification |
bacterial / archaeal isolate genome、MAG |
GTDB release、classification、ANI / placement。read-level profiling とは別 |
★★ |
| MetaPhlAn 4 |
bioBakery / Segata lab 等 |
metagenomic shotgun reads の species-level microbial profiling |
shotgun metagenome reads |
marker DB version、relative abundance、unknown species 対応、batch/contamination |
★★ |
H.4.3 集団遺伝学解析
| ツール名 |
開発元 |
主な機能 |
解析対象 |
特徴 |
学習優先度 |
| PLINK |
Purcell et al. |
GWAS・集団解析 |
SNP data |
大規模データ対応 |
★★★ |
| EIGENSOFT |
Patterson et al. |
主成分分析 |
Population structure |
PCA-based |
★★ |
| ADMIXTURE |
Alexander et al. |
集団構造解析 |
Ancestry |
Model-based clustering |
★★ |
| STRUCTURE |
Pritchard et al. |
集団構造解析 |
Population structure |
Bayesian clustering |
★★ |
| Fst |
Various |
集団分化指数 |
Population differentiation |
統計指標 |
★★ |
H.5 構造生物学ツール
H.5.1 構造予測・解析
| ツール名 |
開発元 |
主な機能 |
手法 |
アクセス方法 |
学習優先度 |
| AlphaFold 3 / AlphaFold Server |
DeepMind |
タンパク質・複合体構造予測 |
Deep learning |
Web/Local |
★★★ |
| ColabFold |
Mirdita et al. |
高速構造予測 |
AlphaFold2-based |
Google Colab |
★★ |
| SWISS-MODEL |
Biozentrum |
ホモロジーモデリング |
Template-based |
Web server |
★★ |
| Modeller |
Webb & Sali |
ホモロジーモデリング |
Comparative modeling |
Python package |
★★ |
| I-TASSER |
Zhang Lab |
構造・機能予測 |
Threading + ab initio |
Web server |
★★ |
| ChimeraX |
UCSF |
分子可視化・解析 |
Interactive visualization |
Desktop app |
★★ |
| PyMOL |
Schrödinger |
分子可視化 |
3D visualization |
Desktop app |
★★ |
H.5.2 構造解析・評価
| ツール名 |
開発元 |
主な機能 |
評価指標 |
特徴 |
学習優先度 |
| RMSD計算 |
Various |
構造類似度評価 |
RMSD |
基本的構造比較 |
★★★ |
| ラマチャンドランプロット |
Various |
立体構造妥当性 |
φ-ψ angles |
構造品質評価 |
★★★ |
| MolProbity |
Richardson Lab |
構造検証 |
多様な指標 |
包括的構造評価 |
★★ |
| ProSA |
Sippl |
構造品質評価 |
Z-score |
エネルギープロファイル |
★ |
H.6 主要データベース
H.6.1 配列データベース
| データベース名 |
運営機関 |
主な内容 |
アクセッション形式 |
URL |
学習優先度 |
| GenBank |
NCBI |
塩基配列データベース |
GB_***** |
https://www.ncbi.nlm.nih.gov/genbank/ |
★★★ |
| EMBL |
EMBL-EBI |
欧州塩基配列DB |
EM_***** |
https://www.ebi.ac.uk/embl/ |
★★ |
| DDBJ |
NIG |
日本DNA配列DB |
DB_***** |
https://www.ddbj.nig.ac.jp/ |
★★★ |
| RefSeq |
NCBI |
参照配列DB |
NM_, NP_ etc. |
https://www.ncbi.nlm.nih.gov/refseq/ |
★★★ |
| UniProt |
UniProt Consortium |
タンパク質配列DB |
P**, Q** |
https://www.uniprot.org/ |
★★★ |
| Swiss-Prot |
SIB |
キュレーション済み蛋白質DB |
P**, Q** |
UniProt内 |
★★★ |
| TrEMBL |
EMBL-EBI |
自動注釈蛋白質DB |
A*****, etc. |
UniProt内 |
★★ |
H.6.2 ゲノムデータベース
| データベース名 |
運営機関 |
主な内容 |
特徴 |
URL |
学習優先度 |
| Ensembl |
EMBL-EBI |
ゲノムブラウザ・注釈 |
包括的ゲノム情報 |
https://www.ensembl.org/index.html?redirect=no |
★★★ |
| UCSC Genome Browser |
UCSC |
ゲノムブラウザ |
豊富なトラック |
https://genome.ucsc.edu/ |
★★★ |
| NCBI Genome |
NCBI |
ゲノム配列・注釈 |
RefSeq基準 |
https://www.ncbi.nlm.nih.gov/genome/ |
★★★ |
| 1000 Genomes |
国際コンソーシアム |
ヒト遺伝的変異 |
集団ゲノミクス |
https://www.internationalgenome.org/ |
★★ |
| gnomAD |
Broad Institute |
ヒト遺伝的変異頻度 |
大規模変異DB |
https://gnomad.broadinstitute.org/ |
★★ |
H.6.3 機能・パスウェイデータベース
| データベース名 |
運営機関 |
主な内容 |
特徴 |
URL |
学習優先度 |
| KEGG |
Kanehisa Labs |
代謝経路・遺伝子機能 |
パスウェイマップ |
https://www.kegg.jp/ |
★★★ |
| Gene Ontology |
GO Consortium |
遺伝子機能分類 |
階層的オントロジー |
http://geneontology.org/ |
★★★ |
| BioCyc |
SRI International |
代謝経路DB |
詳細な生化学情報 |
https://biocyc.org/ |
★★ |
| Reactome |
OICR/EBI |
パスウェイ注釈 |
反応レベル詳細 |
https://reactome.org/ |
★★ |
| WikiPathways |
Community |
パスウェイ情報 |
コミュニティ主導 |
https://www.wikipathways.org/ |
★ |
H.6.4 構造データベース
| データベース名 |
運営機関 |
主な内容 |
ファイル形式 |
URL |
学習優先度 |
| PDB |
wwPDB |
タンパク質立体構造 |
PDB/mmCIF |
https://www.wwpdb.org/ |
★★★ |
| PDBe |
EMBL-EBI |
欧州PDBサイト |
PDB/mmCIF |
https://www.ebi.ac.uk/pdbe/ |
★★ |
| PDBj |
Osaka Univ. |
日本PDBサイト |
PDB/mmCIF |
https://pdbj.org/ |
★★ |
| AlphaFold DB |
DeepMind/EMBL-EBI |
AI予測構造 |
PDB/mmCIF |
https://alphafold.ebi.ac.uk/ |
★★★ |
| SCOP |
MRC-LMB |
構造分類 |
階層分類 |
http://scop.mrc-lmb.cam.ac.uk/ |
★ |
| CATH |
UCL |
構造分類 |
階層分類 |
https://www.cathdb.info/ |
★ |
H.6.5 文献・情報データベース
| データベース名 |
運営機関 |
主な内容 |
検索機能 |
URL |
学習優先度 |
| PubMed |
NCBI |
生物医学文献 |
高度検索 |
https://pubmed.ncbi.nlm.nih.gov/ |
★★★ |
| PMC |
NCBI |
オープンアクセス文献 |
全文検索 |
https://www.ncbi.nlm.nih.gov/pmc/ |
★★ |
| Europe PMC |
EMBL-EBI |
欧州文献DB |
統合検索 |
https://europepmc.org/ |
★★ |
| Google Scholar |
Google |
学術文献検索 |
引用情報 |
https://scholar.google.com/ |
★★ |
H.6.6 臨床ゲノム・相互運用性標準
| 標準・DB名 |
主な用途 |
入力/対象 |
出力/確認すること |
URL |
学習優先度 |
| GA4GH VRS v2.0 |
variant representation |
HGVS、VCF、SPDI等で表される variant、参照配列 |
computed identifier、normalization、reference sequence、descriptive metadata。pathogenicity とは別 |
https://www.ga4gh.org/product/variation-representation/ |
★★ |
| GA4GH Beacon / Beacon v2 |
data discovery / federated query |
dataset、cohort、variant、phenotype、metadata query |
dataset の存在、問い合わせ先、data use condition。データ取得許可ではない |
https://www.ga4gh.org/product/beacon-api/ |
★★ |
| Beacon v2 documentation |
Beacon 実装仕様 |
Beacon framework / model、endpoint、response schema |
framework と data model、実装版、公開範囲、アクセス手順 |
https://docs.genomebeacons.org/ |
★ |
| HL7 FHIR Genomics Reporting IG |
clinical report / EHR-LIMS-CDSS連携 |
genomic observation、diagnostic report、molecular sequence |
structured genomic report、Observation / DiagnosticReport 関係。解析 workflow とは別 |
https://build.fhir.org/ig/HL7/genomics-reporting/ |
★★ |
| ClinVar classification |
germline / somatic classification の確認 |
submitted record、variant、condition、review status |
germline、somatic clinical impact、oncogenicity を分けて確認 |
https://www.ncbi.nlm.nih.gov/clinvar/docs/clinsig/ |
★★ |
| CPIC / ClinPGx |
pharmacogenomics implementation |
gene、drug、diplotype、phenotype、既存の検査結果 |
prescribing recommendation の確認。検査実施判断や最終処方判断とは別 |
https://www.clinpgx.org/cpic |
★★ |
| NBDCヒトデータベース / JGA |
controlled-access data access |
dataset ID、利用目的、利用者、所属機関、セキュリティレベル |
申請、承認期間、利用条件、監査ログ、外部サービス利用可否 |
https://humandbs.dbcls.jp/en/data-use |
★★ |
H.7 統計・機械学習ツール
H.7.1 統計解析環境
| ツール名 |
開発元 |
主な機能 |
特徴 |
学習コスト |
学習優先度 |
| R |
R Foundation |
統計解析・可視化 |
オープンソース |
中 |
★★★ |
| RStudio |
RStudio |
R統合開発環境 |
GUI環境 |
低 |
★★★ |
| Bioconductor |
Bioconductor Team |
バイオ統計パッケージ |
R専用パッケージ群 |
中 |
★★★ |
| Python |
Python Foundation |
汎用プログラミング |
豊富なライブラリ |
中 |
★★★ |
| NumPy |
NumPy team |
数値計算 |
Python基盤ライブラリ |
低 |
★★ |
| SciPy |
SciPy team |
科学計算 |
Python統計ライブラリ |
中 |
★★ |
| pandas |
pandas team |
データ操作 |
データフレーム操作 |
中 |
★★ |
H.7.2 機械学習ライブラリ
| ツール名 |
開発元 |
主な機能 |
対応アルゴリズム |
プラットフォーム |
学習優先度 |
| scikit-learn |
scikit-learn team |
機械学習 |
分類・回帰・クラスタリング |
Python |
★★★ |
| TensorFlow |
Google |
深層学習 |
ニューラルネットワーク |
Python/多言語 |
★★ |
| PyTorch |
Meta |
深層学習 |
ニューラルネットワーク |
Python |
★★ |
| Keras |
Keras team |
深層学習 |
高レベルNN API |
Python |
★★ |
| XGBoost |
XGBoost team |
勾配ブースティング |
決定木アンサンブル |
多言語対応 |
★★ |
| Random Forest |
Various |
ランダムフォレスト |
決定木アンサンブル |
R/Python |
★★ |
H.7.3 Foundation model 評価時に見るツール・モデル
この表は「最新モデル一覧」ではなく、評価時に入力、出力、baseline、training data overlap、ライセンス、臨床利用可否を確認するための入口である。モデル重み、API、利用条件は更新されるため、利用時点の確認日を manifest に残す。
| ツール名 |
区分 |
主な入力 |
主な出力 |
評価・ライセンス確認 |
URL |
学習優先度 |
| AlphaFold 3 / AlphaFold Server |
構造・複合体 |
配列、MSA/template、核酸、小分子、イオン、修飾 |
3D構造、pLDDT / PAE 等の信頼度 |
Web/API/ローカルの利用条件、非商用制約、対象外リガンド、臨床利用不可 |
https://github.com/google-deepmind/alphafold3 |
★★★ |
| Chai-1 |
構造・複合体 |
タンパク質、小分子、DNA/RNA、glycosylation、restraint |
3D構造、候補順位 |
Apache-2.0表記、入力制約、MSA/template/restraint、wet-lab検証 |
https://github.com/chaidiscovery/chai-lab |
★★ |
| Boltz |
構造・複合体 / affinity |
配列、ligand、complex、MSA |
3D構造、confidence、binding affinity関連出力 |
MIT表記、affinity出力の単位/教師データ、過信防止、実測値との比較 |
https://github.com/jwohlwend/boltz |
★★ |
| RoseTTAFold All-Atom |
構造・複合体 |
タンパク質、核酸、小分子、共有結合、金属 |
3D構造、pLDDT 等の信頼度 |
SignalP等の別ライセンス、モデル重み、入力config、confidence確認 |
https://github.com/baker-laboratory/RoseTTAFold-All-Atom |
★ |
| AlphaGenome |
ゲノム配列 |
DNA sequence、reference build、variant allele、context |
genome track、variant effect score |
API/非商用研究用途、臨床利用不可、入力長、training data overlap、既知DB比較 |
https://github.com/google-deepmind/alphagenome |
★★ |
| Evo 2 |
ゲノム配列 |
長文脈 DNA sequence、species/context |
variant score、embedding、生成/順位づけ配列 |
GPU/依存ライブラリ、モデルサイズ、生成配列の安全性・実験検証 |
https://github.com/arcinstitute/evo2 |
★ |
| Nucleotide Transformer |
ゲノム配列 |
DNA sequence、species、tokenization |
embedding、下流タスク特徴量 |
CC BY-NC-SA 4.0表記、モデル別documentation、対象species、baseline比較 |
https://github.com/instadeepai/nucleotide-transformer |
★ |
| scGPT |
single-cell |
expression matrix、gene vocabulary、batch/donor/tissue |
embedding、annotation、integration、perturbation response |
MIT表記、whole-human checkpoint、donor/tissue split、単純 baseline、外部検証 |
https://github.com/bowang-lab/scGPT |
★★ |
| Geneformer |
single-cell |
遺伝子順位、single-cell transcriptome、model version |
embedding、classification、in silico perturbation |
Apache-2.0表記、Genecorpus overlap、fine-tuning条件、GPU要件、臨床利用不可 |
https://huggingface.co/ctheodoris/Geneformer |
★ |
| Nicheformer |
single-cell / spatial |
発現行列、gene rank、assay/species/tissue、spatial context |
embedding、spatial label/composition prediction |
SpatialCorpus-110M overlap、technology split、PCA/scVI等との比較、空間文脈の外部検証 |
https://www.nature.com/articles/s41592-025-02814-z |
★ |
H.8 ワークフロー管理・再現性ツール
H.8.1 ワークフロー管理
| ツール名 |
開発元 |
主な機能 |
記述言語 |
特徴 |
学習優先度 |
| Nextflow |
Seqera Labs |
ワークフロー管理 |
Groovy-based DSL |
可搬性・拡張性 |
★★ |
| nf-core |
nf-core community |
Nextflow pipeline 標準・共有 |
Nextflow / template |
release、test data、lint、RO-Crate |
★★ |
| Snakemake |
Köster et al. |
ワークフロー管理 |
Python-based |
Make風文法 |
★★ |
| WDL |
Broad Institute |
ワークフロー記述言語 |
WDL |
Cromwell実行エンジン |
★★ |
| CWL |
Common Workflow Language |
標準ワークフロー言語 |
YAML/JSON |
ツール間互換性 |
★ |
| Galaxy |
Galaxy Team |
Web-based分析環境 |
GUI |
非プログラマ向け |
★★ |
H.8.2 コンテナ・仮想化
| ツール名 |
開発元 |
主な機能 |
特徴 |
用途 |
学習優先度 |
| Docker |
Docker Inc. |
コンテナ化 |
軽量仮想化 |
環境再現 |
★★ |
| Singularity |
Sylabs |
HPCコンテナ |
HPC特化 |
クラスタ環境 |
★★ |
| Conda |
Anaconda Inc. |
パッケージ管理 |
環境管理 |
Python/R環境 |
★★ |
| Bioconda |
Bioconda team |
バイオツール管理 |
Conda特化チャンネル |
バイオツール配布 |
★★ |
H.9 クラウド・分散処理ツール
H.9.1 クラウドプラットフォーム
| プラットフォーム名 |
提供企業 |
主なサービス |
バイオ特化機能 |
料金体系 |
学習優先度 |
| AWS |
Amazon |
EC2, S3, Lambda等 |
AWS Batch, HealthLake |
従量課金 |
★★ |
| Google Cloud |
Google |
Compute Engine, Cloud Storage等 |
Life Sciences API |
従量課金 |
★★ |
| Microsoft Azure |
Microsoft |
Virtual Machines, Blob Storage等 |
Genomics Service |
従量課金 |
★ |
| Terra |
Broad Institute |
ゲノム解析プラットフォーム |
FireCloud後継 |
使用量ベース |
★ |
H.9.2 分散処理フレームワーク
| ツール名 |
開発元 |
主な機能 |
適用分野 |
特徴 |
学習優先度 |
| Apache Spark |
Apache Foundation |
大規模データ処理 |
ビッグデータ解析 |
インメモリ処理 |
★ |
| Hadoop |
Apache Foundation |
分散ストレージ・処理 |
ビッグデータ |
MapReduce |
★ |
| Dask |
Dask team |
Python並列処理 |
科学計算 |
pandas/NumPy互換 |
★ |
H.10 品質管理・可視化ツール
H.10.1 品質評価
| ツール名 |
開発元 |
主な機能 |
対象データ |
出力形式 |
学習優先度 |
| FastQC |
Babraham Institute |
FASTQ品質評価 |
配列データ |
HTML報告書 |
★★★ |
| MultiQC |
Ewels et al. |
統合品質報告書 |
各種QCツール出力 |
HTML報告書 |
★★ |
| Qualimap |
García-Alcalde et al. |
マッピング品質評価 |
BAMファイル |
HTML/PDF報告書 |
★★ |
| RSeQC |
Wang et al. |
RNA-seq品質評価 |
RNA-seq data |
テキスト/図 |
★★ |
H.10.2 可視化ツール
| ツール名 |
開発元 |
主な機能 |
可視化対象 |
プラットフォーム |
学習優先度 |
| IGV |
Broad Institute |
ゲノムブラウザ |
ゲノムデータ |
Java application |
★★★ |
| UCSC Genome Browser |
UCSC |
ゲノムブラウザ |
ゲノムデータ |
Web browser |
★★★ |
| ggplot2 |
Wickham |
R可視化パッケージ |
統計グラフ |
R |
★★★ |
| matplotlib |
Hunter |
Python可視化 |
科学グラフ |
Python |
★★ |
| Circos |
Krzywinski et al. |
円形ゲノム図 |
ゲノム比較 |
Perl |
★★ |
| Cytoscape |
Cytoscape Consortium |
ネットワーク可視化 |
生物学的ネットワーク |
Java application |
★★ |
H.11 ファイル形式リファレンス
H.11.1 配列データ形式
| 形式名 |
拡張子 |
主な用途 |
特徴 |
例 |
学習優先度 |
| FASTA |
.fa, .fasta, .fas |
配列保存 |
シンプルなテキスト形式 |
>header ATCG |
★★★ |
| FASTQ |
.fq, .fastq |
品質スコア付き配列 |
シークエンシングraw data |
@header ATCG + #### |
★★★ |
| SAM |
.sam |
アライメント結果 |
テキスト形式 |
Header + alignment records |
★★★ |
| BAM |
.bam |
アライメント結果 |
SAMのバイナリ版 |
圧縮されたSAM |
★★★ |
| CRAM |
.cram |
高圧縮アライメント |
参照配列ベース圧縮 |
BAMの高圧縮版 |
★★ |
H.11.2 変異・注釈データ形式
| 形式名 |
拡張子 |
主な用途 |
特徴 |
使用ツール例 |
学習優先度 |
| VCF |
.vcf |
変異データ |
Variant Call Format |
GATK, bcftools |
★★★ |
| BCF |
.bcf |
変異データ |
VCFのバイナリ版 |
BCFtools |
★★ |
| BED |
.bed |
ゲノム領域 |
座標ベース領域指定 |
BEDtools |
★★★ |
| GTF |
.gtf |
遺伝子注釈 |
Gene Transfer Format |
RNA-seq解析 |
★★★ |
| GFF |
.gff |
遺伝子注釈 |
General Feature Format |
ゲノム注釈 |
★★ |
H.11.3 構造データ形式
| 形式名 |
拡張子 |
主な用途 |
特徴 |
対応ソフト |
学習優先度 |
| PDB |
.pdb |
タンパク質構造 |
Protein Data Bank形式 |
PyMOL, ChimeraX |
★★★ |
| mmCIF |
.cif |
タンパク質構造 |
PDBの後継形式 |
構造解析ソフト |
★★ |
| MOL |
.mol |
化学構造 |
MDL Molfile |
化学ソフト |
★ |
| SDF |
.sdf |
化学構造データベース |
Structure Data File |
化学DB |
★ |
この節は 2026-07-17 JST に公式仕様・配布元を確認した選定入口です。特定のtoolを唯一の標準とはせず、実行時はreleaseまたはcommit、container digest、依存するvendor reader / database / library、parameter、利用条件を解析manifestへ固定してください。
| 標準 |
確認した版 |
主な責務 |
記録すること |
公式情報 |
| mzML |
1.1.0 stable |
spectrum / chromatogramと装置・取得metadata |
converter、CV、profile / centroid、filter、compression、checksum |
https://www.psidev.info/mzml |
| mzIdentML |
1.3.0 current(2024-06 release) |
peptide / protein identification結果と検索条件 |
search DB、score、threshold、protein grouping、schema |
https://www.psidev.info/mzidentml |
| mzTab |
1.0 final |
proteomics identification / quantificationのtabular summary |
section、unit、missing value、元結果との対応 |
https://www.psidev.info/mztab-specifications |
| mzTab-M |
2.0 final |
small-molecule identification / quantificationのtabular summary |
2.1 draftと区別、feature / evidence / study variableの対応 |
https://www.psidev.info/mztab-specifications |
| mzQC |
1.0.0 final(2024-02-21 release) |
MS QC metricのreport、handover、archive |
metric CV、対象run、software、計算条件 |
https://www.psidev.info/mzqc |
| ProForma |
2.1 final(2026-06-09 release) |
peptidoform / proteoformと修飾の機械可読表記 |
notation version、修飾CV、曖昧なlocalization |
https://www.psidev.info/proforma |
| SDRF-Proteomics |
PSI specification。source文書とGitHub releaseの版表示は利用時に照合 |
sample特性とdata fileの関係 |
採用revision、sample-to-file、label、fraction、instrument。FDR等のdownstream条件は別管理 |
https://www.psidev.info/sdrf-sample-data-relationship-format |
PSIのion mobility / DIA向けmzML best practiceは2026-06-29更新の提案文書であり、PSI Document Processによるfinal specificationとしては扱いません。schemaで表現できること、toolが正しく出力すること、解析上の情報が欠落しないことは別々に検証します。
| tool |
主な用途 |
OS / 配布 |
主な入力 → 出力 |
license / 利用条件の確認点 |
再現性・citation記録 |
| ProteoWizard / msconvert |
vendor raw / open format変換、filter |
Windows native。source buildやvendor-license同意containerもある |
vendor raw / mzML等 → mzML等 |
sourceはApache-2.0。vendor DLLとcontainer利用条件を別に確認 |
build、citation、vendor reader、filter、profile / centroid、checksum |
| OpenMS |
LC-MS data processing、identification / quantification workflow |
Windows / macOS / Linux、公式container |
mzML、FASTA等 → feature / identification / quantification |
BSD-3-Clause。連携tool・DBの条件は別 |
release、citation、TOPP tool、INI、workflow、container digest |
| FragPipe / MSFragger |
DDA / DIA proteomics search・定量を統合 |
Windows / Linux、Docker配布あり |
spectrum、FASTA / library → PSM・peptide・protein・quant |
suite内componentごとにacademic / non-commercial / commercial条件が異なる。MSFraggerをopen sourceと表現しない |
FragPipeと各component版・citation、workflow、FASTA、decoy、parameter |
| DIA-NN |
DIA / library-free・library-based解析、prediction |
Windows / Linux |
DIA data、FASTA / library → precursor / protein quant |
academia向けとenterprise条件を利用時点で確認 |
release channel / build、citation、library生成元、FASTA、prediction、FDR strategy、CLI |
| MaxQuant |
DDA / DIA identification・定量 |
Windows / Linux |
vendor raw等、FASTA → evidence / peptide / protein groups |
freewareの独自licenseで、open sourceとは扱わない |
release、citation、mqpar、FASTA、contaminant、match-between-runs、raw checksum |
公式入口(確認日: 2026-07-17 JST): ProteoWizard msconvert、ProteoWizard license、OpenMS、FragPipe releases、MSFragger、DIA-NN、MaxQuant。
| tool |
主な用途 |
OS / 配布 |
主な入力 → 出力 |
license / 利用条件の確認点 |
再現性・citation記録 |
| MZmine |
LC/GC-MS feature detection、alignment、annotation、QC補正 |
Windows / macOS / Linux |
mzML等 → feature list / matrix / annotation |
source codeはMIT。配布版・accountのtrial / non-profit academic等のuser licenseと外部library / DBは別途確認 |
release、citation、batch file、metadata、blank / QC / normalization、library |
| XCMS |
LC/GC-MS前処理、peak detection、alignment、grouping |
R / Bioconductor |
mzML等 → feature definitions / matrix |
GPL-2以降およびpackageのLICENSEを確認 |
R / Bioconductor release、citation、parameter object、sample metadata、session info |
| MS-DIAL |
LC-MS / GC-MS / ion mobility等のdeconvolution、alignment、annotation |
Windows GUI、Linux console配布 |
vendor / open data → peak / alignment / annotation |
source LGPLv3、assembly CC BY 4.0との公式記載。component別条件を確認 |
release、citation、project / parameter、library、sample type、batch、analytical order |
| OpenMS |
feature detection、alignment、metabolite annotation workflow |
Windows / macOS / Linux、公式container |
mzML等 → featureXML / consensusXML / tables |
BSD-3-Clause。連携tool・DBは別 |
release、citation、TOPP / workflow、parameter、library / DB、container digest |
QCと利用条件の公式入口(確認日: 2026-07-17 JST): MZmine source、MZmine user / license、MZmine blank subtraction、MZmine intensity normalizer、MZmine project metadata、XCMS、MS-DIAL 5 tutorial、MS-DIAL repository。
H.12.4 Repositoryとaccession
| repository / service |
主対象 |
識別子・成果物 |
再利用時の確認点 |
公式情報 |
| ProteomeXchange / PRIDE |
MS-based proteomics |
PXD accession、raw、open format、result、sample metadata |
complete / partial submission、file category、SDRF、checksum、processing protocol、公開状態 |
https://www.proteomexchange.org/docs/guidelines_px.pdf / https://www.ebi.ac.uk/pride/ |
| MetaboLights |
MS / NMR metabolomics |
MTBLS accession、ISA-Tab、raw / derived data |
sample / assay metadata、file link、公開版、license / data use、取得日 |
https://www.ebi.ac.uk/metabolights/help |
| GNPS / MassIVE |
MS/MS解析・libraryとdataset共有 |
GNPS task URL、library spectrum、MSV accession |
task、library entry、MassIVE datasetを同一視しない。raw / peak list / metadata / supplementaryを区別 |
https://ccms-ucsd.github.io/GNPSDocumentation/ / https://ccms-ucsd.github.io/GNPSDocumentation/datasets/ |
accessionだけでは入力fileと解析結果の対応を確定できません。landing page、file list、checksum、sample metadata、processing protocol、公開日・取得日、関連publication、license / data useをまとめたmanifestを作成します。
学習・活用ガイド
理解確認での活用法
- 学習優先度★★★のツール: 名前と基本機能を押さえておく
- 学習優先度★★のツール: 概要と使い分けを理解する
- 学習優先度★のツール: 存在を知っておく程度
実践研究での活用法
- 目的別ツール選択: 解析目的に応じた最適ツールの選択
- ワークフロー設計: 複数ツールを組み合わせた解析パイプライン構築
- 品質管理: 各ステップでの品質評価とトラブルシューティング
継続学習のポイント
- 公式ドキュメント: 各ツールの公式ドキュメントを参照
- コミュニティ: バイオインフォマティクスコミュニティでの情報交換
- アップデート: ツールの新版リリース情報を定期チェック
このリファレンスは、バイオインフォマティクス分野の急速な発展に合わせて定期的に更新される予定です。最新情報については、各ツール・データベースの公式サイトを確認してください。