第14章: ケーススタディ
この章を読む理由
第14章は、前章までに学んだ解析・機械学習・DB・臨床応用の観点を、 実在のケースで統合して判断する章です。 個別のツール知識よりも、目的、入力、制約、成果物、説明責任をどう結び付けるかを確認します。
本章で使う共通題材
- 題材A: SARS-CoV-2 公開データ
SRR11140744/MN908947.3- 変異追跡と監視系設計の最小例として使います。
- 題材B: TCGA-LUAD 研究用ミニケース
TCGA-LUAD- 発現行列・変異情報・臨床メタデータを統合し、研究支援から臨床連携へ渡す境界を確認します。
- 題材C: 病原体ゲノミクス / メタゲノム公開データ設計
- Nextclade / Nextstrain、AMRFinderPlus、GTDB / GTDB-Tk / MetaPhlAn 4 の適用範囲を比較します。
- 公開データまたは合成データだけを使い、metadata 公開リスクと利用条件を確認します。
学習目標
- 各ケースの背景、目的、入力、制約、評価軸を説明できる
- コスト、データ規模、規制、再現性の観点で代替設計を比較できる
- 実務へ適用する際に、何を自動化し、何を人手判断へ残すべきか整理できる
- 病原体ゲノミクス、AMR、メタゲノム解析のツール適用範囲と公開 metadata の注意点を説明できる
前提知識
- 第4章の sequencing workflow / ワークフロー、reference accession / version、QC、variant calling、annotation、研究・公式判断の境界。SARS-CoV-2 の例では
SRR11140744/MN908947.3を教材として扱い、実際の公衆衛生判断は専門機関の評価に委ねること。 - 第5章〜第9章の発現、multi-omics、machine learning、single-cell / spatial、GWAS / PRS の入力・出力・評価指標・限界。各ケースで、どの章の前提を使っているかを明示できること。
- 第10章の accession、version、checksum、API / DB release、license / terms、cache、provenance、data mart の記録方法。ケーススタディでも、データ取得日と再現条件を省略しないこと。
- 第11章・第12章の個人情報、研究倫理、データアクセス、臨床実装、専門家レビュー、EHR / LIMS / CDSS、法務・施設規程の境界。公開研究データでも再配布・二次利用・臨床転用は自動的に許されない。
- 第13章の research question、study design、DMP、FAIR、data / code availability、positive / negative control、limitations の書き方。ケースは「動いた手順」ではなく「判断可能な証跡」として読むこと。
- それぞれのケースで、背景、目的、データ、ワークフロー、判断ポイント、失敗例、結果の読み方、限界、倫理・法務・ライセンス注意、次に学ぶことを分けて整理すること。
- 本章のコード断片は概念例であり、感染症対策、臨床診断、治療選択、創薬上の有効性、安全性、商用利用可能性を保証しないこと。
14.1 COVID-19変異株解析
背景と目的: 2020年以降、SARS-CoV-2の変異株追跡が公衆衛生上の重要課題となった。リアルタイムでの変異検出と伝播パターンの解析が求められた。
実装アプローチ: この概念例は監視系の処理境界を示す簡略コードで、実データ取得、品質管理、lineage assignment tool、監査ログ、当局報告手順は省略しています。 🧪 概念例
class COVID19VariantTracker:
"""COVID-19変異株追跡システム"""
def __init__(self):
self.reference_genome = self.load_reference()
self.variant_database = {}
def analyze_new_sequence(self, sequence_data):
"""新規配列の変異解析"""
# アライメント
alignment = self.align_to_reference(sequence_data)
# 変異検出
mutations = self.call_mutations(alignment)
# 既知変異株との比較
lineage = self.assign_lineage(mutations)
# 新規変異の評価
novel_mutations = self.identify_novel_mutations(mutations)
return {
'lineage': lineage,
'mutations': mutations,
'novel_mutations': novel_mutations
}
def track_mutation_dynamics(self, time_series_data):
"""変異の時間的ダイナミクス追跡"""
mutation_frequencies = {}
for timepoint in time_series_data:
for mutation in timepoint['mutations']:
if mutation not in mutation_frequencies:
mutation_frequencies[mutation] = []
freq = timepoint['frequency']
mutation_frequencies[mutation].append(
(timepoint['date'], freq)
)
return mutation_frequencies
成果物と利用上の境界:
- 配列、変異、lineage、時系列頻度を同じ形式で記録し、監視系の更新・監査・説明資料に使える候補表を作る
- 共有データや専門機関の評価と照合し、研究・監視上の仮説や追加確認事項を整理する
- ワクチン開発、公衆衛生政策、リスク評価の最終判断は、本書の解析例だけでは行わず、疫学・実験・臨床・行政の別証拠と専門家レビューに委ねる
14.2 公開データで行う病原体ゲノミクスとメタゲノム解析の入口
背景と目的: 病原体ゲノミクスとメタゲノム解析は、感染症監視、食品・環境モニタリング、microbiome 研究、AMR / antimicrobial resistance の仮説生成で重要になります。このケースでは、SARS-CoV-2 の公開データで viral genome の流れを確認し、細菌 genome / assembly の AMR 確認、shotgun metagenome の分類プロファイルを別の目的として整理します。教材では公開データまたは合成データだけを使い、感染症対策、診断、治療、行政報告の最終判断は専門機関・所属機関の手順に委ねます。
データとツールの適用範囲:
| 対象 | 入力の例 | 代表ツール | 主な出力 | 混同しない点 |
|---|---|---|---|---|
| Viral genome surveillance | SARS-CoV-2 の FASTQ、または公開済み consensus FASTA | FASTQ QC、reference mapping / consensus、Nextclade、Nextstrain | clade / lineage、mutation、QC、phylogenetic placement、tree と metadata | Nextclade / Nextstrain は viral genome 解析・可視化の導線であり、感染経路や公衆衛生判断を単独で証明しない |
| Bacterial genome / AMR | 細菌 isolate の assembly FASTA、protein annotation | AMRFinderPlus | AMR gene、resistance-associated point mutation、selected stress / virulence gene | AMR gene の存在は、薬剤感受性試験の phenotype や治療方針をそのまま保証しない |
| Microbiome / shotgun metagenome | 公開または合成 shotgun reads、MAG / isolate genome | MetaPhlAn 4、GTDB、GTDB-Tk | species-level microbial profile、genome taxonomy、分類根拠 | MetaPhlAn は read からの community profiling、GTDB-Tk は genome の taxonomy assignment が主用途である |
最小ワークフロー:
- 入力を
viral_consensus、bacterial_assembly、shotgun_metagenomeに分け、sample ID、host/environment、collection date の公開可否を確認する。 - FASTQ を使う場合は QC、adapter / primer 除去、coverage、contamination の確認を行う。教材では小さな公開データか合成データで手順だけを確認する。
- SARS-CoV-2 などの viral genome では、reference accession、consensus sequence 作成手順、ambiguous base、coverage threshold、excluded region を manifest に残す。公開済み FASTA を使う場合も、取得元、version、checksum、取得日を残す。
- Nextclade で clade assignment、mutation calling、QC、phylogenetic placement を確認する。Nextclade dataset / version、input FASTA、出力 TSV / JSON、QC flag を保存する。1
- Nextstrain / Auspice 形式で tree と metadata を可視化する場合は、metadata schema、日付粒度、地域粒度、配色に使う列、非公開にする列を先に決める。2
- 細菌 genome / assembly では AMRFinderPlus を使う候補を別小節として扱い、SARS-CoV-2 consensus へ誤適用しない。AMRFinderPlus version、database version、organism option、protein/nucleotide 入力、AMR / stress / virulence のどの列を見たかを記録する。3
- Microbiome では、MetaPhlAn 4 は metagenomic shotgun reads からの species-level profiling、GTDB / GTDB-Tk は bacterial / archaeal genome の taxonomy assignment として扱い、database release、marker / reference DB、read filtering、relative abundance の解釈範囲を残す。456
判断ポイント:
| 観点 | 安全側の読み方 | 追加で必要な確認 |
|---|---|---|
| 系統樹上の近さ | 近い配列は共通祖先やサンプリングの近さを示す候補であり、感染経路の証明ではない | 採取日、接触歴、地理、サンプリング密度、疫学調査、再解析条件 |
| AMR gene / point mutation | 耐性 phenotype の候補を示す遺伝子・変異情報として扱う | 薬剤感受性試験、対象菌種、発現、breakpoint、検査室手順、臨床文脈 |
| Microbiome profile | community composition の仮説生成として扱う | host / environment、DNA抽出、library、read depth、contamination、database release、batch effect |
| メタデータ公開 | sample collection site / date / host attribute は公衆衛生・再識別・風評リスクを持つ | 日付・地域の粒度、患者属性の削除、利用条件、GISAID / INSDC / NCBI 等の規約、国・機関の報告義務7 |
成果物テンプレート:
source_dataset: accession、DB、取得日、利用条件、公開範囲。input_manifest: FASTQ / FASTA / assembly / metadata の checksum、file size、reference accession、database release。analysis_run: tool、version、container digest、command、dataset / DB version、parameters、実行者、実行日時。result_summary: Nextclade QC、clade / lineage、主要 mutation、tree metadata、AMRFinderPlus hit、MetaPhlAn profile、GTDB-Tk classification。responsibility_boundary: 教材・研究・監視・臨床・行政報告のどれに使うか、使わないか、次に確認する専門家・機関。
失敗例:
- SARS-CoV-2 の consensus FASTA に AMRFinderPlus をかけ、出力がないことを「AMRがない」と説明する。
- 系統樹で隣接したサンプルを、疫学情報なしに「直接感染」と説明する。
- AMR gene の検出を、薬剤感受性 phenotype、処方、感染対策の最終判断として扱う。
- collection site、collection date、host attribute を細かく公開し、患者・施設・地域の再識別や風評リスクを増やす。
- MetaPhlAn の relative abundance を、絶対菌量や臨床診断として読む。
次に学ぶこと: 第4章で FASTQ QC / consensus sequence / variant calling、第9章で系統推定の前提、第10章で DB/API release と metadata 管理、第11章で privacy / access control、第13章で study design と limitations の書き方へ戻ります。
14.3 大規模がんゲノムプロジェクト
The Cancer Genome Atlas (TCGA)解析: この概念例は公開研究データの統合解析設計を示す簡略コードで、データ利用条件、前処理、統計モデル、臨床判断への接続は省略しています。 🧪 概念例
class TCGAAnalyzer:
"""TCGAデータの統合解析"""
def __init__(self, cancer_type):
self.cancer_type = cancer_type
self.load_multiomics_data()
def integrated_analysis(self):
"""マルチオミクス統合解析"""
# 体細胞変異
mutations = self.analyze_mutations()
# コピー数変異
cnv = self.analyze_copy_number()
# 遺伝子発現
expression = self.analyze_expression()
# メチル化
methylation = self.analyze_methylation()
# 統合クラスタリング
subtypes = self.consensus_clustering([
mutations, cnv, expression, methylation
])
return subtypes
def survival_analysis(self, subtypes, clinical_data):
"""サブタイプ別の生存解析"""
from lifelines import KaplanMeierFitter
results = {}
for subtype in subtypes.unique():
mask = subtypes == subtype
kmf = KaplanMeierFitter()
kmf.fit(
clinical_data[mask]['survival_time'],
clinical_data[mask]['event']
)
results[subtype] = {
'median_survival': kmf.median_survival_time_,
'survival_function': kmf.survival_function_
}
return results
研究上の読み方:
- 統合クラスタリングは、既報サブタイプや外部コホートと照合するための仮説生成として扱う
- 生存解析や発現差は、予後予測バイオマーカー候補の優先順位づけであり、単独で臨床有用性を示さない
- 治療標的候補は、機能検証、薬剤感受性、evidence level、専門家レビューを経て評価する
14.4 日本人基準ゲノム構築
プロジェクト概要: 日本人集団に特有の遺伝的多様性を反映した高精度な基準ゲノム配列の構築。
このケースでは、GRCh38、T2T-CHM13、pangenome / パンゲノムを競合する「どれか1つの正解」としてではなく、解析目的ごとに選択・記録する参照層として扱います。短鎖リードや既存DBとの互換性ではGRCh38、未解決領域や完全性の確認ではT2T-CHM13、集団差・reference bias・構造多型の説明ではpangenome / graph reference を検討し、reference_version、accession、checksum、liftover/remap の有無、確認日を成果物に残します。
技術的アプローチ: この概念例は集団参照・pangenome の設計観点を示す簡略コードで、個人データ利用、同意、アセンブリ検証、臨床報告は省略しています。 🧪 概念例
class JapaneseReferenceGenome:
"""日本人基準ゲノム構築"""
def __init__(self):
self.samples = []
self.assembly = None
def construct_pangenome(self, population_samples):
"""パンゲノムの構築"""
# 各個体のde novoアセンブリ
assemblies = []
for sample in population_samples:
assembly = self.perform_hifi_assembly(sample)
assemblies.append(assembly)
# グラフゲノムの構築
graph_genome = self.build_graph_genome(assemblies)
# 日本人特異的変異の同定
jp_specific = self.identify_population_specific_variants(
graph_genome
)
return graph_genome, jp_specific
def evaluate_research_sample(self, research_sample_genome):
"""研究用途の参照選択・頻度注釈候補を整理"""
# 日本人集団参照へのマッピング条件を評価
alignment_summary = self.evaluate_alignment_to_jp_reference(
research_sample_genome
)
# 研究用のvariant候補を抽出
candidate_variants = self.collect_candidate_variants(
alignment_summary
)
# 集団頻度を添えて、専門家レビュー前の候補表を作る
annotated_candidates = self.annotate_population_frequency(
candidate_variants
)
return annotated_candidates
インパクト:
- 日本人集団で見落としやすいvariant候補探索の補助
- 薬理ゲノミクス研究や集団頻度注釈の基盤整備
- 参照ゲノム選択と集団差に関する説明責任の向上
14.5 AI支援解析ケース: 構造予測・創薬・ゲノムモデル
背景: AI を使うケーススタディでは、構造予測、化合物生成、variant effect prediction、ゲノム foundation model を同じ「AI創薬」という言葉でまとめすぎると、入力、出力、検証方法、利用条件を誤解しやすくなります。このケースでは、AlphaFold 3 / AlphaFold DB、AlphaMissense、AlphaGenome、Evo 2、Nucleotide Transformer、scGPT を、研究用途の仮説生成・候補優先順位づけ・説明資料作成の道具として扱います。
目的:
- 標的タンパク質、変異、発現・single-cell情報、ゲノム配列候補を、同じ評価表で比較できる形に整理する。
- 予測モデルの出力を、薬効・安全性・臨床有用性の証明ではなく、次の実験・専門家レビューに渡す入力として扱う。
- モデルカード、データカード、利用条件、version、乱数、入力配列、参照DB release を記録する。
データ:
- 標的候補: 遺伝子名、isoform、UniProt/RefSeq/Ensembl ID、関連文献、疾患との関係。
- 構造情報: AlphaFold DB の予測構造、AlphaFold 3 / AlphaFold Server 等の複合体予測、実験構造がある場合は PDB ID。
- 変異・配列情報: AlphaMissense、AlphaGenome、Evo 2、Nucleotide Transformer 等の予測対象となる配列・variant・genomic interval。
- 細胞文脈: scGPT などで扱う single-cell / multi-omics の細胞型、batch、組織、前処理条件。
ワークフロー:
- 問いを「結合部位探索」「variant の優先順位づけ」「ゲノム配列設計案の評価」「細胞状態の注釈支援」のいずれかに分ける。
- 入力データの accession、version、参照配列、前処理、利用条件を固定する。
- モデルごとに、入力、出力、confidence、適用外条件、非商用・研究用途などの制約を記録する。
- 予測結果を同じ表に統合し、実験検証、毒性評価、薬事・知財・ライセンス確認へ渡す候補を絞る。
- 最終判断は wet 実験、専門家レビュー、施設の品質管理、規制・契約確認に委ねる。
判断ポイント:
- AlphaFold 3 / AlphaFold DB は構造仮説を与えるが、結合、活性、毒性、臨床効果を直接証明しない。
- AlphaGenome / Evo 2 / Nucleotide Transformer は配列・variant・設計案の探索支援であり、個人ゲノムの臨床判断や安全性保証には使わない。
- scGPT は single-cell 文脈の注釈・統合・仮説生成を支援するが、batch、組織、前処理、細胞型定義に依存する。
- AlphaMissense などの variant effect prediction は優先順位づけの補助であり、臨床分類にはガイドライン、専門家レビュー、検証済みDBが必要になる。
失敗例:
- 予測 confidence が高い構造を、阻害活性や薬効の証拠として扱う。
- 非商用・研究用途のモデルやAPI出力を、商用提案書や臨床報告にそのまま転用する。
- ゲノム foundation model の生成配列を、安全性・機能性が実証済みの設計案として扱う。
- single-cell model の cell type annotation を、マーカー確認やサンプル由来の検証なしに確定ラベルとして扱う。
結果の読み方: 候補ごとに、入力データ、モデル名、model/version、出力指標、confidence、根拠リンク、適用外条件、次の検証を表で残します。順位は「次に調べる順番」であり、「有効性が高い順」ではありません。
限界: 予測モデルは、学習データ、参照DB、配列長、対象分子、組織・細胞型、実験条件に依存します。未知の化合物、希少variant、非標準的な細胞状態、生成配列では、外挿の危険が大きくなります。
倫理・法務・ライセンス注意: 個人ゲノムや医療データを使わず、公開・匿名化・利用許諾が確認できる研究データに限定します。非商用API、model weight terms、DB利用規約、CC BY-NC-SA 4.0 の扱いを記録し、商用利用可能性を本書だけで保証しません。
次に学ぶこと: 第7章で model evaluation / leakage / foundation model の限界、第10章で accession・version・provenance、第12章で臨床ゲノムの責任境界、第13章で再現性と研究デザインを確認します。
2026年時点のAI / foundation model導線(確認日: 2026-05-13 JST):
- AlphaFold 3 / AlphaFold DB は、構造仮説と複合体予測の導線として扱い、利用条件、DB release、旧版取得方法、API field変更予定を記録する。
- AlphaGenome、Evo 2、Nucleotide Transformer、scGPT、AlphaMissense は、研究用途の候補評価・仮説生成・注釈支援として位置づけ、直接の臨床判断や個人ゲノム予測の根拠にはしない。
- 構造予測、化合物生成、ADMET予測、ゲノム foundation model、single-cell foundation model は入力・出力・検証単位が異なるため、同じ「AI」ラベルで混同しない。
🧪 概念例
class AIAssistedCandidateReview:
"""AI支援解析ケースの候補レビュー概念例"""
def __init__(self):
self.molecular_generator = self.build_generator()
self.activity_predictor = self.build_predictor()
def prioritize_candidates(self, target_protein, variant_context):
"""実験検証へ渡す候補の優先順位づけ"""
# 標的タンパク質の構造仮説と variant context を分けて記録する
binding_site = self.analyze_binding_site(target_protein)
variant_notes = self.summarize_variant_context(variant_context)
candidates = []
for _ in range(10000):
molecule = self.molecular_generator.generate()
docking_score = self.perform_docking(molecule, binding_site)
admet = self.predict_admet_properties(molecule)
if self.passes_research_filters(docking_score, admet, variant_notes):
candidates.append(molecule)
return self.rank_for_experimental_follow_up(candidates)
成果:
- 探索範囲の絞り込みや優先順位づけの効率化(ケースによる)
- 実験検証へ進める候補を説明可能な基準で整理できる場合がある
- 予測結果は薬効・安全性・臨床有用性の証明ではなく、追加検証の入力として扱う
まとめ
- ケーススタディの価値は、手法を列挙することではなく、目的に応じて入力、評価軸、制約を切り替える点にあります。
SRR11140744は最小パイプラインと viral surveillance 設計の例、病原体ゲノミクス / メタゲノム題材は AMR・分類・公開 metadata の境界を考える例、TCGA-LUADは研究支援と臨床連携の境界を考える例として有効です。- 本書を読み終えた後は、付録F/J/K を使って、自分の関心領域に近い題材へ横展開してください。
Source notes / 次の一歩
- 付録F: 第14章の次の一歩
- 2026年版出典監査メモ: 第14章の関連更新(AlphaFold 3 / AlphaFold DB / AlphaGenome / Evo 2 / Nucleotide Transformer / scGPT / AlphaMissense、Nextclade / Nextstrain、AMRFinderPlus、GTDB / GTDB-Tk、MetaPhlAn 4 の公式情報と確認日)
- 付録J: 実在アクセッション一覧
- 付録K: 用語集
本書の締めとして意識したいこと
実務では、1 つの手法を覚えるよりも、 「この題材ならどのデータを使い、どこまで自動化し、誰に確認を渡すか」を説明できることが重要です。 付録の補助資料を使いながら、題材ごとの判断メモを残してください。
最小入出力(期待成果物/期待ログ)
- 入力: 公開データ(アクセッション/出典)と参照データ(ゲノム/注釈)、解析目的(何を比較/検出するか)
- 出力(期待成果物): 再現レポート(手順・結果要約・図表)と、意思決定メモ(ツール/パラメータ選定理由、責任境界、追加検証条件)
- 期待ログ(例): 実行コマンド・バージョン・主要指標(QC/統計)、入力snapshot、正常終了、未検証の仮定が分かるログ
| 前へ: 研究手法 | 目次 | 付録A |
演習
SRR11140744とTCGA-LUADのどちらかを選び、目的、入力、評価軸、制約、成果物を 1 ページで整理せよ。- COVID-19 監視系、病原体ゲノミクス / メタゲノム、がんゲノム研究支援、日本人基準ゲノム、AI 創薬の 5 ケースについて、 データ規模、説明責任、規制、更新頻度の観点で比較表を作成せよ。
- 自動化すべき処理と、人手レビューを残すべき処理を切り分け、その理由を述べよ。
具体課題例
SRR11140744を題材に、第4章の最小パイプライン、Nextclade / Nextstrain の viral genome 解析、第10章の保存設計までを 1 つのメモにまとめる。- 細菌 assembly と shotgun metagenome の公開データ候補を選び、AMRFinderPlus、GTDB-Tk、MetaPhlAn 4 のどれを使うかを適用範囲ごとに説明する。
TCGA-LUADを題材に、第7章のモデル評価、第10章のデータマート、第12章のレポート候補作成をつなげて説明する。- 現場導入前に必要な確認事項(同意、監査、コスト、再現性、追加検証、専門家レビュー)をチェックリスト化する。
-
Nextstrain, Nextclade documentation(参照日: 2026-06-05 JST) ↩
-
Nextstrain, Nextstrain documentation(参照日: 2026-06-05 JST) ↩
-
NCBI Pathogen Detection, AMRFinderPlus(参照日: 2026-06-05 JST) ↩
-
Genome Taxonomy Database, GTDB and R232 statistics(参照日: 2026-06-05 JST) ↩
-
Ecogenomics, GTDB-Tk repository(参照日: 2026-06-05 JST) ↩
-
Blanco-Míguez et al., Extending and improving metagenomic taxonomic profiling with uncharacterized species using MetaPhlAn 4; bioBakery, MetaPhlAn repository(参照日: 2026-06-05 JST) ↩
-
GISAID, Terms of Use; INSDC, About / policy principles; NCBI, Website and Data Usage Policies and Disclaimers(参照日: 2026-06-05 JST) ↩