第6章: エピゲノム・マルチオミクス解析
6. エピゲノム・マルチオミクス解析
学習目標
- エピゲノム・マルチオミクス解析の入力、出力、QC、統合手順を説明できる
- 質量分析 proteomics / metabolomics について、vendor raw から標準形式、同定・定量、公開 repository までの data contract を設計できる
- PSM / peptide / protein と metabolite feature / compound annotation の confidence を区別し、FDR、missingness、batch、library version を記録できる
- omics layer 間の ID 対応、batch、欠測、正規化、来歴管理の確認点を挙げられる
- 統合解析結果を研究上の仮説生成として読み、臨床判断へ直結させない理由を説明できる
なぜ IT 技術者に必要か
エピゲノム・マルチオミクス解析では、FASTQ、peak、methylation table、mass spectrum、feature table、quantitative matrix、clinical metadata など、粒度と前処理条件が異なるデータを結合します。質量分析では、同じ vendor raw からでも centroiding、検索DB、spectral library、FDR、feature grouping の条件によって結果が変わります。IT 技術者がこの章の前提を理解していると、サンプル ID の対応、データ利用条件、QC、バッチ補正、ファイル形式、解析ログ、成果物の再現性を設計段階で整理できます。
この章では、個々の解析手法を網羅することよりも、入力と出力の対応、統合前の正規化、来歴管理、研究・臨床解釈の限界を説明できることを重視します。
前提知識
- FASTQ、BAM/CRAM、BED、bigWig、methylation table、count matrix、sample metadata の役割を区別できること。
- 質量分析の詳細な装置原理は前提としないが、spectrum の
m/z、intensity、retention time と、raw data / identification / quantification が別の成果物であること。 - 第2章の実行環境、ストレージ I/O、ログ記録、workflow manager、container の基本。
- 第4章の reference genome、coordinate system、annotation version、checksum の考え方。
- 第5章の RNA-seq count / TPM / DE 解析と、第13章の study design、batch、FDR、交絡の基本。
基本概念
- omics layer: ATAC-seq / ChIP-seq / methylation / RNA-seq / proteomics / metabolomics は、測定対象、単位、ノイズ、欠測、前処理が異なる。
- 質量分析の成果物階層: vendor raw、open spectrum、PSMまたはfeature、annotation、quantitative matrixは相互に代替できない。変換・filtering前後を別成果物として追跡する。
- 統合前の対応付け: sample ID、replicate、batch、reference build、annotation version、coordinate、feature ID を統合前に固定し、変換条件を記録する。
- 統合結果の読み方: PCA / UMAP / clustering / network / factor analysis は仮説生成の補助であり、因果関係や臨床判断には独立検証と専門家レビューが必要である。
入力データと出力データ
| 入力 | 主な処理 | 出力 | 確認すること |
|---|---|---|---|
| ATAC-seq / ChIP-seq FASTQ | QC、alignment、peak calling | peak BED、QC summary、signal track | reference build、duplicate rate、FRiP、peak数、blacklist対応 |
| WGBS / RRBS / methylation table | alignment、methylation calling、差分解析 | CpG単位/領域単位のメチル化率表 | coverage、bisulfite conversion、genomic coordinate、欠測 |
proteomics vendor raw / mzML / sample metadata |
変換、database・library search、FDR、protein inference、定量 | PSM・peptide・protein group、quantitative matrix、QC report | raw checksum、検索DB release、decoy、PSM/peptide/protein FDR、shared peptide、PTM localization |
metabolomics vendor raw / mzML / NMR data / sample metadata |
peak detection、deconvolution、alignment、annotation、QC補正 | feature matrix、compound annotation、QC report | profile/centroid、m/z・RT tolerance、adduct/isotope、blank、pooled QC、library version、confidence |
| RNA-seq count tableと各質量分析matrix | layer内正規化、batch処理、ID mapping、統合 | 統合用matrix、mapping table、factor/network | one-to-many対応、欠測機構、単位・scale、annotation release、外れ値 |
| sample metadata | ID照合、design matrix 作成 | sample sheet、contrast、解析対象一覧 | 同一検体対応、除外基準、同意/利用条件、交絡 |
標準的なワークフロー
- 研究目的、比較条件、検体対応表、除外基準、データ利用条件を metadata として固定する。
- FASTQ、vendor raw、参照ゲノム、annotation、protein / spectral / compound database、converter、解析ツールの version と parameter を記録する。
- 各 omics layer ごとに QC を行い、mapping rate、duplicate rate、peak数、coverage、mass error、retention time、blank、pooled QC、同定数、欠測率などから該当する指標を確認する。
- layer 内の正規化と batch 補正を行い、統合前に feature ID、coordinate、単位、スケールを揃える。
- 統合解析では PCA / UMAP / clustering / network / factor analysis などの結果を、入力条件と可視化設定付きで保存する。
- 解析結果は仮説生成として扱い、臨床判断や因果関係の主張には独立検証と専門家レビューを必要とする。
実務上の落とし穴
- omics layer 間で sample ID、replicate、batch、取得時点がずれている状態で統合しない。
- reference genome や annotation version、coordinate system の違いを無視して peak と gene を結び付けない。
- 欠測補完、正規化、次元削減の設定を記録せずに、クラスタや因子を生物学的結論として読まない。
- vendor rawを変換後に破棄しない。converter build、vendor reader、centroiding/filter、input/output checksumを残さずに
mzMLだけを正本としない。 - PSM level FDRを、そのままpeptide、protein、PTM siteのconfidenceとして流用しない。metabolite featureを、library hitだけでconfirmed compoundと呼ばない。
- blank subtraction、drift correction、normalization、imputationを上書き処理にせず、対象、順序、除外理由、補正前後matrixを残す。
- 小規模データや試験問題形式の例を、臨床実装に必要な検証済み workflow とみなさない。
- ChIP-seq / ATAC-seq / methylation / RNA-seq の結果を統合しても、因果関係が自動的に証明されるわけではない。
小さな実例と結果の読み方
章内のメチル化率計算、MOFA 風の統合、時系列モデル化のコード断片は、入力と処理責務を説明するための概念例です。結果を読むときは、各 layer の QC summary、ID対応表、正規化方法、batch補正、feature filtering、可視化設定を分けて確認します。質量分析では、公開 accession から raw、metadata、検索・annotation条件、定量matrixまで逆向きにたどれるかを確認します。小さな公開データでは、統合結果そのものよりも、どの前処理条件を固定し、どこを質量分析担当者・研究者・統計担当者へ確認するかを明確にします。
限界と注意点
本章のコード断片と試験問題形式の例は、エピゲノム・マルチオミクス解析の概念を説明するための簡略例です。十分な反復数、統一された metadata、同一検体対応、batch設計、検証 cohort、データ利用条件、統計モデルの妥当性を省略した状態では、研究結論や臨床判断に使えません。
6.1 エピゲノム解析技術
DNAメチル化解析: 以下はメチル化率計算の責務を示す説明用断片で、CpGサイト取得、BAM処理、ゼロ割回避、QC、来歴(provenance)記録を省略しているため、そのまま実行しない。 🧪 概念例(実行不可: 説明用Python断片)
class MethylationAnalyzer:
"""バイサルファイトシークエンシング解析"""
def __init__(self, reference_genome):
self.reference = reference_genome
def call_methylation(self, bam_file):
"""
CpGサイトのメチル化率計算
"""
methylation_levels = {}
for cpg_site in self.get_cpg_sites():
# メチル化/非メチル化リード数をカウント
meth_count, unmeth_count = self.count_reads(
bam_file, cpg_site
)
# ベータ値の計算
beta = meth_count / (meth_count + unmeth_count)
methylation_levels[cpg_site] = beta
return methylation_levels
ChIP-seq解析:
- ヒストン修飾・転写因子結合部位の同定
- ピーク検出アルゴリズム(MACS2)
- 差次的結合解析
ATAC-seq/クロマチンアクセシビリティ:
- オープンクロマチン領域の同定
- ヌクレオソーム位置の推定
- 転写因子フットプリント解析
6.2 共通データフローと data contract
質量分析を含む omics では、単一の「解析済みファイル」ではなく、変換と判断の段階ごとに成果物を分けます。
🧪 概念例(実行不可: data flowの説明例)
vendor raw / instrument-native data
-> open spectrum format / sample metadata
-> feature or identification table
-> QC / normalization / batch handling
-> annotated quantitative matrix
-> cross-omics mapping table
-> integration and interpretation
| 段階 | 保存する成果物 | 再現に必要な記録 | fail-closedにする条件の例 |
|---|---|---|---|
| 取得 | vendor raw、instrument method、sample sheet | raw checksum、取得時刻、instrument / acquisition method、sample / batch / injection order | sample ID重複、raw欠落、checksum不一致 |
| 標準化 | mzML等のopen format、変換log |
converter build、vendor reader、profile/centroid、filter、output checksum | 変換失敗、scan数の説明不能な差、空file |
| 検出・同定 | PSM / peptide / feature / annotation table | search engine、protein DB / spectral library、release、parameter、decoy、score | DB・library版不明、threshold不明 |
| QC・定量 | QC report、除外表、補正前後matrix | blank / pooled QC / internal standard、FDR / confidence、normalization、imputation、batch処理 | 除外理由なし、補正前matrix欠落 |
| 統合 | ID mapping table、layer別matrix、model output | annotation release、one-to-many処理、scale、missingness、seed、software environment | sample対応不明、mapping衝突を黙って集約 |
| 公開・再利用 | accession、file manifest、解析manifest | repository、公開版、license / data use、取得日、citation | accessionだけで対象fileを特定できない |
vendor raw と open format は用途が異なります。open format はtool間交換と長期再利用に有用ですが、vendor readerや変換設定に依存します。rawを保持した上で、変換前後のchecksumとscan summaryを別に記録します。標準のversion、controlled vocabulary、software buildも解析manifestに含め、最新版という語だけで置き換えません。
6.3 Proteomics の実務導線
DDA / DIA と探索方式を分ける
| 判断軸 | DDA(data-dependent acquisition) | DIA(data-independent acquisition) |
|---|---|---|
| 取得 | 条件を満たすprecursorを逐次選択してfragment化 | 定義したm/z window内のionをまとめてfragment化 |
| 主な性質 | spectrumとprecursorの対応を読みやすい一方、選択の確率性によりrun間欠測が生じ得る | 広い範囲を反復測定しやすい一方、混合fragmentの分離とscoreは解析modelに強く依存する |
| 解析入口 | protein sequence DB search、spectral library search | empirical library、predicted library、library-free / direct search |
| 比較時に固定するもの | isolation、dynamic exclusion、gradient、search DB、enzyme / modification | window scheme、cycle time、library生成元、prediction model、FDR strategy |
DDA / DIAは優劣ではなく、研究目的、装置、sample complexity、定量設計、再解析要件で選びます。「library-free」は参照情報が不要という意味ではありません。FASTA、model、decoy、retention-time / fragment prediction、software buildを記録します。
標準形式の責務を混同しない
| 標準 | 主な責務 | この章での記録点 |
|---|---|---|
mzML 1.1 |
spectrum、chromatogram、instrument / acquisition metadataの交換 | converter、CV、profile/centroid、compression、checksum |
mzIdentML 1.3 |
peptide / protein identification結果と検索条件の交換 | schema version、search DB、score、threshold、protein grouping |
mzTab 1.0 |
proteomics identification / quantification結果のtabular summary | section、unit、missing value表現、元結果への対応 |
mzQC 1.0 |
質量分析QC指標のreport / handover / archive | metric CV、対象run、software、計算条件 |
| ProForma 2.1 | peptidoform / proteoformと修飾の機械可読表記 | notation version、修飾CV、ambiguous localization |
| SDRF-Proteomics | sample特性とdata fileの関係 | row単位のsample-to-file対応、label、fraction、instrument |
SDRF-Proteomicsはsample-to-file metadataを担い、FDR thresholdや比較contrastなどのdownstream解析条件を代替しません。標準形式を出力できても、そのfileがvalidation済みであることや、元tool固有の全情報を保持していることは別に確認します。
同定・定量の confidence boundary
- spectrum と候補peptideの対応を PSM としてscoreする。
- PSMをpeptide / peptidoformへ集約する。修飾位置の不確実性は、配列同定のscoreと分ける。
- peptideをprotein / protein groupへ推論する。複数proteinへ対応するshared peptideを、根拠なしに1 proteinへ確定しない。
- PSM、peptide、protein、PTM siteの各levelで、母集団、threshold、FDRまたはfalse localization rateを記録する。
- target-decoyは広く使われるFDR推定法ですが、decoy生成、competition、sample sizeなどの仮定を確認し、
1% FDRという数値だけを別workflowへ移植しない。
label-free intensity、SILAC、TMT / iTRAQなどのisobaric labelingは、観測単位とnormalizationが異なります。reporter channel、reference channel、lot、isotope correction、ratio compressionの確認点を解析設計に含めます。missing valueは、低強度、sampling、feature matching、filter、真の非存在など複数要因で生じるため、0への置換や一律imputationを既定にしません。
QCでは、mass accuracy、retention time、chromatographic peak、identification rate、contaminant、carry-over、batch、replicate CVを目的に応じて選びます。除外前後の数、理由、対象levelを残し、PTMではlocalization confidenceをPSM confidenceと別列で保持します。
公開と再利用
PRIDEはProteomeXchangeのpartner repositoryとしてMS-based proteomics dataを受け入れます。再利用時はPXD accessionだけでなく、raw、open format、result、SDRF / sample metadata、processing protocol、file checksumの対応をmanifest化します。完全submissionとpartial submissionでは再解析可能性が異なるため、file categoryと公開状態を確認します。reviewer access、embargo、dataset license / data use、関連publicationも別項目として記録します。
6.4 Metabolomics の実務導線
測定目的とplatformを先に固定する
| 区分 | 主な目的 | 出力の読み方 | 固有の確認点 |
|---|---|---|---|
| targeted MS | 事前定義したanalyteの検出・定量 | calibration、LOD / LOQ、internal standardを含む対象別結果 | transition、標準物質、matrix effect、calibration range |
| untargeted MS | 広いfeature集合の探索 | featureは候補信号であり、compound同定とは限らない | peak detection、alignment、adduct / isotope grouping、library score |
| LC-MS | 液体chromatographyで分離してMS測定 | m/z、retention time、MS/MSを組み合わせる |
column / gradient、ion mode、carry-over、RT drift |
| GC-MS | 揮発化・誘導体化とgas chromatographyを利用 | EI spectrumとretention index等を利用 | derivatization、RI standard、deconvolution、library version |
| NMR | 核磁気共鳴spectrumを利用 | chemical shift、multiplicity等を用いる | pulse sequence、field strength、reference、processing |
LC-MS、GC-MS、NMRは相補的で、同じ「metabolite matrix」でもcoverage、単位、confidenceが同じではありません。targeted / untargetedとplatformをmetadataの別列にし、混在したmatrixを無条件に連結しません。
feature matrixを作るまで
- vendor rawとsample metadataを受領し、profile / centroid、polarity、acquisition order、batch、sample / blank / pooled QC / standardを固定する。
- open formatへ変換し、peak detection、deconvolution、alignment、feature groupingを実施する。各stepの
m/z、retention time、minimum intensity、gap-filling parameterを記録する。 - isotope、adduct、in-source fragment、同一compound候補をgroup化する。1 feature = 1 metaboliteとは仮定しない。
- blankとcarry-overを評価し、pooled QCでsignal stabilityとdriftを確認する。internal standardは抽出・ionization・測定変動のどこを補正するかを定義する。
- 補正前matrix、除外表、補正関数、補正後matrixを分け、sample / featureごとの変更を追跡可能にする。
| QC項目 | 目的 | 実装上の注意 |
|---|---|---|
| procedure / solvent blank | background、reagent、carry-over由来の信号を把握 | blank thresholdを満たさないfeatureを即削除せず、tagと根拠を残す |
| pooled QC | 代表sampleの混合物を反復注入し、stability / driftを観測 | biological replicateではない。batch、injection order、作成法を記録 |
| internal standard | extraction、injection、ionization等の変動を監視・補正 | analyteごとの近似妥当性、添加時点、濃度、lotを記録 |
| drift correction | QC等を参照してacquisition orderに沿う変動を補正 | interpolation / model、適用範囲、外挿、過補正、補正前後を評価 |
| batch correction | run / plate / day差を扱う | biological conditionとbatchが交絡していれば計算だけでは解消できない |
featureとconfirmed metaboliteを分ける
metabolite featureは少なくともfeature ID、m/z、retention time、polarity、adduct候補、isotope group、sample intensityを持たせます。annotationでは、library名・release、spectrum accession、precursor / fragment tolerance、score、matched peaks、decoyまたはconfidence methodを記録します。
Metabolomics Standards Initiativeのreporting level等を用いる場合も、採用したschemeと判定根拠を明記します。authentic standardを同一条件で測定していないlibrary matchを、confirmed metaboliteと表現しません。isomer / stereoisomerは同じexact massや類似MS/MSを持ち得るため、解像できない場合はcompound class、候補集合、unknown featureとして保持します。mzTab-M 2.0はsmall-molecule result交換のfinal specificationであり、draft 2.1と混同しません。
公開と再利用
MetaboLightsはMSとNMRを含むmetabolomics studyをISA-Tab metadataとともに扱い、MTBLS accessionを付与します。GNPSはMS/MSの解析・spectral libraryと、MassIVE datasetの共有を接続します。GNPS task URL、library spectrum、MassIVE accessionは同じ識別子ではありません。再利用時はraw / peak list / metadata / supplementary resultのfile category、公開状態、library version、license / data useを確認し、accessionと取得日をmanifestへ記録します。
6.5 Cross-omics mapping と統合解釈
mapping tableを独立成果物にする
| source layer | source ID | target ID例 | release / version | one-to-many処理 | 根拠・状態 |
|---|---|---|---|---|---|
| transcriptomics | Ensembl transcript version | Ensembl gene / HGNC ID | annotation release | isoformを保持してgene集約規則を別記 | mapped / retired / ambiguous |
| proteomics | peptide / ProForma、UniProt accession / isoform | protein group / gene ID | FASTA・UniProt release | shared peptideとprotein groupを保持 | unique / shared / unmapped |
| metabolomics | feature ID、InChIKey、ChEBI / PubChem等 | compound / reaction / pathway | DB・library release | salt、charge、stereo、isomerを区別 | confirmed / putative / unknown |
表示名やgene symbolだけでjoinせず、stable ID、version、organism、sequenceまたはchemical structure、mapping service、取得日を残します。Ensemblではgene / transcript / proteinのversion更新条件が異なり、UniProtでは1 geneに複数entry / isoformが対応し得ます。compound nameはsynonym、salt、stereochemistryにより衝突するため、可能ならInChIKey等のstructure keyとcurated IDを併記します。
one-to-manyを解決する規則は解析前に決めます。例として、複数transcriptをgeneへ集約する方法、shared peptideをprotein groupとして残すか、複数compound候補をunknownのまま保持するかを記録します。対応しなかった行を捨てず、unmapped / ambiguous tableとして件数と理由を出力します。
layer内処理と統合を分ける
- raw count、log intensity、ratio、absolute concentrationを同一scaleとして連結しない。normalization、transformation、feature filteringはlayer内で評価する。
- missingnessはRNA count、DDA peptide、DIA precursor、metabolite featureで機構が異なる。欠測補完法を全layerへ一括適用しない。
- sample、subject、time point、replicateの対応表を固定し、同一個体でないdataをpaired designとして扱わない。
- early integration、factor model、network / pathway、late integrationのどれを使うかを、目的とvalidation単位に合わせる。
- supervised modelではsplit後にpreprocessing / feature selectionをfitし、test cohortやbatch情報のdata leakageを避ける。
MOFA+のようなfactor modelは複数view / groupとmissing valueを扱えますが、missingness mechanismやbad mappingを自動的に正当化しません。factor loading、correlation、network edgeは関連と仮説を示すもので、介入、時間順序、交絡統制、独立検証なしに生物学的因果や臨床有用性を示しません。
以下は統合処理の責務を示す説明用断片で、入力正規化、欠測機構、batch補正、model selection、validationを省略しているため、そのまま実行しません。
🧪 概念例(実行不可: 説明用Python断片)
class MultiOmicsIntegrator:
"""マルチオミクスデータ統合"""
def __init__(self):
self.omics_layers = {}
self.mapping_tables = {}
def add_layer(self, name, matrix, mapping_table):
"""正規化済みmatrixとversion付きmappingを登録する。"""
self.omics_layers[name] = matrix
self.mapping_tables[name] = mapping_table
def integrate_by_factor_model(self):
"""事前検証済み入力から潜在因子と寄与度を返す責務を示す。"""
factors = self.extract_factors()
contributions = self.evaluate_contributions()
return factors, contributions
6.6 時系列オミクス解析
時間軸や空間座標を持つdataでは、sample間の独立性を仮定した統合だけでは不十分です。MEFISTOのようなmodelは既知の時間・空間依存をfactor modelへ組み込めますが、sampling interval、subject、batch、missing time pointを正しく与える必要があります。時間順序があるだけで因果関係が確定するわけではありません。
以下は時系列モデル化の考え方を示す SciPy 依存の説明用断片で、入力形状確認、欠測処理、パラメータ選択、過学習確認を省略しているため、そのまま実行しません。
🧪 概念例(実行不可: SciPy依存の説明用Python断片)
class TimeSeriesOmics:
"""時系列オミクスデータ解析"""
def fit_temporal_model(self, expression_matrix, time_points):
"""スプライン回帰による時間変化モデリング"""
from scipy.interpolate import UnivariateSpline
temporal_profiles = {}
for feature_id, values in expression_matrix.items():
spline = UnivariateSpline(time_points, values, s=0.5)
temporal_profiles[feature_id] = spline
return temporal_profiles
🎯 認定試験ポイント
重要概念チェックリスト
エピゲノム基礎 ⭐⭐⭐
- DNAメチル化・ヒストン修飾・クロマチン構造の関係を理解している
- CpGアイランド・ショア・シェルフの定義と機能を説明できる
- エピジェネティックな遺伝・可逆性の概念を把握している
- 発生・分化におけるエピゲノム変化の役割を理解している
エピゲノム解析技術 ⭐⭐
- ChIP-seq・ATAC-seq・WGBS・RRBS等の技術原理を比較できる
- ピークコーリング・差次的結合解析の統計的手法を理解している
- エンハンサー・プロモーター・インスレーター領域の同定法
- 3Dクロマチン構造解析(Hi-C・4C-seq)の原理
質量分析オミクス ⭐⭐⭐
- vendor raw、open spectrum、sample metadata、同定・定量結果を別成果物として追跡できる
- DDA / DIA、targeted / untargeted、LC-MS / GC-MS / NMR の目的と出力を比較できる
- PSM、peptide、protein / protein group、PTM site の confidence と FDR の level を区別できる
- metabolite feature と confirmed compound を区別し、blank、pooled QC、internal standard、library version を記録できる
- PXD、MTBLS、MSV、GNPS task / library の識別子と file manifest の役割を説明できる
マルチオミクス統合 ⭐⭐⭐
- gene、transcript、protein、peptide、compound の one-to-many 対応を mapping table に残せる
- omics layer ごとに正規化、batch、missingness、scale が異なる理由を説明できる
- 次元削減、factor、network、pathway の結果を関連・仮説として解釈できる
- 統合結果を因果と誤読せず、独立検証に必要な条件を説明できる
臨床応用 ⭐⭐
- エピゲノムバイオマーカーの発見手法
- 薬物応答性とエピゲノム変化の関連
- がん・神経疾患でのエピゲノム異常
- エピゲノム編集技術の原理と応用
典型的な出題パターン
【技術原理】 🧪 概念例(実行不可: 試験問題形式の説明例)
問題例: ChIP-seqとATAC-seqの技術的違いと、
得られる情報の違いを説明せよ。
解答:
ChIP-seq: 特定タンパク質(転写因子・ヒストン修飾)の結合部位
ATAC-seq: クロマチンアクセシビリティ(オープンクロマチン領域)
→ ChIP-seqは特異的、ATAC-seqは包括的なクロマチン状態情報
【データ統合】 🧪 概念例(実行不可: 試験問題形式の説明例)
問題例: RNA-seqとChIP-seqデータを統合して
遺伝子発現制御を解析する際の手順を述べよ。
解答:
1) ChIP-seqピークと遺伝子プロモーター/エンハンサーの関連付け
2) 発現変動遺伝子とエピゲノム変化の相関解析
3) 転写因子結合モチーフ解析
4) 制御ネットワークの構築と可視化
【統計・品質管理】 🧪 概念例(実行不可: 試験問題形式の説明例)
問題例: DNAメチル化解析においてWGBSとRRBSの
使い分け基準を3つの観点から説明せよ。
解答:
1) カバレッジ: WGBS(全ゲノム網羅)vs RRBS(CpG密集領域)
2) コスト: WGBS(高コスト)vs RRBS(低コスト)
3) 解像度: WGBS(1塩基)vs RRBS(制限酵素サイト依存)
【質量分析 data contract】 🧪 概念例(実行不可: 試験問題形式の説明例)
問題例: untargeted LC-MS metabolomicsの公開データを再解析する。
再現性と同定confidenceを監査するための成果物を説明せよ。
解答:
1) vendor raw、変換後mzML、変換log、各fileのchecksumを対応付ける
2) sample / blank / pooled QC / standard、batch、injection orderをsample sheetで固定する
3) peak detection、alignment、blank filter、drift correctionのparameterと補正前後matrixを残す
4) feature ID、m/z、retention time、adduct/isotope、library release、scoreを記録する
5) authentic standard未確認の候補をconfirmed metaboliteとせず、accessionと取得日をmanifestへ残す
関連する付録・章
- 付録G: JSBi認定試験の理解補助
- 付録H: プログラム・ツール・データベース一覧(H.12 質量分析標準・ツール・repository)
- 付録K: 用語集(質量分析オミクスの最小用語)
- 第5章: トランスクリプトーム解析(発現との統合)
- 第7章: 機械学習・AI応用(統合解析手法)
- 第12章: 臨床応用システム(研究・臨床実装の責任境界)
Source notes / 次の一歩
- 公式仕様(確認日: 2026-07-17 JST): HUPO-PSI mzML、mzIdentML、mzTab / mzTab-M、mzQC、ProForma、SDRF-Proteomics
- 公開repository(確認日: 2026-07-17 JST): ProteomeXchange、PRIDE、MetaboLights、GNPS
- QC / confidenceの一次根拠(確認日: 2026-07-17 JST): target-decoy / FDR quality、protein inference、metabolite identification confidence
- 統合の一次根拠(確認日: 2026-07-17 JST): MOFA+、MEFISTO
- 付録H: プログラム・ツール・データベース一覧(ATAC-seq / ChIP-seq / methylation / mass spectrometry / multi-omics の確認先)
- 付録K: 用語集(PSM、FDR level、protein inference、feature、blank / QC)
- 付録F: 参考資料(2026年版で本文へ反映した主要トピックの索引)
- 第5章: トランスクリプトーム解析(RNA-seq との統合)
- 第13章: 研究手法(study design、batch、FDR、再現性)
- 2026年版出典監査メモ(標準、repository、利用条件、統合手法の確認日付き根拠)
2026年時点の更新メモ
2026-07-17 JST に、PSI の mzML 1.1、mzIdentML 1.3、mzTab 1.0、mzTab-M 2.0、mzQC 1.0、ProForma 2.1 と SDRF-Proteomics、主要repositoryと解析ツールの公式情報を再確認しました。mzTab-M 2.1 は draft であり、2.0 final と混同しません。toolや標準の更新を「最新版」とだけ書かず、確認日、release、利用条件、OS / container、input / output、workflow、parameter、checksumを解析manifestへ固定します。
マルチオミクス統合では、reference / annotation release、sample metadata、omics layer 間の ID 対応表、QC summary、normalization / batch correction、missingness、model、利用条件を合わせて記録します。factor、correlation、network、pathwayの結果は関連・仮説であり、介入、時間順序、交絡統制、独立cohort等の追加根拠なしに因果関係を示しません。
最小入出力(期待成果物/期待ログ)
- 入力: ATAC-seq / ChIP-seq等のFASTQまたはメチル化データ、質量分析vendor raw / open format、参照・検索DB / library、version付きsample metadata
- 出力(期待成果物): peak / methylation table、PSM・peptide・protein group、metabolite feature / annotation、補正前後matrix、ID mapping、QC summary、公開accession
- 期待ログ: input / output checksum、converter / tool / DB / library release、parameter、FDR / confidence、blank / QC / batch / exclusion、one-to-many / unmapped件数
| 前へ: トランスクリプトーム解析 | 目次 | 次へ: 機械学習・AI応用 |
演習
- PRIDEまたはMetaboLightsの公開accessionを1件選び、metadataだけを用いてもよいので、raw / open format / result / sample metadata、checksum、version、除外条件を対応付けるmanifestを作成せよ。
- 同じomics layerの2 toolを、入力、出力、license / 利用条件、OS / container、主な用途、再現性記録の観点で比較せよ。
- transcript、protein / peptide、metabolite featureを結ぶmapping tableを設計し、one-to-many、unmapped、ambiguous、annotation releaseの扱いを説明せよ。
具体課題例
- PXDまたはMTBLS accessionのlanding pageとfile listを調べ、どのfileがraw、変換済み、同定・定量、metadata、補助結果かを分類する。大容量fileのdownloadは必須としない。
- ProteoWizard / OpenMS / FragPipe / DIA-NN / MaxQuant、またはMZmine / XCMS / MS-DIAL / OpenMSから2つを選び、比較日時と公式URL付きの選定表を作る。
- gene symbolだけでjoinせず、Ensembl / UniProt / ChEBI等のIDとreleaseを持つmapping例を作り、保持した曖昧性と捨てた情報を記録する。
- 成果物一式として、manifest、比較表またはmapping table、判断記録、利用した公式出典と確認日を提出する。実データを実行した場合だけcommand、parameter、tool / DB version、log、QC reportを追加する。