第6章: エピゲノム・マルチオミクス解析

6. エピゲノム・マルチオミクス解析

学習目標

  • エピゲノム・マルチオミクス解析の入力、出力、QC、統合手順を説明できる
  • 質量分析 proteomics / metabolomics について、vendor raw から標準形式、同定・定量、公開 repository までの data contract を設計できる
  • PSM / peptide / protein と metabolite feature / compound annotation の confidence を区別し、FDR、missingness、batch、library version を記録できる
  • omics layer 間の ID 対応、batch、欠測、正規化、来歴管理の確認点を挙げられる
  • 統合解析結果を研究上の仮説生成として読み、臨床判断へ直結させない理由を説明できる

なぜ IT 技術者に必要か

エピゲノム・マルチオミクス解析では、FASTQ、peak、methylation table、mass spectrum、feature table、quantitative matrix、clinical metadata など、粒度と前処理条件が異なるデータを結合します。質量分析では、同じ vendor raw からでも centroiding、検索DB、spectral library、FDR、feature grouping の条件によって結果が変わります。IT 技術者がこの章の前提を理解していると、サンプル ID の対応、データ利用条件、QC、バッチ補正、ファイル形式、解析ログ、成果物の再現性を設計段階で整理できます。

この章では、個々の解析手法を網羅することよりも、入力と出力の対応、統合前の正規化、来歴管理、研究・臨床解釈の限界を説明できることを重視します。

前提知識

  • FASTQ、BAM/CRAM、BED、bigWig、methylation table、count matrix、sample metadata の役割を区別できること。
  • 質量分析の詳細な装置原理は前提としないが、spectrum の m/z、intensity、retention time と、raw data / identification / quantification が別の成果物であること。
  • 第2章の実行環境、ストレージ I/O、ログ記録、workflow manager、container の基本。
  • 第4章の reference genome、coordinate system、annotation version、checksum の考え方。
  • 第5章の RNA-seq count / TPM / DE 解析と、第13章の study design、batch、FDR、交絡の基本。

基本概念

  • omics layer: ATAC-seq / ChIP-seq / methylation / RNA-seq / proteomics / metabolomics は、測定対象、単位、ノイズ、欠測、前処理が異なる。
  • 質量分析の成果物階層: vendor raw、open spectrum、PSMまたはfeature、annotation、quantitative matrixは相互に代替できない。変換・filtering前後を別成果物として追跡する。
  • 統合前の対応付け: sample ID、replicate、batch、reference build、annotation version、coordinate、feature ID を統合前に固定し、変換条件を記録する。
  • 統合結果の読み方: PCA / UMAP / clustering / network / factor analysis は仮説生成の補助であり、因果関係や臨床判断には独立検証と専門家レビューが必要である。

入力データと出力データ

入力 主な処理 出力 確認すること
ATAC-seq / ChIP-seq FASTQ QC、alignment、peak calling peak BED、QC summary、signal track reference build、duplicate rate、FRiP、peak数、blacklist対応
WGBS / RRBS / methylation table alignment、methylation calling、差分解析 CpG単位/領域単位のメチル化率表 coverage、bisulfite conversion、genomic coordinate、欠測
proteomics vendor raw / mzML / sample metadata 変換、database・library search、FDR、protein inference、定量 PSM・peptide・protein group、quantitative matrix、QC report raw checksum、検索DB release、decoy、PSM/peptide/protein FDR、shared peptide、PTM localization
metabolomics vendor raw / mzML / NMR data / sample metadata peak detection、deconvolution、alignment、annotation、QC補正 feature matrix、compound annotation、QC report profile/centroid、m/z・RT tolerance、adduct/isotope、blank、pooled QC、library version、confidence
RNA-seq count tableと各質量分析matrix layer内正規化、batch処理、ID mapping、統合 統合用matrix、mapping table、factor/network one-to-many対応、欠測機構、単位・scale、annotation release、外れ値
sample metadata ID照合、design matrix 作成 sample sheet、contrast、解析対象一覧 同一検体対応、除外基準、同意/利用条件、交絡

標準的なワークフロー

  1. 研究目的、比較条件、検体対応表、除外基準、データ利用条件を metadata として固定する。
  2. FASTQ、vendor raw、参照ゲノム、annotation、protein / spectral / compound database、converter、解析ツールの version と parameter を記録する。
  3. 各 omics layer ごとに QC を行い、mapping rate、duplicate rate、peak数、coverage、mass error、retention time、blank、pooled QC、同定数、欠測率などから該当する指標を確認する。
  4. layer 内の正規化と batch 補正を行い、統合前に feature ID、coordinate、単位、スケールを揃える。
  5. 統合解析では PCA / UMAP / clustering / network / factor analysis などの結果を、入力条件と可視化設定付きで保存する。
  6. 解析結果は仮説生成として扱い、臨床判断や因果関係の主張には独立検証と専門家レビューを必要とする。

実務上の落とし穴

  • omics layer 間で sample ID、replicate、batch、取得時点がずれている状態で統合しない。
  • reference genome や annotation version、coordinate system の違いを無視して peak と gene を結び付けない。
  • 欠測補完、正規化、次元削減の設定を記録せずに、クラスタや因子を生物学的結論として読まない。
  • vendor rawを変換後に破棄しない。converter build、vendor reader、centroiding/filter、input/output checksumを残さずにmzMLだけを正本としない。
  • PSM level FDRを、そのままpeptide、protein、PTM siteのconfidenceとして流用しない。metabolite featureを、library hitだけでconfirmed compoundと呼ばない。
  • blank subtraction、drift correction、normalization、imputationを上書き処理にせず、対象、順序、除外理由、補正前後matrixを残す。
  • 小規模データや試験問題形式の例を、臨床実装に必要な検証済み workflow とみなさない。
  • ChIP-seq / ATAC-seq / methylation / RNA-seq の結果を統合しても、因果関係が自動的に証明されるわけではない。

小さな実例と結果の読み方

章内のメチル化率計算、MOFA 風の統合、時系列モデル化のコード断片は、入力と処理責務を説明するための概念例です。結果を読むときは、各 layer の QC summary、ID対応表、正規化方法、batch補正、feature filtering、可視化設定を分けて確認します。質量分析では、公開 accession から raw、metadata、検索・annotation条件、定量matrixまで逆向きにたどれるかを確認します。小さな公開データでは、統合結果そのものよりも、どの前処理条件を固定し、どこを質量分析担当者・研究者・統計担当者へ確認するかを明確にします。

限界と注意点

本章のコード断片と試験問題形式の例は、エピゲノム・マルチオミクス解析の概念を説明するための簡略例です。十分な反復数、統一された metadata、同一検体対応、batch設計、検証 cohort、データ利用条件、統計モデルの妥当性を省略した状態では、研究結論や臨床判断に使えません。

6.1 エピゲノム解析技術

DNAメチル化解析: 以下はメチル化率計算の責務を示す説明用断片で、CpGサイト取得、BAM処理、ゼロ割回避、QC、来歴(provenance)記録を省略しているため、そのまま実行しない。 🧪 概念例(実行不可: 説明用Python断片)

class MethylationAnalyzer:
    """バイサルファイトシークエンシング解析"""
    
    def __init__(self, reference_genome):
        self.reference = reference_genome
        
    def call_methylation(self, bam_file):
        """
        CpGサイトのメチル化率計算
        """
        methylation_levels = {}
        
        for cpg_site in self.get_cpg_sites():
            # メチル化/非メチル化リード数をカウント
            meth_count, unmeth_count = self.count_reads(
                bam_file, cpg_site
            )
            
            # ベータ値の計算
            beta = meth_count / (meth_count + unmeth_count)
            methylation_levels[cpg_site] = beta
            
        return methylation_levels

ChIP-seq解析:

  • ヒストン修飾・転写因子結合部位の同定
  • ピーク検出アルゴリズム(MACS2)
  • 差次的結合解析

ATAC-seq/クロマチンアクセシビリティ:

  • オープンクロマチン領域の同定
  • ヌクレオソーム位置の推定
  • 転写因子フットプリント解析

6.2 共通データフローと data contract

質量分析を含む omics では、単一の「解析済みファイル」ではなく、変換と判断の段階ごとに成果物を分けます。

🧪 概念例(実行不可: data flowの説明例)

vendor raw / instrument-native data
  -> open spectrum format / sample metadata
  -> feature or identification table
  -> QC / normalization / batch handling
  -> annotated quantitative matrix
  -> cross-omics mapping table
  -> integration and interpretation
段階 保存する成果物 再現に必要な記録 fail-closedにする条件の例
取得 vendor raw、instrument method、sample sheet raw checksum、取得時刻、instrument / acquisition method、sample / batch / injection order sample ID重複、raw欠落、checksum不一致
標準化 mzML等のopen format、変換log converter build、vendor reader、profile/centroid、filter、output checksum 変換失敗、scan数の説明不能な差、空file
検出・同定 PSM / peptide / feature / annotation table search engine、protein DB / spectral library、release、parameter、decoy、score DB・library版不明、threshold不明
QC・定量 QC report、除外表、補正前後matrix blank / pooled QC / internal standard、FDR / confidence、normalization、imputation、batch処理 除外理由なし、補正前matrix欠落
統合 ID mapping table、layer別matrix、model output annotation release、one-to-many処理、scale、missingness、seed、software environment sample対応不明、mapping衝突を黙って集約
公開・再利用 accession、file manifest、解析manifest repository、公開版、license / data use、取得日、citation accessionだけで対象fileを特定できない

vendor raw と open format は用途が異なります。open format はtool間交換と長期再利用に有用ですが、vendor readerや変換設定に依存します。rawを保持した上で、変換前後のchecksumとscan summaryを別に記録します。標準のversion、controlled vocabulary、software buildも解析manifestに含め、最新版という語だけで置き換えません。

6.3 Proteomics の実務導線

DDA / DIA と探索方式を分ける

判断軸 DDA(data-dependent acquisition) DIA(data-independent acquisition)
取得 条件を満たすprecursorを逐次選択してfragment化 定義したm/z window内のionをまとめてfragment化
主な性質 spectrumとprecursorの対応を読みやすい一方、選択の確率性によりrun間欠測が生じ得る 広い範囲を反復測定しやすい一方、混合fragmentの分離とscoreは解析modelに強く依存する
解析入口 protein sequence DB search、spectral library search empirical library、predicted library、library-free / direct search
比較時に固定するもの isolation、dynamic exclusion、gradient、search DB、enzyme / modification window scheme、cycle time、library生成元、prediction model、FDR strategy

DDA / DIAは優劣ではなく、研究目的、装置、sample complexity、定量設計、再解析要件で選びます。「library-free」は参照情報が不要という意味ではありません。FASTA、model、decoy、retention-time / fragment prediction、software buildを記録します。

標準形式の責務を混同しない

標準 主な責務 この章での記録点
mzML 1.1 spectrum、chromatogram、instrument / acquisition metadataの交換 converter、CV、profile/centroid、compression、checksum
mzIdentML 1.3 peptide / protein identification結果と検索条件の交換 schema version、search DB、score、threshold、protein grouping
mzTab 1.0 proteomics identification / quantification結果のtabular summary section、unit、missing value表現、元結果への対応
mzQC 1.0 質量分析QC指標のreport / handover / archive metric CV、対象run、software、計算条件
ProForma 2.1 peptidoform / proteoformと修飾の機械可読表記 notation version、修飾CV、ambiguous localization
SDRF-Proteomics sample特性とdata fileの関係 row単位のsample-to-file対応、label、fraction、instrument

SDRF-Proteomicsはsample-to-file metadataを担い、FDR thresholdや比較contrastなどのdownstream解析条件を代替しません。標準形式を出力できても、そのfileがvalidation済みであることや、元tool固有の全情報を保持していることは別に確認します。

同定・定量の confidence boundary

  1. spectrum と候補peptideの対応を PSM としてscoreする。
  2. PSMをpeptide / peptidoformへ集約する。修飾位置の不確実性は、配列同定のscoreと分ける。
  3. peptideをprotein / protein groupへ推論する。複数proteinへ対応するshared peptideを、根拠なしに1 proteinへ確定しない。
  4. PSM、peptide、protein、PTM siteの各levelで、母集団、threshold、FDRまたはfalse localization rateを記録する。
  5. target-decoyは広く使われるFDR推定法ですが、decoy生成、competition、sample sizeなどの仮定を確認し、1% FDRという数値だけを別workflowへ移植しない。

label-free intensity、SILAC、TMT / iTRAQなどのisobaric labelingは、観測単位とnormalizationが異なります。reporter channel、reference channel、lot、isotope correction、ratio compressionの確認点を解析設計に含めます。missing valueは、低強度、sampling、feature matching、filter、真の非存在など複数要因で生じるため、0への置換や一律imputationを既定にしません。

QCでは、mass accuracy、retention time、chromatographic peak、identification rate、contaminant、carry-over、batch、replicate CVを目的に応じて選びます。除外前後の数、理由、対象levelを残し、PTMではlocalization confidenceをPSM confidenceと別列で保持します。

公開と再利用

PRIDEはProteomeXchangeのpartner repositoryとしてMS-based proteomics dataを受け入れます。再利用時はPXD accessionだけでなく、raw、open format、result、SDRF / sample metadata、processing protocol、file checksumの対応をmanifest化します。完全submissionとpartial submissionでは再解析可能性が異なるため、file categoryと公開状態を確認します。reviewer access、embargo、dataset license / data use、関連publicationも別項目として記録します。

6.4 Metabolomics の実務導線

測定目的とplatformを先に固定する

区分 主な目的 出力の読み方 固有の確認点
targeted MS 事前定義したanalyteの検出・定量 calibration、LOD / LOQ、internal standardを含む対象別結果 transition、標準物質、matrix effect、calibration range
untargeted MS 広いfeature集合の探索 featureは候補信号であり、compound同定とは限らない peak detection、alignment、adduct / isotope grouping、library score
LC-MS 液体chromatographyで分離してMS測定 m/z、retention time、MS/MSを組み合わせる column / gradient、ion mode、carry-over、RT drift
GC-MS 揮発化・誘導体化とgas chromatographyを利用 EI spectrumとretention index等を利用 derivatization、RI standard、deconvolution、library version
NMR 核磁気共鳴spectrumを利用 chemical shift、multiplicity等を用いる pulse sequence、field strength、reference、processing

LC-MS、GC-MS、NMRは相補的で、同じ「metabolite matrix」でもcoverage、単位、confidenceが同じではありません。targeted / untargetedとplatformをmetadataの別列にし、混在したmatrixを無条件に連結しません。

feature matrixを作るまで

  1. vendor rawとsample metadataを受領し、profile / centroid、polarity、acquisition order、batch、sample / blank / pooled QC / standardを固定する。
  2. open formatへ変換し、peak detection、deconvolution、alignment、feature groupingを実施する。各stepのm/z、retention time、minimum intensity、gap-filling parameterを記録する。
  3. isotope、adduct、in-source fragment、同一compound候補をgroup化する。1 feature = 1 metaboliteとは仮定しない。
  4. blankとcarry-overを評価し、pooled QCでsignal stabilityとdriftを確認する。internal standardは抽出・ionization・測定変動のどこを補正するかを定義する。
  5. 補正前matrix、除外表、補正関数、補正後matrixを分け、sample / featureごとの変更を追跡可能にする。
QC項目 目的 実装上の注意
procedure / solvent blank background、reagent、carry-over由来の信号を把握 blank thresholdを満たさないfeatureを即削除せず、tagと根拠を残す
pooled QC 代表sampleの混合物を反復注入し、stability / driftを観測 biological replicateではない。batch、injection order、作成法を記録
internal standard extraction、injection、ionization等の変動を監視・補正 analyteごとの近似妥当性、添加時点、濃度、lotを記録
drift correction QC等を参照してacquisition orderに沿う変動を補正 interpolation / model、適用範囲、外挿、過補正、補正前後を評価
batch correction run / plate / day差を扱う biological conditionとbatchが交絡していれば計算だけでは解消できない

featureとconfirmed metaboliteを分ける

metabolite featureは少なくともfeature ID、m/z、retention time、polarity、adduct候補、isotope group、sample intensityを持たせます。annotationでは、library名・release、spectrum accession、precursor / fragment tolerance、score、matched peaks、decoyまたはconfidence methodを記録します。

Metabolomics Standards Initiativeのreporting level等を用いる場合も、採用したschemeと判定根拠を明記します。authentic standardを同一条件で測定していないlibrary matchを、confirmed metaboliteと表現しません。isomer / stereoisomerは同じexact massや類似MS/MSを持ち得るため、解像できない場合はcompound class、候補集合、unknown featureとして保持します。mzTab-M 2.0はsmall-molecule result交換のfinal specificationであり、draft 2.1と混同しません。

公開と再利用

MetaboLightsはMSとNMRを含むmetabolomics studyをISA-Tab metadataとともに扱い、MTBLS accessionを付与します。GNPSはMS/MSの解析・spectral libraryと、MassIVE datasetの共有を接続します。GNPS task URL、library spectrum、MassIVE accessionは同じ識別子ではありません。再利用時はraw / peak list / metadata / supplementary resultのfile category、公開状態、library version、license / data useを確認し、accessionと取得日をmanifestへ記録します。

6.5 Cross-omics mapping と統合解釈

mapping tableを独立成果物にする

source layer source ID target ID例 release / version one-to-many処理 根拠・状態
transcriptomics Ensembl transcript version Ensembl gene / HGNC ID annotation release isoformを保持してgene集約規則を別記 mapped / retired / ambiguous
proteomics peptide / ProForma、UniProt accession / isoform protein group / gene ID FASTA・UniProt release shared peptideとprotein groupを保持 unique / shared / unmapped
metabolomics feature ID、InChIKey、ChEBI / PubChem等 compound / reaction / pathway DB・library release salt、charge、stereo、isomerを区別 confirmed / putative / unknown

表示名やgene symbolだけでjoinせず、stable ID、version、organism、sequenceまたはchemical structure、mapping service、取得日を残します。Ensemblではgene / transcript / proteinのversion更新条件が異なり、UniProtでは1 geneに複数entry / isoformが対応し得ます。compound nameはsynonym、salt、stereochemistryにより衝突するため、可能ならInChIKey等のstructure keyとcurated IDを併記します。

one-to-manyを解決する規則は解析前に決めます。例として、複数transcriptをgeneへ集約する方法、shared peptideをprotein groupとして残すか、複数compound候補をunknownのまま保持するかを記録します。対応しなかった行を捨てず、unmapped / ambiguous tableとして件数と理由を出力します。

layer内処理と統合を分ける

  • raw count、log intensity、ratio、absolute concentrationを同一scaleとして連結しない。normalization、transformation、feature filteringはlayer内で評価する。
  • missingnessはRNA count、DDA peptide、DIA precursor、metabolite featureで機構が異なる。欠測補完法を全layerへ一括適用しない。
  • sample、subject、time point、replicateの対応表を固定し、同一個体でないdataをpaired designとして扱わない。
  • early integration、factor model、network / pathway、late integrationのどれを使うかを、目的とvalidation単位に合わせる。
  • supervised modelではsplit後にpreprocessing / feature selectionをfitし、test cohortやbatch情報のdata leakageを避ける。

MOFA+のようなfactor modelは複数view / groupとmissing valueを扱えますが、missingness mechanismやbad mappingを自動的に正当化しません。factor loading、correlation、network edgeは関連と仮説を示すもので、介入、時間順序、交絡統制、独立検証なしに生物学的因果や臨床有用性を示しません。

以下は統合処理の責務を示す説明用断片で、入力正規化、欠測機構、batch補正、model selection、validationを省略しているため、そのまま実行しません。

🧪 概念例(実行不可: 説明用Python断片)

class MultiOmicsIntegrator:
    """マルチオミクスデータ統合"""

    def __init__(self):
        self.omics_layers = {}
        self.mapping_tables = {}

    def add_layer(self, name, matrix, mapping_table):
        """正規化済みmatrixとversion付きmappingを登録する。"""
        self.omics_layers[name] = matrix
        self.mapping_tables[name] = mapping_table

    def integrate_by_factor_model(self):
        """事前検証済み入力から潜在因子と寄与度を返す責務を示す。"""
        factors = self.extract_factors()
        contributions = self.evaluate_contributions()
        return factors, contributions

6.6 時系列オミクス解析

時間軸や空間座標を持つdataでは、sample間の独立性を仮定した統合だけでは不十分です。MEFISTOのようなmodelは既知の時間・空間依存をfactor modelへ組み込めますが、sampling interval、subject、batch、missing time pointを正しく与える必要があります。時間順序があるだけで因果関係が確定するわけではありません。

以下は時系列モデル化の考え方を示す SciPy 依存の説明用断片で、入力形状確認、欠測処理、パラメータ選択、過学習確認を省略しているため、そのまま実行しません。

🧪 概念例(実行不可: SciPy依存の説明用Python断片)

class TimeSeriesOmics:
    """時系列オミクスデータ解析"""

    def fit_temporal_model(self, expression_matrix, time_points):
        """スプライン回帰による時間変化モデリング"""
        from scipy.interpolate import UnivariateSpline

        temporal_profiles = {}
        for feature_id, values in expression_matrix.items():
            spline = UnivariateSpline(time_points, values, s=0.5)
            temporal_profiles[feature_id] = spline
        return temporal_profiles

🎯 認定試験ポイント

重要概念チェックリスト

エピゲノム基礎 ⭐⭐⭐

  • DNAメチル化・ヒストン修飾・クロマチン構造の関係を理解している
  • CpGアイランド・ショア・シェルフの定義と機能を説明できる
  • エピジェネティックな遺伝・可逆性の概念を把握している
  • 発生・分化におけるエピゲノム変化の役割を理解している

エピゲノム解析技術 ⭐⭐

  • ChIP-seq・ATAC-seq・WGBS・RRBS等の技術原理を比較できる
  • ピークコーリング・差次的結合解析の統計的手法を理解している
  • エンハンサー・プロモーター・インスレーター領域の同定法
  • 3Dクロマチン構造解析(Hi-C・4C-seq)の原理

質量分析オミクス ⭐⭐⭐

  • vendor raw、open spectrum、sample metadata、同定・定量結果を別成果物として追跡できる
  • DDA / DIA、targeted / untargeted、LC-MS / GC-MS / NMR の目的と出力を比較できる
  • PSM、peptide、protein / protein group、PTM site の confidence と FDR の level を区別できる
  • metabolite feature と confirmed compound を区別し、blank、pooled QC、internal standard、library version を記録できる
  • PXD、MTBLS、MSV、GNPS task / library の識別子と file manifest の役割を説明できる

マルチオミクス統合 ⭐⭐⭐

  • gene、transcript、protein、peptide、compound の one-to-many 対応を mapping table に残せる
  • omics layer ごとに正規化、batch、missingness、scale が異なる理由を説明できる
  • 次元削減、factor、network、pathway の結果を関連・仮説として解釈できる
  • 統合結果を因果と誤読せず、独立検証に必要な条件を説明できる

臨床応用 ⭐⭐

  • エピゲノムバイオマーカーの発見手法
  • 薬物応答性とエピゲノム変化の関連
  • がん・神経疾患でのエピゲノム異常
  • エピゲノム編集技術の原理と応用

典型的な出題パターン

【技術原理】 🧪 概念例(実行不可: 試験問題形式の説明例)

問題例: ChIP-seqとATAC-seqの技術的違いと、
得られる情報の違いを説明せよ。

解答: 
ChIP-seq: 特定タンパク質(転写因子・ヒストン修飾)の結合部位
ATAC-seq: クロマチンアクセシビリティ(オープンクロマチン領域)
→ ChIP-seqは特異的、ATAC-seqは包括的なクロマチン状態情報

【データ統合】 🧪 概念例(実行不可: 試験問題形式の説明例)

問題例: RNA-seqとChIP-seqデータを統合して
遺伝子発現制御を解析する際の手順を述べよ。

解答: 
1) ChIP-seqピークと遺伝子プロモーター/エンハンサーの関連付け
2) 発現変動遺伝子とエピゲノム変化の相関解析
3) 転写因子結合モチーフ解析
4) 制御ネットワークの構築と可視化

【統計・品質管理】 🧪 概念例(実行不可: 試験問題形式の説明例)

問題例: DNAメチル化解析においてWGBSとRRBSの
使い分け基準を3つの観点から説明せよ。

解答: 
1) カバレッジ: WGBS(全ゲノム網羅)vs RRBS(CpG密集領域)
2) コスト: WGBS(高コスト)vs RRBS(低コスト)
3) 解像度: WGBS(1塩基)vs RRBS(制限酵素サイト依存)

【質量分析 data contract】 🧪 概念例(実行不可: 試験問題形式の説明例)

問題例: untargeted LC-MS metabolomicsの公開データを再解析する。
再現性と同定confidenceを監査するための成果物を説明せよ。

解答:
1) vendor raw、変換後mzML、変換log、各fileのchecksumを対応付ける
2) sample / blank / pooled QC / standard、batch、injection orderをsample sheetで固定する
3) peak detection、alignment、blank filter、drift correctionのparameterと補正前後matrixを残す
4) feature ID、m/z、retention time、adduct/isotope、library release、scoreを記録する
5) authentic standard未確認の候補をconfirmed metaboliteとせず、accessionと取得日をmanifestへ残す

関連する付録・章

Source notes / 次の一歩

2026年時点の更新メモ

2026-07-17 JST に、PSI の mzML 1.1、mzIdentML 1.3、mzTab 1.0、mzTab-M 2.0、mzQC 1.0、ProForma 2.1 と SDRF-Proteomics、主要repositoryと解析ツールの公式情報を再確認しました。mzTab-M 2.1 は draft であり、2.0 final と混同しません。toolや標準の更新を「最新版」とだけ書かず、確認日、release、利用条件、OS / container、input / output、workflow、parameter、checksumを解析manifestへ固定します。

マルチオミクス統合では、reference / annotation release、sample metadata、omics layer 間の ID 対応表、QC summary、normalization / batch correction、missingness、model、利用条件を合わせて記録します。factor、correlation、network、pathwayの結果は関連・仮説であり、介入、時間順序、交絡統制、独立cohort等の追加根拠なしに因果関係を示しません。

最小入出力(期待成果物/期待ログ)

  • 入力: ATAC-seq / ChIP-seq等のFASTQまたはメチル化データ、質量分析vendor raw / open format、参照・検索DB / library、version付きsample metadata
  • 出力(期待成果物): peak / methylation table、PSM・peptide・protein group、metabolite feature / annotation、補正前後matrix、ID mapping、QC summary、公開accession
  • 期待ログ: input / output checksum、converter / tool / DB / library release、parameter、FDR / confidence、blank / QC / batch / exclusion、one-to-many / unmapped件数

前へ: トランスクリプトーム解析 目次 次へ: 機械学習・AI応用

演習

  1. PRIDEまたはMetaboLightsの公開accessionを1件選び、metadataだけを用いてもよいので、raw / open format / result / sample metadata、checksum、version、除外条件を対応付けるmanifestを作成せよ。
  2. 同じomics layerの2 toolを、入力、出力、license / 利用条件、OS / container、主な用途、再現性記録の観点で比較せよ。
  3. transcript、protein / peptide、metabolite featureを結ぶmapping tableを設計し、one-to-many、unmapped、ambiguous、annotation releaseの扱いを説明せよ。

具体課題例

  • PXDまたはMTBLS accessionのlanding pageとfile listを調べ、どのfileがraw、変換済み、同定・定量、metadata、補助結果かを分類する。大容量fileのdownloadは必須としない。
  • ProteoWizard / OpenMS / FragPipe / DIA-NN / MaxQuant、またはMZmine / XCMS / MS-DIAL / OpenMSから2つを選び、比較日時と公式URL付きの選定表を作る。
  • gene symbolだけでjoinせず、Ensembl / UniProt / ChEBI等のIDとreleaseを持つmapping例を作り、保持した曖昧性と捨てた情報を記録する。
  • 成果物一式として、manifest、比較表またはmapping table、判断記録、利用した公式出典と確認日を提出する。実データを実行した場合だけcommand、parameter、tool / DB version、log、QC reportを追加する。