2026年版出典監査メモ
編集用リソース: このページは 2026-07-19 までに追加・更新した外部出典、公式ドキュメント、一次論文、実装リポジトリの確認状況を記録する監査メモです。読者向けの確定解説ではなく、本文・付録・更新履歴の根拠を確認するための保守用リソースとして扱います。
このメモは、2026年版の本文・付録へ反映した出典、確認日、本文反映先を管理します。将来の更新時は、該当章で文脈、利用条件、制限、公開可否を再確認してから本文へ反映します。
P0外部仕様再確認(確認日: 2026-07-15 JST)
| 対象 | 2026-07-15時点の確認結果 | 主な反映先 | 公式一次情報 |
|---|---|---|---|
| AlphaFold DB prediction API | 旧fieldのsunset日(2026-06-25)が経過。entryId→modelEntityId、uniprotStart→sequenceStart、uniprotEnd→sequenceEnd、uniprotSequence→sequence、isReviewed→isUniProtReviewed、isReferenceProteome→isUniProtReferenceProteome。paeImageUrlは削除対象で、公式案内ではsunset後にAPIから提供・参照不可。 |
第7章、第10章、第14章、付録I | AFDB API breaking changes、API schema |
| Scanpy | PyPI latest confirmed releaseは1.12.2(2026-06-29)。本文ではpatch versionを固定環境の代替にせず、実行環境と依存lockを記録する。 | 第8章、付録H | PyPI Scanpy、scverse packages |
| Ensembl | Ensembl 116 / Ensembl Genomes 63は2026-06-09にリリース済みで、現行サイト・platform上のfinal release。新データは新Ensembl platformへ移行し、既存データはarchiveで参照する。 | 第10章、付録H、付録I | Ensembl 116 release、programmatic access transition |
質量分析オミクス再確認(確認日: 2026-07-17 JST)
| 領域 | 確認した事項 | 主な反映先 | 公式一次情報・一次論文 |
|---|---|---|---|
| mass spectrometry standards / repository | PSIではmzML 1.1.0、mzIdentML 1.3.0、proteomics向けmzTab 1.0、small molecule向けmzTab-M 2.0、mzQC 1.0.0、ProForma 2.1をfinal / current specificationとして確認した。mzTab-M 2.1とion mobility / DIA向けmzML best practiceは提案・draftとしてfinal版と分ける。SDRF-Proteomicsはsample-to-file関係を担い、downstreamのFDR threshold等は別に記録する。PSM / peptide / protein / PTM siteのconfidenceを分け、target-decoyの仮定、shared peptide、metabolite identification levelを記録する。PXD / MTBLS / MSV accessionだけで再現可能とせず、raw、open format、result、metadata、checksum、processing protocol、公開状態をmanifest化する。 |
第6章、付録H、付録K | PSI mzML、mzIdentML、mzTab / mzTab-M、mzQC、ProForma、SDRF-Proteomics、target-decoy / FDR quality、protein inference、metabolite identification confidence、ProteomeXchange guidelines、PRIDE、MetaboLights help、GNPS datasets |
| tool distribution / license / QC | ProteoWizard / msconvert、OpenMS、FragPipe / MSFragger、DIA-NN、MaxQuant、MZmine、XCMS、MS-DIALは、OS / container、input / output、component別のlicense・商用条件が異なる。tool名だけでなくrelease / commit、release channel、citation、container digest、vendor reader、DB / library、parameter、checksumを固定する。SDRF-Proteomicsのsource文書とGitHub release、DIA-NNの公式配布channelとGitHub releaseの版表示は一致しない場合があるため、採用したartifact / URL / 確認日を明記する。MZmineはsource codeのMIT licenseと、配布版・accountに対するtrial / non-profit academic等のuser licenseを分けて確認する。metabolomicsではblank、pooled QC、internal standard、injection order、drift / batch処理、補正前後matrixを分けて記録する。QC-RLSC等の個別手順や閾値はassay / instrument / batch依存であり、万能な固定値として移植しない。 | 第6章、付録H | ProteoWizard msconvert、ProteoWizard license、OpenMS getting started、FragPipe releases、MSFragger、DIA-NN、MaxQuant、MZmine source、MZmine user / license、MZmine blank subtraction、MZmine normalization、XCMS、MS-DIAL tutorial、MS-DIAL repository、Dunn et al. QC-RLSC protocol |
| cross-omics ID / integration | gene / transcript / protein / peptide / compoundはone-to-one対応とは限らない。Ensembl stable IDのversion、UniProt accession / isoform、HGNC / ChEBI等のcurated ID、mapping service、DB release、unmapped / ambiguous件数をmapping tableへ残す。MOFA+ / MEFISTOのfactor、correlation、networkは複数view・group・時間 / 空間構造を探索するが、bad mapping、missingness、交絡を自動解決せず、因果関係や臨床有用性を単独では示さない。 | 第6章、付録K | Ensembl stable IDs、UniProt accession、UniProt ID mapping、HGNC downloads、ChEBI downloads、MOFA+、MOFA2 documentation、MEFISTO |
確認済み事項(確認日: 2026-04-27)
| 領域 | 確認した事項 | 主な反映先 | 出典 |
|---|---|---|---|
| ヒトパンゲノム | HPRC Data Release 2 を初期棚卸し対象として採用した。Release の人数・アセンブリ数は pangenome / reference bias 行、Data Use は HPRC data use 行、章別の本文反映責務は pangenome / population genomics 行で管理する。 |
第1章, 第3章, 第4章, 第9章, 第14章 | HPRC Data Release 2 |
| AlphaFold DB | AlphaFold DB v6 は UniProt 2025_03 と同期し、26 million 超の新規予測構造を追加、合計 241,070,489 predicted protein structures と説明されている。 | 第7章, 第14章, 付録H | PDBe AlphaFold Database release notes |
| Ensembl | Ensembl 116 / Ensembl Genomes 63は2026-06-09にリリース済みで、現行サイト・platform上のfinal releaseである。以後の新データは新Ensembl platformへ移行し、既存データはarchiveで参照する。 | 第10章, 付録I, 付録H | Ensembl Blog: release 116 / Genomes 63 |
確認済み事項(確認日: 2026-04-28)
| 領域 | 確認した事項 | 主な反映先 | 出典 |
|---|---|---|---|
| GRCh38 | GRC FAQ は現行 human reference genome assembly の公式名称を Genome Reference Consortium Human Build 38、略称を GRCh38 と説明している。GRC Human Overview は GRCh38.p14 を latest minor release として示し、GRCh39 の coordinate-changing update は延期中と説明している。 | 第1章, 第3章, 第4章, 第9章, 第14章 | GRC FAQ, GRC Human Overview |
| T2T-CHM13 | NCBI Insights は 2022-04-01 に Science が T2T-CHM13 を first complete sequence of a human genome として発表したこと、NCBI が T2T-CHM13 と GRCh38.p14 間の remap を案内していることを説明している。NCBI Datasets では T2T-CHM13v2.0 を GCA_009914755.4 として確認した。 |
第1章, 第3章, 第4章, 第14章 | NCBI Insights: T2T-CHM13 now available, NCBI Datasets: T2T-CHM13v2.0 |
| pangenome / reference bias | HPRC は GRCh38 linear reference が reference bias を生み、downstream variant discovery、disease association studies、reference-based mapping の精度に影響し得ると説明している。HPRC Data Release 2 は 2025-05-12 発表の pre-publication release で、200人超の配列データと 232 individuals 由来のアセンブリを含むと説明されている。 | 第1章, 第3章, 第4章, 第9章, 第14章 | HPRC, HPRC Data Release 2, HPRC Data Use: Best Practices |
| HPRC data use | HPRC Data Use は Release II の構成要素として >230 samples の DNA sequence data、対応する phased/near-Telomere-to-Telomere assemblies、annotations、graph-based assembly alignments を挙げ、利用時の best practices を説明している。 | 第1章, 第11章, 第14章 | HPRC Data Use: Best Practices |
| JSBi認定試験 | 2026年度試験は CBT 方式、120分、4者択一式、60問と案内されている。第1回受験期間は 2026-07-11〜2026-08-09 予定、第2回は 2026-11-07〜2026-12-06 予定。受験資格は問わず、受験料は6,000円(税込)。出題範囲は生命科学分野、情報科学分野、バイオインフォマティクス分野として整理されている。JSBi は『バイオインフォマティクス入門』を参考図書に掲載し、出版事業ページで公式教科書として案内している。 | 第0章, 付録G | JSBi 2026年度認定試験情報, JSBi 出題範囲, JSBi 参考図書, JSBi 出版事業 |
確認済み事項(確認日: 2026-05-12)
| 領域 | 確認した事項 | 主な反映先 | 出典 |
|---|---|---|---|
| AI / foundation model | AlphaGenome は Google DeepMind の DNA sequence-to-function モデルで、1 Mb の DNA 配列入力、単一塩基分解能の予測、variant effect prediction を扱う。API は非商用利用条件のもと研究用途で提供され、直接の臨床目的には設計・検証されていないと説明されている。 | 第7章, 第14章, 付録F, 付録H | Google DeepMind: AlphaGenome, Nature: AlphaGenome, AlphaGenome research repository, AlphaGenome API repository |
| AI / foundation model | Evo 2 は Arc Institute / NVIDIA / Stanford などによる DNA foundation model で、Nature 2026 論文と公式 repository で、長文脈ゲノム配列の予測・設計支援、公開コード・モデル・データ、計算資源要件が説明されている。生成配列の機能性や安全性は実験的検証の対象として扱う。 | 第7章, 第14章, 付録F, 付録H | Arc Institute: Evo 2, Evo 2 repository, Nature: Evo 2 |
確認済み事項(確認日: 2026-05-13 JST)
この節の各行は、個別に明記がない限り 2026-05-13 JST に確認した事項として扱う。
| 領域 | 確認した事項 | 主な反映先 | 出典 |
|---|---|---|---|
| AI / structure prediction | AlphaFold 3 はタンパク質、核酸、小分子、イオン、修飾残基を含む複合体の joint structure prediction を扱う。AlphaFold Server は非商用利用で、ローカル推論パイプラインのモデルパラメータは Google から直接受領したものに限り、利用条件に従う必要がある。出力は理論モデリング用で、臨床用途には使わない。 | 第7章, 第14章, 付録H | Nature: AlphaFold 3, AlphaFold 3 repository, AlphaFold 3 model parameter terms |
| AlphaFold DB / API | この行は2026-06-05に追加確認した事項を記録する。同日の確認では、AlphaFold DB v6 は UniProt 2025_03 と同期し、Web版は最新モデルのみを提供、旧版はFTPで提供され、prediction API の旧fieldは2026-06-25にsunset予定と案内されていた。2026-07-15の再確認では、その案内上のsunset日が経過した。modelEntityId、sequenceStart、sequenceEnd、sequence、isUniProtReviewed、isUniProtReferenceProteomeが新fieldで、paeImageUrlは削除対象(sunset後はAPIから提供・参照不可)である。 |
第7章, 第10章, 第14章, 付録H, 付録I | PDBe AlphaFold Database release notes, PDBe AFDB API breaking changes |
| AI / variant effect prediction | AlphaMissense は human missense variant の pathogenicity prediction と優先順位づけを支援する。公式 repository は参照実装として提供され、学習済み重みは提供されない。AlphaMissense Database の予測はconfidenceが異なり、臨床用途には検証・承認されていないと説明されている。 | 第7章, 第12章, 第14章, 付録H | Google DeepMind: AlphaMissense publication, AlphaMissense repository |
| AI / foundation model | Nucleotide Transformer は DNA sequence で事前学習した foundation model 群で、Nature Methods 論文では 50M〜2.5B parameters、3,202 human genomes、850 diverse species genomes を用いたモデル群として説明されている。公式 repository は inference code とpre-trained weightsを公開し、モデル別documentation参照を案内している。 | 第7章, 第14章, 付録H | Nature Methods: Nucleotide Transformer, Nucleotide Transformer repository |
| AI / single-cell foundation model | scGPT は single-cell multi-omics の foundation model で、cell type annotation、multi-batch integration、multi-omic integration、perturbation response prediction、gene network inference の支援が説明されている。公式 repository はwhole-human checkpointを既定推奨とし、33 million normal human cellsで事前学習したと説明している。 | 第7章, 第8章, 第14章, 付録H | Nature Methods: scGPT, scGPT repository |
| single-cell / Scanpy | Scanpy 1.12.2 は 2026-06-29 に PyPI へ公開された(1.12.1の公開日は2026-04-10)。scverse は Scanpy を preprocessing、visualization、clustering、trajectory inference、differential expression を含む scalable toolkit と説明している。scanpy.pp.calculate_qc_metrics は総カウント、検出遺伝子数、QC変数(例: mitochondrial genes)割合などを算出する。 |
第8章, 付録H | Scanpy PyPI, scverse packages: Scanpy, Scanpy calculate_qc_metrics |
| single-cell / Seurat v5 | Seurat 公式サイトは Seurat v5 の導入、PBMC 3k tutorial、Visium HD spatial dataset 解析の導線を提供している。PBMC tutorial の nFeature_RNA > 200、nFeature_RNA < 2500、percent.mt < 5 はPBMC例の設定として扱い、他データへ一般化しない。R/Seurat と Python/Scanpy の結果は既定値・データ構造・versionに依存するため、本文では実装・version・入力オブジェクトを記録する。 |
第8章, 付録H | Getting Started with Seurat v5, Seurat PBMC 3K tutorial, Seurat Visium HD vignette |
| single-cell / spatial data model | AnnData は annotated data matrix、MuData は annotated multimodal datasets、SpatialData は spatial omics datasets のFAIR storage formatとPython librariesとして説明されている。SpatialDataはactive developmentでAPI変更の可能性があるため、利用versionの記録が必要。 | 第8章, 第14章, 付録H | AnnData documentation, MuData documentation, SpatialData documentation, Nature Methods: SpatialData |
| spatial / Visium HD | 10x Genomics は Visium HD WT Panel と HD 3’ Gene Expression を single-cell-scale の spatial assay として説明し、HD 3’ は whole transcriptome coverage、2 µm x 2 µm barcoded squares を示している。本文では bin/spot/segmentation/cell label を区別し、画像位置合わせ、Space Ranger version、サンプル条件を記録する。 | 第8章, 第14章, 付録H | 10x Genomics Visium product family, 10x Genomics HD 3’ Gene Expression, 10x Genomics Visium HD user guides |
| single-cell QC | scRNA-seq QCでは、固定閾値だけでなくデータ分布・組織・細胞型・サンプル品質を踏まえた adaptive / data-driven QC が必要と報告されている。本文の max_mito_fraction や max_genes は概念例の入力パラメータであり、固定推奨値として扱わない。 |
第8章 | Genome Biology: data-driven QC, PLOS Computational Biology: miQC |
| privacy / 個人情報保護 | 個人情報保護委員会の通則ガイドラインは、個人情報、要配慮個人情報、個人識別符号、仮名加工情報、匿名加工情報などの用語を区別し、個人データの取扱いではアクセス制御、識別・認証、不正アクセス防止、漏えい防止などの安全管理措置を確認する必要がある。医療・介護Q&Aでは、条件を満たすゲノムデータが個人識別符号に該当し得る例示がある。 | 第11章, 第12章 | PPC: 個人情報保護法ガイドライン(通則編), PPC: 医療・介護関係事業者Q&A, PPC: 仮名加工情報・匿名加工情報編 |
| research ethics / 人を対象とする研究 | 人を対象とする生命科学・医学系研究では、研究計画、同意、倫理審査、個人情報の扱いを研究手順と分けずに管理する。MEXTページでは、旧ヒトゲノム・遺伝子解析研究指針と旧医学系研究指針が統合後の指針施行に伴い 2021-06-30 に廃止されたこと、令和5年改正本文と令和6年4月1日一部改訂ガイダンスが掲載されている。 | 第11章, 第12章, 第13章 | 文部科学省: 人を対象とする生命科学・医学系研究 |
| human data sharing / NBDC | NBDCヒトデータベースは、公的資金由来のヒトに関するデータを広く収集・共有し、研究対象者の権利を可能な限り尊重する原則で運用される。データ提供では同意文書・倫理審査・利用制限、非制限公開/登録者公開/制限公開等の区分、制限公開データの Type I / Type II セキュリティレベル、利用者側IT環境の追加対策を確認する。この行の参照URLは 2026-05-19 JST に再確認・更新した。 | 第11章, 第13章, 付録J | NBDCヒトデータ共有ガイドライン, NBDCヒトデータ取扱いセキュリティガイドライン(データ利用者向け) |
| medical data / 次世代医療基盤法 | 改正次世代医療基盤法は 2023-05-26 公布、2024-04-01 施行と案内され、匿名加工医療情報に加えて仮名加工医療情報の作成・提供、匿名加工医療情報と医療・介護に関する公的データベースとの連結が説明されている。通常の研究解析、院内利用、NBDC利用、個人情報保護法上の仮名加工情報とは適用枠組みを混同しない。この行の参照URLは 2026-05-19 JST に再確認・更新した。 | 第11章, 第12章 | 内閣府: 次世代医療基盤法 概要, 内閣府: 利活用者の方, 内閣府: 1人のデータ、みんなの健康、次世代法 |
| clinical genomics / germline・somatic | ClinVar はヒトの variation と phenotype の関係に関する提出情報と supporting evidence へのアクセスを提供する public archive で、提出内容を独自に curate / modify しない。ClinGen の variant classification guidance は ACMG/AMP criteria を VCEP specifications 等で具体化し、somatic oncogenicity と clinical actionability は pathogenicity classification と分けて扱う。 | 第12章 | NCBI ClinVar: What is ClinVar?, ClinGen Variant Classification Guidance, ClinGen somatic oncogenicity recommendations, ClinGen Actionability |
| clinical genomics / cancer knowledgebase | CIViC は cancer variant の clinical interpretation を共有する open-access, open-source, community-driven knowledgebase と説明されている。OncoKB の FDA recognized human genetic variant database としての扱いは、FDA が認識する Level 2 / Level 3 biomarkers の範囲に限定して扱い、OncoKB / CIViC の evidence level をDB横断で機械的に換算しない。 | 第12章, 第14章 | CIViC documentation: About CIViC, OncoKB: FDA Recognition, OncoKB Therapeutic Levels of Evidence, FDA Recognition of Public Human Genetic Variant Databases |
| clinical genomics / pharmacogenomics | ClinPGxはPharmGKB、CPIC、PharmCATを統合するclinical PGx resource / portalであり、4者を旧称・新称の同義語として扱わない。ClinPGx公式はPharmGKBをcurated evidence / dataの構成要素として現在も列挙し、旧standalone site / URLはClinPGxへ移行した。CPICは入手済みの遺伝子検査結果を薬物療法へ接続するexpert guidelineを作成し、検査実施要否や個別患者の最終処方を単独で決めない。PharmCATはVCF等を処理してCPIC等のsource guidelineに由来するrecommendationを照合・reportするsoftware toolであり、guideline著者ではない。この役割境界と一次情報URLは2026-07-19 JSTに再確認した。 | 第12章 | ClinPGx, ClinPGx / CPIC Guidelines, ClinPGx Blog: Announcing ClinPGx, PharmCAT, PharmCAT Matching Recommendations, FDA Table of Pharmacogenetic Associations |
| clinical genomics / biomarker・CDx | TMB、MSI、HRD、companion diagnostics は、検査法、閾値、腫瘍種、適応、薬剤ラベル、PMA等の識別子と切り離して一般化しない。FDA/NCIの定義・承認情報・companion diagnostics一覧は更新され得るため、研究・教育用サマリでは確認日、検査名、対象疾患、出典を併記する。 | 第12章, 第14章 | NCI: tumor mutational burden, FDA: TMB-H pembrolizumab approval, NCI: MSI, FDA: first tissue/site agnostic indication, FDA: HRD-positive niraparib approval, FDA PMA P190014: myChoice HRD CDx, FDA Companion Diagnostics, FDA List of Cleared or Approved Companion Diagnostic Devices |
| pangenome / population genomics | 2026-04-28 の pangenome / reference bias 行を本文へ反映する際の章別責務を整理する。第3章では graph reference と索引構造の関係、第4章では reference_version、accession、checksum、DB release、解析日の記録、第9章では GWAS/PRS の前提として reference build、liftover/remap、variant representation、checksum、解析バージョンを記録する。第14章ではケーススタディで参照選択、reference build、来歴、利用条件の記録方針を扱う。Release の人数・アセンブリ数・reference bias の一次確認は pangenome / reference bias 行を正とし、この行では重複再掲しない。 |
第3章, 第4章, 第9章, 第14章 | HPRC, HPRC Data Release 2, HPRC Data Use: Best Practices |
| GWAS / PRS metadata | NHGRI-EBI GWAS Catalog は published GWAS results と sample metadata を整理し、PGS Catalog は scoring files、publication source、development/evaluation samples、performance metrics、ancestry description を提供する。sample ancestry は自己申告属性や race/ethnicity の単純な代替ラベルとしてではなく、収集・解析上のメタデータとして扱う。PRS/PGS は discovery cohort と target cohort の ancestry、LD構造、phenotype definition、imputation panel、allele alignment、外部検証に依存するため、研究・教育用サマリでは performance と適用外条件を併記する。 | 第9章, 第12章, 第14章 | GWAS Catalog documentation, PGS Catalog downloads, PGS Catalog ancestry description, Nature Genetics: PRS health disparities |
確認済み事項(確認日: 2026-05-23 JST)
| 領域 | 確認した事項 | 主な反映先 | 出典 |
|---|---|---|---|
| workflow / Nextflow | Nextflow は scalable / portable / reproducible workflows を目的とし、local machine、HPC schedulers、cloud、container runtimes、package managers をまたいで実行できると説明されている。本文では version、profile、executor、container digest、work directory / resume を記録する。 | 第2章, 付録E | Nextflow documentation |
| workflow / Snakemake | Snakemake は report による transparency / data provenance、single core から multicore / clusters / cloud への scale、profiles による設定永続化を案内している。本文では profile、software-deployment-method、入力/出力命名、rerun 条件を記録する。 | 第2章, 付録E | Snakemake |
| workflow / nf-core | nf-core/tools は pipeline download、licenses、RO-Crate、lint、test などの入口を持つ。本文では pipeline release、test profile、offline assets、software license、引用方法を導入前チェックに含める。 | 第2章, 付録E | nf-core/tools |
| environment / Bioconda | Bioconda は biomedical research packages を conda で提供し、現行の推奨 channel 設定として conda-forge / bioconda と strict channel priority を示す。2024年8月に defaults channel が推奨セットから外れた説明があるため、本文では channel order と lock を記録する。 |
第2章, 付録A, 付録E, 付録H | Bioconda Usage |
| DB/API / NCBI Datasets | NCBI Datasets CLI docs は CLI v16+ / API v2 として公開され、datasets と dataformat を command-line tools として扱う。CLI は頻繁に更新され command syntax が変わり得ると説明されている。 |
第10章, 付録I | NCBI Datasets CLI reference, Download and Install |
| DB/API / NCBI E-utilities | NCBI は E-utilities で 3 requests/sec 以下、API key 利用時は default 10 requests/sec、tool/email 登録、History parameter によるバッチ処理を案内している。API key 値は教材・ログに保存しない。 | 第10章, 付録I | EUtilities Usage Guidelines and API Key |
| DB/API / Ensembl REST | Ensembl REST /info/rest は現在の REST API version を返す endpoint で、2026-05-23 の確認では release: 15.10 を返した。実行時は rate-limit headers も保存する。 |
第10章, 付録I | Ensembl REST GET info/rest |
| DB/API / UniProt REST | UniProtKB entry P38398 は 2026-05-23 に BRCA1_HUMAN を返し、response header は X-UniProt-Release: 2026_01 と X-UniProt-Release-Date: 28-January-2026 だった。本文では accession、entry version、reviewed/unreviewed、release header を記録する。 |
第10章, 付録I | UniProtKB REST entry, UniProt API documentation |
| QC / MultiQC | MultiQC は bioinformatics tool outputs の log / console output 等を解析し、複数 samples / analysis steps の結果を summary する reporting tool と説明されている。本文では QC report を最終成果物だけでなく入力・version・ログと紐付ける。 | 第4章, 第5章, 第13章, 付録H | MultiQC overview |
| variant workflow / GATK | GATK4 は germline short variant、somatic short variants、CNV、structural variation 等の Best Practices workflows を提供し、Docker container 利用を推奨している。本文では Best Practices を固定手順として丸写しせず、対象データ、reference、container、tool version、license を記録する。 | 第4章, 付録H | GATK documentation |
今後の更新時に再確認する事項
この節は未完了タスクの一覧ではなく、今後の改訂時に優先して再確認する監査対象を示します。
| 優先度 | 領域 | 確認対象 | 主な反映先 | 確認方針 |
|---|---|---|---|---|
| 高 | ライセンス | 現行サイトとリポジトリの CC BY-NC-SA 4.0 表記、商用利用は別契約であること | 第0章, ライセンスページ | ローカル LICENSE, LICENSE.md, 公開サイトを照合する |
| 高 | コード分類 | 実行検証済み、概念例、疑似コード、抜粋、環境依存 の全章適用状況 |
全章, 付録A, 付録E | scripts/check_codeblock_tags.py と章本文を照合する |
| 高 | single-cell / spatial | Seurat v5、Scanpy、scverse、SpatialData、Visium HD / HD 3’、QC閾値の新規リリース・本文反映状況 | 第8章, 付録H | 確認済み行を基準に、公式ドキュメント・論文・製品ページを継続確認する |
| 高 | 日本の個人情報・研究倫理 | 個人識別符号、要配慮個人情報、NBDCヒトデータベース、次世代医療基盤法の新規改正・本文反映状況 | 第11章, 第12章 | 確認済み行を基準に、PPC、NBDC、文部科学省、厚生労働省、内閣府等の一次情報を継続確認する |
| 高 | 臨床ゲノム | ACMG/AMP、AMP/ASCO/CAP、ClinGen、ClinVar、CIViC、OncoKB、CPIC、ClinPGx、PharmCAT、TMB/MSI/HRD/CDx の新規改訂・本文反映状況 | 第12章, 第14章 | 確認済み行を基準に、公式ガイドライン、DB公式ページ、FDA/NCI等の一次情報を継続確認する |
| 高 | pangenome / GWAS / PRS | HPRC、GRCh38/T2T/pangenome、GWAS Catalog、PGS Catalog、PRS transferability、ancestry metadata の新規改訂・本文反映状況 | 第3章, 第4章, 第9章, 第14章 | 確認済み行を基準に、公式ページ、カタログdocumentation、一次論文を継続確認する |
| 中 | AI / foundation model | AlphaFold 3、AlphaFold Server、AlphaFold DB、AlphaGenome、Evo 2、Nucleotide Transformer、scGPT、AlphaMissense の新規リリース・利用条件・本文反映状況 | 第7章, 第14章, 付録F, 付録H | 確認済み行を基準に、公式ページ、論文、利用規約を継続確認する |
| 中 | ワークフロー | Nextflow、Snakemake、nf-core、GATK Best Practices、MultiQC、Docker、Apptainer、Bioconda、uv | 第2章, 第4章, 第5章, 付録A, 付録E | 公式ドキュメントでバージョン、利用条件、実行例を確認する |
| 中 | DB/API | NCBI Datasets CLI、Entrez / E-utilities、Ensembl REST / BioMart、UniProt API、GENCODE、RefSeq、GA4GH refget / htsget / Beacon | 第10章, 付録I, 付録H | API仕様、rate limit、ライセンス、取得例を確認する |
| 中 | アクセッション | SRR11140744, MN908947.3, TCGA-LUAD の取得可否、参照配列、利用条件 |
第4章, 第5章, 第10章, 第14章, 付録J | SRA、NCBI Nucleotide、GDC等で確認する |
初期構成監査(ローカル確認日: 2026-04-27)
| 項目 | 現状 | 改稿上の扱い |
|---|---|---|
| 公開サイトソース | docs/ が Jekyll build の主対象。GitHub Actions も docs を検査対象にしている。root _data/navigation.yml は公開正本ではないが、将来の再利用時に旧 part1/part2 導線を戻さないよう docs/_data/navigation.yml と同期済み。docs/root/template 側の breadcrumb・navigation・fallback・footer・index も、旧 /introduction/ ではなく canonical /chapters/chapter-introduction/ を参照する。 |
章改稿は docs/ を優先し、必要に応じて manuscript/ と同期する。ナビゲーション編集時は docs/_data/navigation.yml を正本とし、root 側テンプレートは追随させる。 |
| 章構成 | docs/chapters/chapter-introduction と第1章〜第14章が存在する。 |
2026年版改稿時の章テンプレートを段階適用する。 |
| 付録構成 | 付録A〜Kと付録I-1〜I-5が存在する。 | 付録Iはレシピ集化、ExACの歴史的位置づけ、API運用説明を優先する。 |
| コードブロック | docs/ の fenced code block は既存スクリプトで全件ラベル付き。manuscript/ には未ラベルの code block が多数残る。 |
docs/ の新ラベル移行後、manuscript/ の同期方針を決める。 |
| 表記ゆれ | docs/appendices/appendix-i/index.md に残っていた非推奨表記は解消済み。現行の docs/ と manuscript/ では「ベストプラクティス」表記を使う。 |
今後の追記でも「ベストプラクティス」に統一し、旧表記を再導入しない。 |
| single-cell QC | 第8章の概念例に固定除外値が残っていた。 | データセット依存の閾値として説明し、固定値の機械的流用を避ける。 |
| 旧第5章URL | docs/chapters/part2/chapter05/ の旧構成由来の第5章重複本文と client-side-only redirect stub は公開対象から削除済み。旧URLは公開アーティファクトに生成せず 404/410 とする。現行の正本は docs/chapters/chapter-5/index.md と manuscript/chapter-5/index.md。 |
以後の第5章改稿は canonical な docs/chapters/chapter-5/ と manuscript/chapter-5/ に集約し、docs/chapters/part2/ 配下に旧本文を再導入しない。scripts/check_legacy_routes.py で旧URLの source / built artifact が存在しないことを確認する。 |
本文反映時の記録単位
各章を改稿したら、次の形式で本メモへ追記します。
| 章・付録 | 反映した更新 | 出典 | 確認日 | 残課題 |
|---|---|---|---|---|
| 例: 第8章 | QC閾値を固定値からデータセット依存の説明へ変更 | 公式ドキュメントまたは論文 | YYYY-MM-DD | 実行例の tiny data 化 |
| 第2章 | HPC/クラウド/コンテナ/ワークフロー/CI を章テンプレートへ再構成し、SHIROKANE 等の固定性能値を本文から外して、公式情報・ジョブログ・確認日を利用時に記録する方針へ変更した。 | docs/appendices/appendix-a/, docs/appendices/appendix-e/, workflow 行 |
2026-05-12 | 実行検証済み tiny data smoke は CI と付録A/Eに集約。第4章・第5章の具体pipeline説明で継続参照する。 |
確認済み事項(確認日: 2026-06-05 JST)
| 領域 | 確認した事項 | 主な反映先 | 出典 |
|---|---|---|---|
| AI / structure foundation models | AlphaFold 3 はタンパク質、核酸、小分子、イオン、修飾を含む複合体構造予測を扱い、pLDDT / PAE 等の信頼度を併記する。Chai-1 はタンパク質、小分子、DNA/RNA、glycosylation 等を統一的に扱う構造予測モデルとして公開され、Boltz は複合体構造と binding affinity 関連出力を扱う。RoseTTAFold All-Atom はタンパク質、核酸、小分子、共有結合、金属を扱うが、SignalP等の外部ライセンスとモデル重みを確認する。いずれも臨床判断に直接使わない。 | 第7章, 付録F, 付録H, 付録K | Nature: AlphaFold 3, AlphaFold 3 repository, Chai-1 repository, Boltz repository, Science: RoseTTAFold All-Atom, RoseTTAFold All-Atom repository |
| AI / genome sequence foundation models | AlphaGenome、Evo 2、Nucleotide Transformer は DNA sequence を入力に、functional track、variant score、embedding、生成/順位づけ配列などを出す。reference build、species/context、入力長、variant class、training data overlap、非商用/商用条件、既知DBや単純 baseline との比較を記録し、variant effect prediction を臨床判断に直接使わない。 | 第7章, 付録F, 付録H, 付録K | Nature: AlphaGenome, AlphaGenome API repository, Nature: Evo 2, Evo 2 repository, Nature Methods: Nucleotide Transformer, Nucleotide Transformer repository |
| AI / single-cell foundation model evaluation | scGPT、Geneformer、Nicheformer は expression matrix、gene rank、batch/donor/tissue/species、必要に応じて spatial context を入力し、embedding、annotation、integration、perturbation response、spatial label/composition prediction を支援する。donor/tissue/species split、training data overlap、model card、データ持ち出し、臨床利用可否を確認する。Nature Methods の perturbation benchmark は深層学習系が単純 linear baseline を上回らない場合を示しており、単純 baseline と外部データで評価する。 | 第7章, 第8章, 付録F, 付録H, 付録K | Nature Methods: scGPT, scGPT repository, Geneformer model card, Nature Methods: Nicheformer, Nature Methods: perturbation baseline |
| clinical interoperability / data standards | GA4GH VRS v2.0 は variant evidence を sequence collection 間で統合しやすくする標準化された computational representation として扱い、clinical classification とは分ける。GA4GH Beacon v2 は genomic / phenotypic / clinical data の discovery API であり、問い合わせ先や data use conditions を示しても取得許可そのものではない。HL7 FHIR Genomics Reporting IG 4.0.0-ballot は genomic report の data structure に焦点を当て、検査依頼・解析・承認・配信 workflow は対象外と明記している。ClinVar は germline、somatic clinical impact、somatic oncogenicity の3分類を分け、CPIC / ClinPGx は入手済み PGx 結果を prescribing guidance へ接続する。NBDC controlled-access data は利用者・目的・セキュリティ・再配布禁止等を承認条件として扱うため、本書では未承認の公開 LLM / 外部 SaaS / 個人端末へ投入しない運用原則とする。 | 第11章, 第12章, 付録H, 付録K | GA4GH VRS product, GA4GH VRS v2.0 announcement, GA4GH Beacon API, Beacon v2 documentation, HL7 FHIR Genomics Reporting IG, HL7 genomics-reporting repository, NCBI ClinVar classification documentation, ClinVar NAR 2025 update, CPIC, ClinPGx CPIC, NBDC Human Data Sharing Guidelines, NBDC data use |
| DB/API release tracking | AlphaFold DB v6 は UniProt 2025_03 と同期し、prediction API は旧 field の sunset 済みを示している。Ensembl は current APIs / public MySQL の final update を e!116 とし、新 platform では GraphQL / RefGet 等へ移行する案内と public MySQL の MySQL 8 移行案内を出している。ClinVar は germline、somatic clinical impact、somatic oncogenicity の分類を分けて扱う。DDBJ / NBDC / jMorp の国内DB・ヒトデータ基盤では、サービス種別、access level、利用条件、dataset ID、取得日を記録対象にする。 | 第10章, 付録I | PDBe AlphaFold Database release notes, PDBe AFDB API breaking changes, Ensembl programmatic access transition, Ensembl MySQL 8 upgrade notice, NCBI ClinVar classification documentation, DDBJ Center Services, NBDC Human Data Sharing Guidelines, jMorp User Guide |
| reference genome / pangenome selection | GRCh38.p14 は GRC の latest minor release として coordinate stability を重視する既存互換性の基準、T2T-CHM13v2.0 は gapless / repeat 領域研究用の補完的参照、HPRC Release 2 は 200人超・232 individuals の assemblies と graph-based alignments を含む pre-publication pangenome resource として扱う。GFA は graph 構造、GAF は graph alignment を表すため、VCFへ射影した結果と同一視しない。 | 第4章, 第9章, 付録J | GRC Human Overview, NCBI T2T-CHM13, HPRC Data Release 2, HPRC release timeline, GFA specification, minigraph GAF/rGFA docs |
| long-read WGS / RNA-seq workflows | minimap2 は PacBio / ONT genomic reads と Iso-Seq / cDNA / direct RNA の splice-aware alignment に対応し、pbmm2 は PacBio native formats 向け minimap2 wrapper として扱う。Long-read WGS では raw read QC、alignment、coverage、small variant、SV、phasing、annotation、provenance を分け、DeepVariant / Clair3 は model、Sniffles2 / pbsv / cuteSV は SV support/filter、WhatsHap は sample name と phase set を固定する。LRGASP 2024 は long-read RNA-seq で transcript identification と quantification を分け、長く精度の高い read は transcript 同定、read depth は定量、well-annotated genome では reference-based tools が有利という傾向を示す。RNA velocity は model assumption と uncertainty を伴う仮説生成として扱い、veloVI のように posterior velocity uncertainty を扱うモデル例も UMAP 上の矢印を分化経路の証明としては読まない。 | 第4章, 第5章, 付録H | minimap2, pbmm2, mosdepth, DeepVariant, Clair3, Sniffles2, pbsv, cuteSV, WhatsHap, LRGASP long-read RNA-seq assessment, IsoQuant, FLAIR, bambu, Clair3-RNA, scVelo, Nature Methods: veloVI |
| metagenomics / pathogen genomics case study | Nextclade は viral genome alignment、mutation calling、clade assignment、quality checks、phylogenetic placement を行う open-source project として説明されている。Nextstrain は pathogen evolution と epidemic spread の解析・可視化基盤であり、tree と metadata は感染経路の証明ではなく疫学・サンプリング文脈と併せて読む。AMRFinderPlus は assembled nucleotide sequence / protein annotation から AMR genes、resistance-associated point mutations、selected stress / virulence genes を同定するが、phenotypic susceptibility や治療判断を保証しない。GTDB は genome phylogeny に基づく standardized microbial taxonomy、GTDB-Tk は bacterial / archaeal genomes の taxonomy assignment、MetaPhlAn 4 は metagenomic shotgun data の species-level microbial profiling として扱う。公開メタデータは GISAID / INSDC / NCBI 等の利用条件、国・機関の報告ルール、再識別・風評リスクを確認する。 | 第4章, 第9章, 第10章, 第14章, 付録H, 付録J | Nextclade documentation, Nextstrain documentation, NCBI AMRFinderPlus, AMRFinderPlus repository, GTDB, GTDB R232 statistics, GTDB-Tk repository, Nature Biotechnology: MetaPhlAn 4, MetaPhlAn repository, GISAID Terms of Use, INSDC policy principles, NCBI Website and Data Usage Policies |
| spatial omics / SpatialData data model | SpatialData は FAIR storage format と Python libraries による spatial omics 用データフレームワークで、Images、Labels、Points、Shapes、Tables と coordinate transformations を束ねる。spatialdata-io は Visium、Visium HD、Xenium、CosMx、MERSCOPE / MERFISH、Akoya PhenoCycler(formerly CODEX)、Stereo-seq などの reader を提供するが、community-maintained で format 更新に追随するため reader version と入力 checksum を記録する。Visium HD は 2 µm x 2 µm barcoded squares を扱うため bin / spot / cell を混同しない。Seurat v5 は sequencing-based と imaging-based spatial data の導入例を提供し、Nature Methods は spatial proteomics を 2024 Method of the Year として位置づけている。 | 第8章, 付録F, 付録H | SpatialData documentation, SpatialData object API, Nature Methods: SpatialData, spatialdata-io readers, 10x Genomics Visium Spatial Assays, Seurat v5 spatial vignettes, Nature Methods: Method of the Year 2024 spatial proteomics |
機械判定用の鮮度レジストリ
一次情報の確認日と再確認期限は、source-freshness.json に機械可読形式で記録しています。make source-freshness は期限、重複ID、対象パスを検証し、ネットワーク障害による一時的な取得失敗とは分離して扱います。