このページの内容

Awesome BioIE Logo

BioIE Logoを扱う資料や関連プロジェクトをまとめたAwesomeリストです。

目次

研究概観

生物医学IEのLLM

LLM以前の概観

先頭へ戻る

活動中の研究グループ

先頭へ戻る

組織

  • AMIA - 生物医学情報学研究者の多く(全員ではありません)がAmerican Medical Informatics Association会員。学術誌JAMIAを発行。
  • IMIA - International Medical Informatics Association。IMIA Yearbook of Medical Informaticsを発行。

先頭へ戻る

学術誌とイベント

BioIEは学際的であり、研究者はさまざまな方法で成果・Toolを共有します。生物医学・Life Scienceでは一般的な学術誌論文、Computer Science・Engineeringでは一般的なConference Paperと採択後のPoster/口頭発表などです。Conference PaperはProceedingsとしてまとめられることが多く、Preprintも次第に一般化し機関に受容されています。これらの正式な成果物を取り巻くのがOpen Science、Open Data、Open Sourceであり、BioIE研究者が作るCode、Data、SoftwareはCommunityの重要資料です。

学術誌

PreprintはarXivのComputation and Language(cs.CL)/Information Retrieval(cs.IR)、bioRxivmedRxivのHealth Informaticsなどを試してください。

  • Database - 副題は「The Journal of Biological Databases and Curation」。Open Access。
  • NAR - Nucleic Acids Research。幅広いBiomolecular領域を扱い、年次Database Issueで特に著名。
  • JAMIA - Journal of the American Medical Informatics Association。臨床Care/Research、Translational/Implementation Science、Imaging、教育、Consumer Health、Public Health、Policyを扱います。
  • JBI - Journal of Biomedical Informatics。既定ではOpen AccessではありませんがOpen Accessの「X」版があります。
  • Scientific Data - 科学的価値のあるデータセットの説明と、科学データの共有・再利用を進める研究を掲載するSpringer NatureのOpen Access誌。

カンファレンスなど

  • ACM-BCB - ACM Conference on Bioinformatics, Computational Biology, and Health Informatics。2010年から毎年開催。
  • BIBM - IEEE International Conference on Bioinformatics and Biomedicine。
  • ISMB - International Society for Computational Biologyが1993年から毎年開催するInternational Conference on Intelligent Systems for Molecular Biology。臨床を明示せずBioinformatics/Computational Biologyを主に扱いますが、Text Miningも増加。2019年にはText Mining for Biology and Healthcareの終日特別Sessionを開催。奇数年はEuropean Conference on Computational Biology(ECCB)と合同。
  • PSB - Pacific Symposium on Biocomputing。

Challenge

BioIEの一部イベントは、与えられたデータセットへ各Groupが計算的Solutionを開発する正式Task/Challengeを中心に構成されます。

先頭へ戻る

チュートリアル

分野の変化が速く、数年以上前のチュートリアルには重要な詳細が欠けます。比較的新しい教育資料を以下に示します。Text Mining技法の基礎理解とPython/Rの基礎経験が有用で、実践しながら学ぶのが最善かもしれません。

LLMガイド

未定—今後の更新をお待ちください。

LLM以前のガイド、講義、講座

先頭へ戻る

Code Library

  • Biopython - 論文 - コード - 主にBioinformatics/Computational Molecular Biology向けPython Tool。PubMed文書・Abstractを含むデータ取得にも便利(Documentation第9章参照)。
  • Bio-SCoRes - 論文 - 生物医学Coreference Resolution Framework。
  • medaCy - 予測的医療NLP Model構築System。spaCy Framework上に構築。
  • ScispaCy - 論文 - 科学・生物医学文書向けspaCy Framework。
  • rentrez - PubMedを含むNCBI ResourceへAccessするR Utility。
  • Med7 - 論文 - コード - 薬剤関連ConceptのNERを行うspaCy向けPython Package/Model。

特定データセットのリポジトリ

先頭へ戻る

Tool、Platform、Service

  • cTAKES - 論文 - コード - 電子Medical Recordのテキスト処理System。広く利用されるOpen Source。
  • CLAMP - 論文 - 臨床Reportのテキスト向けNLP Toolkit。まずLive Demoで動作を確認できます。学術研究では無料利用可。
  • DeepPhe - Cancer Presentationを記述した文書の処理System。cTAKESベース。
  • DNorm - 論文 - 疾患名・略語への言及を一意Concept IDへLinkするDisease Normalization手法。Download版はNCBI Disease CorpusとBC5CDR(下記)を同梱。
  • II-Commons - PubMed/PMC、arXiv、対応US Policy Corpusを対象に、決定的で日次更新の検索、Metadata Lookup、全文Markdown取得を行うNode.js CLI/Agent Skill。
  • PubTator Central - 論文 - PubMed記事・PubMed Central全文から5種類の生物医学Conceptを識別するWeb Platform。全Annotation SetをDownload可能です(下記の注釈付きテキストデータを参照)。
  • Pubrunner - PubMedの最新Document SetへText Mining Toolを実行するFramework。
  • SemEHR - 論文 - EHR向けIE Infrastructure。CogStack Project上に構築。
  • TaggerOne - 論文 - Concept Normalizationを実行。特定Concept Type向けに学習でき、ほかのNormalization機能から独立してNERも実行可能。
  • TabInOut - 論文 - 文献中の表からIEを行うFramework。

Annotation Tool

  • Anafora - 論文 - Adjudicationと進捗追跡を備えるAnnotation Tool。
  • brat - 論文 - コード - brat Rapid Annotation Tool。Browserで視覚的にText Annotationを作成。分野非依存で多様なProjectに適し、可視化はstav Toolを基盤とします。
  • MedTator - 論文 - コード - 依存関係を最小限にしたAnnotation Tool。

先頭へ戻る

技法とモデル

Large Language Model

未定—今後の更新をお待ちください。

BERTモデル

GPT-2モデル

  • BioGPT - 論文 - 1,500万PubMed Abstractで事前学習し、複数の生物医学TaskへFine-TuneしたGPT-2 Model。

その他のモデル

  • PubMedのFlair Embedding - Flair Framework/Embedding Methodから利用できるLanguage Model。2015年までのPubMed Abstract 5% Sample、合計120万超で学習。

Text Embedding

  • Mayo ClinicのHongfang Liu Groupによる論文は、生物医学・臨床Textで学習したEmbeddingが生物医学NLP Taskで常にではないものの高性能になり得ることを示します。分野固有Embeddingの学習は計算量が多いため、事前学習済みEmbeddingが適する場合があります。
  • BioASQword2vec - 論文 - 人気のword2vec Toolで1,000万超のPubMed Abstractから得た生物医学TextのWord Embedding。
  • BioWordVec - 論文 - コード - 2,700万超のPubMed Title/Abstractから得たWord Embedding。MeSHベースのSubword Embedding Modelを含みます。

先頭へ戻る

データセット

以下の一部データセットはAccessにUMLS Terminology Services(UTS)Accountが必要です。UTS AccountのLicenseではUMLS Resource利用に関する年次Report提出が必要ですが、見た目ほど難しくありません。

生物医学テキスト情報源

以下は生物医学科学の索引付きText Documentを含みます。

  • OHSUMED - 論文 - 1987〜1991年のMEDLINE Entry 348,566件(Title、場合によりAbstract)。MeSH Labelを含み、主に歴史的意義があります。
  • PubMed Central Open Access Subset - 従来のCopyright以外のLicenseで使えるPubMed Central記事集。正確なLicenseは出版物・情報源ごとに異なり、PDF/XMLで利用可能。
  • CORD-19 - COVID-19に関する学術原稿Corpus。主にPubMed CentralとPreprint Server由来で、全文のない論文Metadataも含みます。

注釈付きテキストデータ

  • SPL-ADR-200db - 論文 - FDA承認薬200種の既知有害反応約5,000件について標準化情報とText内出現Annotationを含むPilot Dataset。
  • BioCreAtIvE 1 - 論文 - Protein/Gene Nameを注釈した15,000文(学習10,000・Test 5,000)。Protein Name/Gene Ontology Termを注釈した生物医学研究全文1,000件。
  • BioCreAtIvE 2 - 論文 - Protein/Gene Nameを注釈した別の15,000文、EntrezGene IDへLinkしたAbstract 542件、Protein間相互作用の特徴を注釈した各種論文。
  • BioCreAtIvE V CDR Task Corpus(BC5CDR) - 論文 - 2014年以降の1,500記事(Title/Abstract)。Chemical 4,409、Disease 5,818、Chemical–Disease Interaction 3,116を注釈。登録必須。
  • BioCreative VI CHEMPROT Corpus - 論文 - 多様なRelation TypeのChemical–Protein Interactionを注釈した2,400超の記事。登録必須。
  • CRAFT - 論文 - Concept/Coreferenceなどを多様に注釈した生物医学全文67件。現在Version 5で、MONDO Disease OntologyへのConcept Linkを含みます。
  • n2c2(旧i2b2)Data - Harvard Medical School DBMIが、2006年からのNational NLP Clinical Challenges/Informatics for Integrating Biology and the BedsideのDataを管理。Access/利用前に登録必須。個別説明はData Challenge一覧を参照。
  • NCBI Disease Corpus - 論文 - Disease NameとMeSH/OMIMの関連Conceptを注釈した生物医学Abstract 793件。
  • PubTator Central datasets - 論文 - RESTful API/FTP DownloadでAccess可能。2,900万超のAbstractと約300万の全文DocumentのAnnotationを収録。
  • Word Sense Disambiguation(WSD) - 論文 - 曖昧語203語と、生物医学研究出版物から自動抽出した用例37,888件。UTS Account必須。
  • Clinical Questions Collection - CQC/Iowa Collectionとも呼ばれ、診療中に医師が出した数千の質問と回答を収録。
  • BioNLP ST 2013 datasets - 6つのShared TaskのData。一部はAccessしにくい可能性があります。広範なEntity/Event AnnotationにはCG Task Set(BioNLP2013CG)を試してください。
  • BioScope - 論文 - 医学・生物学文書の文にNegation、Speculation、Linguistic Scopeを注釈したCorpus。
  • BioRED - 論文 - 6,500超の生物医学Relation Annotationと新規知見Label。

タンパク質間相互作用注釈Corpus

Protein–Protein InteractionはPPIと略します。以下はBioC形式で利用できます。古いSet(AIMed、BioInfer、HPRD50、IEPA、LLL)はWBI Corpora Repository提供で、Turku UniversityのGroupが原Setから派生させました。

  • AIMed - 論文 - PPIを注釈したMEDLINE Abstract 225件。
  • BioC-BioGRID - 論文 - PPI/Genetic Interactionを注釈した全文120件。BioCreative V BioC Taskで使用。
  • BioInfer - 論文 - PPIを含む関係、Named Entity、Syntactic Dependencyを注釈した生物医学Abstract 1,100文。追加情報・Download
  • HPRD50 - 論文 - Human Protein Reference Databaseが参照する科学Abstract 50件へPPIを注釈。
  • IEPA - 論文 - Proteinを含む共起Chemical Pairを注釈した生物医学Abstract 486文(したがってPPI Annotationを含む)。
  • LLL - 論文 - 細菌_Bacillus subtilis_に関する論文77文へProtein–Gene Interactionを注釈(PPIに近い)。追加情報

その他のデータセット

  • Columbia Open Health Data - 論文 - EHRから抽出したCondition、Drug、Procedure、Patient Demographicsの有病率・共起頻度DB。元Record Textは含みません。
  • Comparative Toxicogenomics Database - 論文 - Chemical、Gene Product、Phenotype、Disease、Environmental Exposure間の人手Curation Association DB。Chemical Typeなど関連Concept Ontologyの組み立てに有用。
  • MIMIC-III - 論文 - ICU入院約6万件のDeidentified Health Data。利用前にOnline Training(CITI Training)完了とData Use Agreement同意が必要。
  • MIMIC-CXR - MIMIC Chest X-Ray DB。377,000超のRadiographic Imageと付随する自由記述Radiology Report。MIMIC-III同様、Data Use Agreement同意が必要。
  • UMLS Knowledge Sources - Reference Manual - 生物医学用語・IdentifierとTool/Scriptの大規模で包括的なCollection。目的によってはUMLS Metathesaurus全Conceptの一意ID/Nameを含むMRCONSO.RRFだけで十分です。下のOntology/統制語彙も参照。
  • MIMIC-IV - MIMIC-IIIのMultimodal Patient Data更新版。より新しい入院年、新Data Structure、救急部記録、MIMIC-CXR ImageへのLinkを追加。
  • eICU Collaborative Research Database - 論文 - 一貫した構造を持つICU入院20万超の観察DB。登録、Training完了、Data Use Agreementが必要。

先頭へ戻る

Ontologyと統制語彙

  • Disease Ontology - 論文 - 人の疾患Ontology。MeSH、ICD、NCI Thesaurus、SNOMED、OMIMへのCross-Linkを持つPublic Domain。GitHubOBO Foundryで利用可能。
  • RxNorm - 論文 - Clinical Drug/Drug Packの正規化Name。成分、Strength、Form、Semantic Network由来Typeを組み合わせ、毎月Release。
  • SPECIALIST Lexicon - 論文 - 多数の生物医学用語を含む一般英語Lexicon。1994年から年次更新され、2019年時点でも更新中。UMLSの一部ですがDownloadにUTS Account不要。
  • UMLS Metathesaurus - 論文 - 380万超Concept、1,400万Concept Name、200超の生物医学語彙・Identifier Source間のMapping。巨大です。MetamorphoSys Installation ToolでSubsetを準備できますが、2019 Releaseでも約30GB必要。Manual。UTS Account必須。
  • UMLS Semantic Network - 論文 - 生物医学Concept/語彙を扱う133 Semantic Typeと54 Semantic Relationshipの一覧。Metathesaurusが複雑すぎる場合に試せます。DownloadにUTS Account不要。

先頭へ戻る

Data Model

Data Modelが必要ですか?生物医学Dataを扱うなら、おそらく答えは「はい」です。

  • Biolink - コード - 生物EntityのData Model。YAML Fileとして提供。
  • BioUML - 論文 - 生物医学Dataの分析、統合、可視化Architecture。視覚Modeling Language UMLを概念的基盤とします。
  • OMOP Common Data Model - 観察医療Dataの標準。
  • unmiri-ngs-fhir-schema - Vendor横断の体細胞NGS解釈出力(Foundation Medicine、Tempus、Caris、Guardant)向けApache-2.0 JSON Schema(Draft 2020-12)API Contract。HL7 FHIR Genomics IGに準拠し、Oncology Lab Reportを解析する生物医学情報抽出Pipelineの標準準拠Target Representationです。

先頭へ戻る

クレジット

Curatorと情報源のクレジット

ライセンス

CC0

ライセンス