Research

データレイク研究開発センター

生成AI時代の高度なデータ管理の実現

ChatGPTの登場以来、生成AIは社会の在り方に多大な影響を及ぼしており、業務効率化に加えて科学研究やイノベーションの加速も期待されています。高度な目的、専門的な用途への生成AI適用においては、ベースとなるAIモデルに種々のドメインデータを与え、より洗練されたAIモデルを構築していくことが求められます。本センターでは、複数の機関が相互に固有のデータやAIモデルを利活用する生成AI時代に向け、多様な学習データとAIモデルを来歴や利用条件とともに統合的に管理するデータ基盤の構築に取り組みます。

AIモデルおよび学習データの統合管理とセキュアな利用環境の提供

データレイクは、数値・文字列等の構造化データ、文書・画像等の非構造化データを一元的に格納するデータ基盤のアーキテクチャであり、探索的で柔軟なデータ分析を可能にします。本センターのデータ基盤は、データを学習したAIモデルも管理の対象に加え、学習データの追加・更新や学習手法の改良によるAIモデルの継続的な高度化、学習データの遡及によるAIモデルの挙動解析等のための研究開発基盤を提供します。主な取り組みは以下のとおりです。

  • 多様な学習データを継続的に収集して来歴・利用権を管理するとともに、遡及的検索のためのベクトル索引を構築
  • AIモデルのバージョン毎に学習データおよび学習過程を含めた来歴情報を管理する高度なAIモデル運用手法を確立
  • 高度なセキュリティを有する堅牢なシステムを構築し、大学共同利用機関として様々な最先端研究分野へ安全な利用環境を提供
  • データ収集・利活用における個人情報保護法、著作権法等の法的課題、および生命倫理等の社会倫理的課題を洗い出し、学習データ・AIモデルの管理手法に反映

医療用LLM/LMMの研究開発を促進する医療データ基盤の構築・運用

我が国の医療分野では、研究促進等の学術的観点と、適正な医療技術提供等の社会的観点から、医療データの共有および生成AIの利活用が求められています。本センターでは医療分野向けにデータ基盤を具現化し、SIP第3期「統合型ヘルスケアシステムの構築」に参画して医療データ基盤(図)の構築および運用を実施しています。10ペタバイトのストレージを有する大規模医療データ基盤と、大規模医療LLM/LMMモデル管理機構を実装するとともに、臨床医療データ、医学知識ベース、大規模日本語ウェブデータ等からなる学習用データの系統的収集を行っています。また、医療データガバナンスDBを用いた医療データおよび医療LLM/LMMの適正利用管理に取り組んでいます。

図 医療用LLM/LMMの研究開発を促進する医療データ基盤

メンバー

田村 孝之
センター長、特任教授
中野 美由紀
理事
合田 憲人
教授
高倉 弘喜
教授
林 正和
特任研究員
松井 勇佑
特任研究員

2024年度 研究成果

2025年4月30日 SIP第3期「統合型ヘルスケアシステムの構築における生成AIの活用」公開シンポジウム
「テーマ4:医療データ・医療LLM/LMMの利活⽤を促進する医療データ基盤」成果報告
シンポジウムについての情報(外部リンク:国立健康危機管理研究機構(JIHS)のページ)
テーマ4 医療データ基盤の構築と運用手法の検討 ELSI 実務家チーム 報告書
はじめに
第1部 Executive Summary – Society 5.0 に向けた医療生成AIの課題
第2部 ELSI 研究会報告