「データ墓場」とは|アーカイブが失うのはデータではなく文脈だ

「データ墓場」とは|アーカイブが失うのはデータではなく文脈だ

半年前の実験データ、去年の議事録、前任者が残した報告書。ファイルはちゃんと残っている。開けば数字も文章も読める。それなのに、「これは何のために取ったデータだったか」がどうしても思い出せない。

データが消えたわけではない。むしろ削除もせず、律儀に保存し続けてきた。それなのに、時間が経つほど使い物にならなくなっていく。

この感覚は珍しいものではない。Gartnerの調査では、企業データの60〜73%が分析に使われないまま放置されているという。捨てられていないのに、活用もされていない。この状態は「ダークデータ」と呼ばれる。

この記事では、アーカイブが時間とともに使えなくなっていく構造を、「失われるのはデータではなく文脈である」という視点から整理します。

  • 「ダークデータ」とは何か、なぜ企業データの過半数がそうなるのか
  • データそのものより先に失われる「文脈」の正体
  • 文脈の喪失を防ぐために、保存の時点でできること

ラベルの文字が擦れて読めなくなった古いファイルキャビネットの引き出しが積み重なっている白黒写真

目次

企業データの過半数を占める「ダークデータ」

Gartnerは、活用されず眠ったままの企業データを、天文学でいう「ダークマター」になぞらえて「ダークデータ」と呼んだ。古いファイル、重複データ、放棄されたプロジェクトフォルダ、所有者不明の共有フォルダ。企業データの50%以上、調査によっては60〜73%がこれに該当するとされる。

あたま

数字だけ見ると「そんなに多いのか」と思いますが、自分のPCやクラウドストレージを見返しても、「これ何のフォルダだっけ」というものは意外とあるはずです。

問題の中心は、データの量そのものではない。メタデータ、分類、ガバナンス文脈の欠如だ。説明も、ビジネス上の定義も、所有者情報も、来歴(このデータがどこから来て、何のために作られたか)の情報も無いデータは、それが関連性や信頼性を持つか、安全に使えるかを誰も判断できなくなる。

失われるのはデータではなく、文脈である

ここで見分けておきたいことがある。ダークデータ化した資料は、データが壊れているわけではない。数字は数字のまま、文章は文章のまま残っている。壊れているのは、そのデータの周りにあったはずの文脈だ。

「データが存在すること」と「データが使えること」は別問題だ。時間とともに失われるのは、データそのものではなく、それが何のために、どんな条件で、どんな仮説のもとに取得されたかという文脈である。

時間の経過とともにデータそのものは残るが、目的、条件、仮説といった文脈が失われ「存在するが使えない」状態に近づいていく様子を3段階で示す図

取得した直後は、「実験結果Xがある」という事実に、目的、条件、仮説がすべて紐づいている。取得した本人の記憶の中にあるからだ。しばらく経つと、データ自体は残っていても、目的や条件は記憶頼みになる。さらに長期間放置されると、記憶を持つ本人が異動する、あるいは離職して、「実験結果Xがある」という事実だけが残り、それが何のためのデータだったかは誰にも分からなくなる。

この動きは、物理学の比喩を借りると分かりやすい。データという「状態」は保存されているのに、その状態の意味を決めていた付随情報が時間とともに拡散していく。エントロピーが増大していくように、放っておけば意味は薄まる方向にしか進まない。

忘却との違い

あたま

「忘れる」というと悪いことのように聞こえますが、この文脈喪失は忘却とは別物です。忘却は選んで手放す能動的な処理になりえますが、データ墓場は誰も選んでいない、ただの放置による劣化です。

この違いは軽くない。意図的に手放したものは、必要になれば「あのとき整理した」という記憶がたどれる。だが放置によって文脈を失ったデータは、いつ、なぜ意味を失ったのかという記録すら残らない。

気づいたときには、すでに誰も判断材料を持っていない。文脈の喪失は、失われた瞬間ではなく、必要になって初めて発覚する。

保存の時点で文脈を残す

  • 取得した目的:何を確かめるために、何のために作ったデータか
  • 取得した条件:どんな設定や前提のもとで得られた結果か
  • 関連する仮説や意思決定:このデータがどんな判断の材料になったか
  • 取得日と更新日:今の状況にどこまで通用する情報か

文脈は、データを取得した本人の記憶が新しいうちにしか正確に書けない。後から書き足そうとしても、その頃にはもう文脈自体があいまいになっている。

筆者が運用しているknowledge-wikiでは、記事のfrontmatterにraw_sources(出典)、summary(要約)、date_updated(更新日)を必ず記録する設計にしている。これは検索性を上げる工夫ではなく、後から見返したときに「これは何のために、いつ、何を根拠に書いたか」を復元できるようにするための、文脈保存の仕組みだ。

まとめ

過去のデータが使えなくなっていくのは、データが失われるからではない。データはそこにあり続けるのに、それを取得した目的、条件、仮説という文脈が、時間とともに拡散していくからだ。この劣化は、意図的に手放す忘却とは違い、誰も選んでいない放置の結果として進む。

対処は、後から取り戻すことではなく、保存の時点で文脈を書き残しておくことにある。今保存しようとしているそのデータに、半年後の自分が読んでも分かる説明が添えられているか。それが、データ墓場を作らないための最初の分かれ目になる。

あたま

この記事が役に立てば嬉しいです。よかったら他の記事も見てみてくださいね。

→ このブログを書いている人について

関連記事

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!
個別のご相談を受け付けています

生成AI活用やナレッジ基盤づくりについて、実務経験をもとに個別のご相談を承っています。ご興味があれば覗いてみてください。

note.comでは、実際の構築事例をより詳しく書いた有料記事も公開しています。→ 有料記事のご紹介を見る

この記事を書いた人

本業で生成AIの活用法を研究し、実装・社内への導入推進を担当。属人化しがちなノウハウをどう言語化し、チームの資産にするかに関心があります。このラボでは、ナレッジ・生成AIツール・実践ワークフロー・データサイエンスの4領域で検証したことを記録しています。姉妹サイト「なないろ日和」では育児や暮らしについても書いています。

コメント

コメントする

目次