Raw HTMLを保存する理由|未来の自分へ残す、やり直しの保険

Raw HTMLを保存し、競艇データベースへ再展開する流れ データベース構築

Raw HTMLは、未来の自分へ残す「やり直しの保険」である。
今すぐ中身を理解できなくても構わない。元データさえ残っていれば、データベースも分析方法も、あとから何度でも作り直せる。

📱 スマホで読めます  💻 PC推奨

競艇ソフトを作り始めると、出走表・直前情報・結果・オッズを、できるだけ早くExcelやデータベースへ整理したくなる。

きれいな表が完成すると、データを集めた実感も得られる。しかし、完成した表だけを残して元のHTMLを捨ててしまうと、数か月後、数年後の修正が難しくなる。

私自身、データベースを作り続ける中で何度も仕様を変更してきた。その経験から、先に結論を述べる。

データはRaw HTMLから展開する。

加工前の元データを残し、必要な形へ何度でも作り直せるようにする。

Raw HTMLとは何か

Rawとは「加工していない、生の状態」という意味である。ここでいうRaw HTMLは、競艇オフィシャルサイトのページを構成しているHTMLを、加工前のまま保存したファイルを指す。

HTMLをメモ帳などで開くと、英字や記号が大量に並んでいる。人間が普段見るWeb画面とは、まったく違うものに見えるかもしれない。

しかし、その中には画面に表示されている選手情報、展示タイム、気象情報、進入、結果などの元になる情報が含まれている。

見た目は読みにくくても、競艇ソフトにとっては貴重な原石である。

なぜ加工済みデータだけでは足りないのか

最初に作ったデータベースが、そのまま最後まで完成形であり続けることはほとんどない。

  • あとから必要な項目が増える
  • 保存形式を変更したくなる
  • 一部の条件だけ取得ミスが見つかる
  • 別のロジック用にデータを作り直したくなる
  • ExcelからDuckDBやParquetへ移行したくなる

加工済みのExcelファイルしか残っていなければ、そこに存在しない項目は復元できない。取得ミスが加工時に起きたのか、元ページに存在しなかったのかも判断しにくい。

Raw HTMLが残っていれば、元のページを再び読み取り、別のルールでデータを展開できる。オフィシャルサイトへ何万回もアクセスし直す必要もない。

Raw HTMLがあると、何をやり直せるのか

取り出す項目を増やせる

最初は使わなかった情報でも、ロジックの発展によって必要になることがある。元データに含まれていれば、あとから追加できる。

保存形式を変更できる

Excel、CSV、データベース、Parquetなど、保存先や形式はあとから変えられる。Raw HTMLを基準にすれば、新旧データの整合性も確認しやすい。

取得ミスを調査できる

数字がおかしいとき、保存したHTMLまで戻れば原因を切り分けられる。サイト上の表示、HTMLの内容、読み取り処理、保存処理を順番に確認できる。

別のロジックへ再利用できる

現在の予想方法で使わない項目でも、将来の検証で役立つ可能性がある。Raw HTMLは、一つのロジック専用ではない。

HTMLを全部理解する必要はない

HTMLファイルを初めて開くと、「これを全部読めなければ競艇ソフトは作れないのか」と不安になるかもしれない。

その必要はない。目的はHTMLの専門家になることではなく、必要なデータを正しく取り出すことである。

現在は、HTMLの構造確認や読み取りコードの作成をAIに手伝ってもらえる。人間がすべてのタグや記号を暗記する必要はない。

AIに任せること、人間が決めること

AIに手伝ってもらえること

  • HTML構造の説明
  • 必要な項目の位置探し
  • 読み取りコードの作成と修正
  • 例外ページや取得ミスの調査

人間が決めること

  • 何のためにデータを集めるのか
  • どの情報を残すのか
  • どのレースを同一データとして結びつけるのか
  • 何をもって正しいデータと判断するのか

AIはHTMLを読む作業を助けてくれる。しかし、データの目的と検証基準は人間が決めなければならない。

保存前に決めておきたい最低限のルール

HTMLを保存するだけでも価値はある。ただし、あとから迷子にならないよう、最低限のルールを先に決めておく。

  1. レースID:日付・会場・レース番号から一つのレースを特定する
  2. データ種別:出走表・直前情報・結果・オッズを区別する
  3. ファイル名:同じ規則で保存し、名前だけで内容を判断できるようにする
  4. 保存場所:年・会場・種類など、自分が探しやすい単位で分ける
  5. バックアップ:PC故障や誤操作で一度に失わない構成にする

大切なのは、私と同じフォルダ構成を使うことではない。数年後の自分が見ても、どのレースの何のデータかを判断できることである。

最初から大量に集めなくてよい

8年分、約50万レースをいきなり集める必要はない。まずは1日、1会場、数レースで確認する。

  • HTMLを保存できるか
  • ファイル名からレースを特定できるか
  • 必要なデータを取り出せるか
  • 元のHTMLと加工後の数字が一致するか

小さな範囲で「保存できる・取り出せる・検証できる」を確認してから広げる方が、安全で速い。

データベースは作り直せる。分析ロジックも改善できる。
しかし、元になるRaw HTMLがなければ、やり直すたびに再取得から始めなければならない。だから、HTML保存は未来の自分への保険なのである。

次に読む

競艇データベース構築の案内へ戻る

コメント

タイトルとURLをコピーしました