Webの手作業を、壊れたことまで検知できるデータ収集の仕組みに変えます
Webサイト上の情報を収集し、CSV・Excelなどで使えるデータへ整理する仕組みをPythonで開発しています。
自主開発では、4つのデータ収集プロジェクトを通じて、複数の公開Webサイトを対象に、数万件規模のイベントデータと数十万件規模の明細データを収集・検証してきました。MacとVPSでの定時実行、時刻指定の収集、重複排除、欠損・整合性チェック、失敗通知、バックアップまで実装しています。
大切にしているのは「一度取得できたら完成」ではなく、サイト変更や通信失敗が起きても、壊れたことに気づける状態で納品することです。実運用で収集漏れが起きた際には、スケジューラーの競合まで原因を切り分け、排他制御と監視を見直して再発防止まで行いました。
対応できる内容は、Webページからのデータ収集、CSV・Excel向けの整形、重複データの除外、定期実行、取得失敗時の通知などです。
ご相談時に「対象URL」と「欲しい項目」をお知らせいただければ、技術面と利用規約・robots.txtの両面から対応可否を確認します。規約で禁止されている取得、個人情報の収集、相手サイトへ過度な負荷をかける方法はお受けしません。
専門用語をできるだけ使わず、実行方法を手順書にしてお渡しします。まずは購入前のご相談からお気軽にご連絡ください。