手作業でコピペしている情報収集を自動化します。
▼ 最初に「取得してよいか」を確認します
対象サイトの robots.txt と利用規約を確認し、自動取得が許可されているかをお伝えします。
禁止されている場合は、公式APIなど別の取得方法がないかを調べてご提案します。
実際に公的機関のサイトを調べたところ、4サイト中3サイトが自動アクセスを制限していました。「画面で見られる=取得してよい」ではないため、ここを飛ばすと後から問題になります。
▼ できること
・指定サイトからの定期的なデータ取得
・取得したデータの CSV / スプレッドシート出力
・定期実行(毎日・毎週など)の設定
・前回との差分(新着・更新・掲載終了)の検知
・取得に失敗したときの記録と通知
▼ 失敗しても壊れない作りにします
収集はいつか必ず失敗します(相手サイトのメンテナンス、通信断、仕様変更)。
そのときに困らないよう、次のようにしています。
・取得できなかったものを「無くなった」と誤って判定しない
・一部が失敗しても、取得できた分は保存する
・「失敗した」のか「取得を禁止されていた」のかを記録して区別する
▼ CSVはExcelで開く前提で作ります
文字化けしない形式、改行コード、
外部から来た文字列がExcelで数式として実行されないための対策まで対応します。
▼ 納品物
・実行できる状態のプログラム一式
・設定手順書(ご自身で動かせるように書きます)
・取得データのサンプル
▼ お受けできないもの
・robots.txt や利用規約で自動取得が禁止されているサイト
・ログインが必要な会員向け情報の取得
・著作権のあるコンテンツの複製
▼ 実績
補助金・公募情報を毎日収集し、前回との差分を検知する仕組みを個人で開発し、公開しています。
自動実行の記録が残る形で、現在も毎日稼働しています。
(テスト38件/静的解析・型チェックは自動で検証)
まずは対象サイトをお知らせください。取得可能かどうかをお答えします。
ご購入前に、必ずダイレクトメッセージでご相談ください。
スクレイピングは対象サイトの構造によって作業量が大きく変わります。
同じ「一覧を取得する」でも、サイトによって数時間から数十時間まで幅があります。
正確なお見積りのため、事前に対象サイトを確認させてください。
▼ 事前にお知らせいただきたいこと
・対象サイトのURL
・取得したい項目(例:商品名・価格・在庫数)
・取得の頻度(1回だけ/毎日/毎週)
・出力形式(CSV/スプレッドシート/その他)
▼ お断りする場合があります
robots.txt や利用規約で自動取得が禁止されている場合はお受けできません。
その場合は、公式APIなど別の方法がないかをお調べしてご報告します。
ここまでは無料です。
▼ 生成AIの利用について
作業効率化のため生成AIを利用する場合があります。
お客様の情報を学習に使わない設定で利用しますが、
利用を希望されない場合は事前にお申し付けください。