データの取得について(compachi-fetch)
compachi(産業用機器の中立な仕様データベース)は、メーカーの公式サイトから仕様値を取るときに、取得器 compachi-fetch を使います。 このページは、アクセスログでこの名前を見たサイトの運営者の方に向けた案内です。
1. User-Agent
compachi-fetch/0.1.0 (+https://compachi.com/bot/)
「/」の後ろは取得器の版(いまは 0.1.0)で、取得器を直すと変わります。ブラウザを装うことはありません。
2. 目的
メーカーが公開している製品の仕様値(事実)と、その出典(資料の URL・表題・取得日)を取り、compachi のデータベースに出典付きで記録するためです。 検索エンジンの索引や、AI の学習のための巡回ではありません。
3. 取りに行くもの・行かないもの
- 取りに行くのは、ログインなしで誰でも見られる、メーカー公式の製品ページ・シリーズページ・データシート(PDF)と、それらのページが使うメーカー自身のデータ(JSON・Markdown など)です。
- 人が決めたメーカー×型番の URL だけを取ります。サイト全体を辿ったり、全製品を定期的に集めたりはしません。変化の確認は、出典の URL の状態を月に1回、型番のページの取り直しを半年に1回にとどめます。
- ログイン・会員登録・フォームの入力の後ろにある資料と、robots.txt が禁じるページは取りません。ログインの画面へ転送されたとき、パスワードの入力欄がある応答を受けたときは、そこで止まります。
4. 頻度と間隔
- 要求は1本ずつ送ります。同じサイトの中でも、サイトをまたいでも、同時には送りません。
- 同じホストへの要求は、前の要求が終わってから 3 秒か、robots.txt の Crawl-delay のうち長いほうを空けます。
- 1回の要求は 30 秒で打ち切ります。サーバーの誤り(5xx)・時間切れ・接続の失敗のときだけ、最大 2 回まで再試行し、Retry-After の指定を守ります(5 分を超える指定なら再試行しません)。
- 403・429 の応答や、JavaScript のチャレンジを受けたときは、再試行も回避もせず、そのホストへの取得を止めます。
5. robots.txt
RFC 9309 に従って読みます。compachi-fetch を名指ししたグループがあればそれに、無ければ * のグループに従います。 解釈が分かれる書き方は、禁止の側に読みます。robots.txt がサーバーの誤り(5xx)を返すとき・届かないときは、すべてが禁止されているとみなします。取得した robots.txt は最長 24 時間使います。
compachi-fetch だけを止めるには、robots.txt に次のように書いてください。
User-agent: compachi-fetch
Disallow: /6. 取得したものの扱い
- 記録するのは、仕様値と出典(URL・表題・取得日。PDF はファイルの SHA-256)だけです。
- 取得したページやファイルは、値の読み取りと確認のためだけに、公開しない手元のフォルダに置きます。PDF・画像・文章をこのサイトやリポジトリに載せたり、転載したりしません。
- 例外は、型番を載せているメーカーのロゴです。各社の公式サイトから 1 社 1 つを、この取得器を使わずに 1 回だけ取り、色と形を変えずに社名の横に小さく載せています(利用規約の3)。
7. 連絡先
取得を止めてほしい、間隔を広げてほしいなどのご連絡は、contact@compachi.com へお送りください。