インターネットアーカイブ(Wayback Machine)の使い方|過去のサイトを調べる方法とSEOでの活用術

インターネットアーカイブ(Wayback Machine)の使い方

インターネットアーカイブ(Wayback Machine)を使って、Webサイトの過去の姿をチェックしたことはありますか?

必須キーワードの選定と高品質記事作成を完全自動化!
\ 短期間でアクセス数を増やす専用ツールをご案内!/
SEOツール「キーワードファインダー」を無料で見る
\ 御社サイトの必須キーワードをたった3秒で最大約1000個無料入手!/

Googleの検索エンジンは大小さまざまなアップデートを繰り返していて、そのたびに検索順位も上下します。そんな中で「あの競合サイトの順位が上がったのはなぜだろう?」と考えることは、SEO対策を進めるうえでとても大切な視点です。

というのも、検索順位は相対評価で決まるものだからです。自社サイトの順位だけを追いかけていても、競合がどう変わったのかを知らなければ、いま検索エンジンに評価されている傾向をつかむことは難しいのではないでしょうか。

そこで必要になるのが、自社や競合サイトの「過去の状態」を知ることです。順位が動いたタイミングで、そのサイトに何か修正や改善が加えられていたのか。

仮説を立てて、その裏付けを取るための調査が欠かせません。

こうした調査に役立つのが、今回ご紹介する「インターネットアーカイブ(Wayback Machine)」という無料のサービスです。過去にさかのぼってサイトの状態を確認できるため、検索エンジンからの評価に何が影響したのかを読み取るヒントになるかもしれません。

一方で、このサービスをめぐる状況はここ数年で大きく変わりました。Googleのキャッシュ機能は2024年に廃止され、robots.txtでアーカイブを拒否する方法は以前のようには機能しなくなり、海外ではAI学習への懸念からアーカイブのクローラーをブロックするニュースサイトも増えています。

ネット上には古い情報のまま残っている解説も多いため、この記事では2026年時点の状況を踏まえて、基本の使い方から実務での活用法、注意点まで整理していきます。

必須キーワードの選定と高品質記事作成を完全自動化!
\ 短期間でアクセス数を増やす専用ツールをご案内!/
SEOツール「キーワードファインダー」を無料で見る
\ 御社サイトの必須キーワードをたった3秒で最大約1000個無料入手!/

この記事でわかること

  • インターネットアーカイブ(Wayback Machine)の概要と、過去のWebサイトを見る基本手順
  • 見たいページが表示されないときの原因と対処、Save Page Nowで今すぐ保存する方法
  • SEO担当者・サイト運営者が実務で使える活用術と、APIによる調査の効率化
  • 保存されたくない・削除したい場合の申請方法と、robots.txtをめぐる2025〜2026年の最新動向
  • 著作権などの法的な注意点と、archive.today・WARPなど代替サービスとの使い分け
おすすめの読者層
  • 競合サイトや自社サイトの過去の状態を調べて、SEO対策やサイト改善に役立てたいと考えている方
  • Googleキャッシュの廃止後、過去のページを確認する手段を探しているWeb担当者の方
  • 自社サイトがアーカイブされることへの対処法や、robots.txtの最新事情を正確に知りたいサイト運営者の方
インターネットアーカイブ(Wayback Machine)の使い方|過去のサイトを調べる方法とSEOでの活用術
目次
  1. インターネットアーカイブ(Wayback Machine)とは
  2. 基本の使い方:URL検索で過去のサイトを見る
  3. 見たいページが見つからないときの原因と対処
  4. Save Page Nowでページを今すぐ保存する方法
  5. SEO担当者・サイト運営者の実務活用術
  6. APIで効率化する:CDX API・Availability API
  7. 保存されたくない・削除したい場合の対処法
  8. robots.txtとの関係・2025〜2026年の最新動向
  9. 著作権・法的注意点と商用利用の可否
  10. 代替サービスとの使い分け
  11. よくある質問
  12. まとめ

インターネットアーカイブ(Wayback Machine)とは

インターネットアーカイブ(Wayback Machine)とは

はじめに、インターネットアーカイブ(Internet Archive)とは、Web上に公開された膨大なWebページをはじめ、書籍・音楽・映像・ソフトウェアなどのデジタル資料を収集・保存し、無償で公開している米国サンフランシスコに拠点を置く非営利団体です。1996年に設立され、「すべての知識へのユニバーサルなアクセス」を掲げてデジタル図書館の運営を続けています。

日本では「インターネットアーカイブ」という呼び方が浸透していますが、これはあくまで団体の名前です。過去のWebページを閲覧できるサービス自体は「Wayback Machine(ウェイバックマシン)」という名称で、web.archive.orgというURLで提供されています。

「ウェブアーカイブ」「アーカイブサイト」などと呼ばれることもありますが、どれも同じサービスを指していると考えて差し支えありません。

Webページの収集は団体の設立と同じ1996年から始まっていて、Wayback Machineとして一般公開されたのは2001年のことです。以来、四半世紀以上にわたって収集が続けられており、保存されたWebページの数は数千億ページ規模にのぼるといわれています。

日々新しいスナップショット(ある時点のページの複製)が追加されているため、規模は今もなお拡大し続けています。

運営資金は寄付や助成金によって支えられていて、閲覧も保存も無料で利用できます。ただし、ここでひとつ押さえておきたいのは、すべてのWebページが毎日保存されているわけではないという点です。

Internet Archiveのクローラーが巡回して保存するほか、提携機関のクロール、そして後述する「Save Page Now」による利用者の手動保存など、複数の経路でスナップショットが集められています。そのため、アクセスの多い有名サイトは1日に何度も保存されている一方で、小規模なサイトは数か月に1回、あるいはまったく保存されていないということも珍しくありません。

Wayback Machineの収集は、Internet Archiveが運用するクローラー(archive.org_botなど)がWeb上を巡回することで行われています。検索エンジンのクローラーとは別物ですが、仕組みの考え方は共通する部分が多いので、クローラーそのものについて知りたい方はこちらの記事もあわせてご覧ください。
クローラーとは?意味やSEOでの仕組み、対策を解説!

SEOの観点でこのサービスが重宝されるのは、自社サイトだけでなく競合サイトの過去も同じように確認できるからです。「いつ、どのページが、どう変わったのか」を第三者の記録として追えるツールは他にほとんどなく、後ほど紹介するGoogleキャッシュの廃止以降は、その役割がいっそう大きくなっています。

基本の使い方:URL検索で過去のサイトを見る

Wayback Machineの基本的な使い方(URL検索とカレンダー)

それでは、Wayback Machineの具体的な使い方を見ていきましょう。操作そのものは非常にシンプルで、大きく分けると「URLを入力する」「カレンダーから日付を選ぶ」の2ステップです。

手順1:web.archive.orgでURLを入力する

まずは「Wayback Machine」にアクセスします。画面はすべて英語ですが、使う部分は限られているので心配はいりません。

ページ中央の入力フォームに、確認したいWebページのURLを入力してEnterキーを押します。トップページだけでなく、「https://example.com/blog/article/」のように個別ページのURLをそのまま入力しても構いません。

むしろSEOの調査では、特定のページの変化を追いたいケースのほうが多いのではないでしょうか。

なお、Internet Archiveのトップページ(archive.org)にもWayback Machineの検索窓がありますが、書籍や映像など他のコレクションと並んで表示されるため、Webページの調査が目的であれば最初からweb.archive.orgを開いたほうが迷いません。

手順2:年表とカレンダーからスナップショットを選ぶ

URLを入力すると、そのページがこれまでに何回保存されているかというサマリーと、画面上部に年ごとの棒グラフ(タイムライン)、その下にカレンダーが表示されます。

カレンダーは初期状態では最新の年が表示されています。過去にさかのぼりたい場合は、上部のタイムラインから確認したい西暦をクリックしましょう。

すると、その年のカレンダーに切り替わり、スナップショットが存在する日付に色付きの丸が表示されます。

丸の上にカーソルを乗せると、その日に保存された時刻が一覧で表示されます。アクセスの多いサイトでは1日に複数回保存されていることもあり、その場合は時刻のリンクが複数行にわたって並びます。

確認したい時刻をクリックすれば、その時点のページが表示されます。

カレンダーの色の意味を知っておく

カレンダー上の丸は、色によって保存された瞬間にWebサーバーが返したHTTPステータスコードを表しています。丸の大きさは、その日に保存された回数の多さを示しています。

  • 青:2xx(正常にページが取得できた)
  • 緑:3xx(別のURLへリダイレクトされていた)
  • オレンジ:4xx(404 Not Foundなどクライアントエラーだった)
  • 赤:5xx(サーバーエラーが発生していた)

通常どおり運用されているサイトであれば、ほとんどが青い丸になっているはずです。緑が続いている期間は「その間ずっと別のURLに転送されていた」ことを意味し、オレンジや赤が続く期間は「ページが存在しなかった、あるいはサーバーが不安定だった」ことを示します。

この色の見方は、あとで説明する中古ドメインの評価や競合調査でも重要な手がかりになるので、ぜひ覚えておいてください。

表示されたページの見方と注意点

日付を選んで表示されたページの上部には、Wayback Machineのツールバーが固定表示されます。ここには保存日時と、前後のスナップショットへ移動する矢印、年ごとのグラフが並んでいるので、同じページの時系列変化をたどるのに便利です。

また、表示中のページ内のリンクをクリックすれば、そのままアーカイブ内でリンク先へ移動することもできます。ただし、いくつか注意しておきたい点があります。

  • リンク先ページが同じ日に保存されているとは限らず、日付の近いスナップショットに自動的に切り替わることがあります(ツールバーの日時で確認できます)
  • 画像やCSS、JavaScriptが保存されていない場合、レイアウトが崩れたり画像が表示されなかったりします
  • JavaScriptで動的に描画されるコンテンツや、ログインが必要なページは正しく再現されないことが多いです

つまり、Wayback Machineで見えるものは「当時の完全な複製」ではなく、「保存できた範囲での記録」だと理解しておくことが大切です。

サイト内のURL一覧をまとめて見る方法

特定のページだけでなく「このサイトのどんなURLが保存されているのか」を知りたい場合は、URLの末尾にアスタリスク(*)を付けて検索する方法があります。

https://web.archive.org/web/*/example.com/*

このように入力すると、そのドメイン配下で保存されているURLが一覧で表示され、フィルターで絞り込むこともできます。競合サイトが過去にどんなディレクトリ構成でページを公開していたのか、いま削除されているページに何があったのかをまとめて見渡すのに役立つ機能です。

「Changes」で2つのスナップショットの差分を比べる

カレンダー画面の上部には「Changes」というタブも用意されています。これは、同じURLの2つのスナップショットを選んで、内容がどの程度変わったのかを比較表示する機能です。変更の大きさが色の濃淡でカレンダー上に示されるため、「いつ大きく書き換えられたのか」を目視で見つけやすくなります。

競合ページのリライト時期を特定したいときや、自社ページの変更履歴を振り返りたいときに、1件ずつスナップショットを開いて見比べる手間を減らせるので、あわせて覚えておくと便利です。ただし、比較の精度は保存状態に依存するため、最終的には実際のスナップショットを開いて確認することをおすすめします。

見たいページが見つからないときの原因と対処

過去ページが見つからないときの原因と対処

URLを入力しても「Hrm. Wayback Machine has not archived that URL.」と表示されたり、カレンダーに丸がなかったりして、目的のページが見られないこともあります。そうしたときは、次のような原因が考えられます。

原因1:そもそもクロールされていない

もっとも多いのがこのケースです。前述のとおり、Wayback Machineはすべてのページを保存しているわけではありません。公開されて間もないページ、外部からのリンクが少ないページ、アクセスの少ない小規模サイトは、クローラーが巡回する機会そのものが少ないため、スナップショットが1つも存在しないことがあります。

原因2:除外申請などによってブロックされている

サイト所有者や権利者からの申請によってアーカイブから除外されている場合、「This URL has been excluded from the Wayback Machine.」といったメッセージが表示されます。この状態のページは、過去に保存されていたとしても閲覧できません。除外の仕組みについては後の章で詳しく説明します。

原因3:保存された瞬間がエラーやリダイレクトだった

カレンダーの丸が赤やオレンジの場合、保存を試みた時点でサーバーがエラーを返していたため、中身のないページしか記録されていない可能性があります。緑の場合は転送先のURLに記録が残っていることが多いので、リダイレクト先のURLで改めて検索してみましょう。

原因4:過去にrobots.txtでブロックされていた

後ほど詳しく触れますが、Internet Archiveは以前、robots.txtでのクロール拒否を尊重していました。そのため、当時robots.txtでブロックしていたサイトは、その期間のスナップショットが存在しない、または表示されないことがあります。これは現在の運用ではなく、過去の運用の影響が残っているケースです。

原因5:URLの表記が微妙に違う

意外と見落としがちなのが、URLの表記揺れです。Wayback Machineはある程度の正規化を行ってくれますが、次のような違いで結果が変わることがあります。

  • httpとhttpsの違い
  • wwwの有無
  • 末尾のスラッシュの有無、index.htmlの有無
  • URLパラメータ(?utm_source=… など)の有無
  • 大文字と小文字の違い

思い当たる表記をいくつか試すか、前章で紹介したアスタリスク検索で実際に保存されているURLの一覧を確認すると、見つかることがあります。

それでも見つからない場合の対処

上記を試しても見つからないときは、archive.today(archive.ph)や国立国会図書館のWARPなど、別のアーカイブサービスに保存されていないかを確認してみましょう(代替サービスについては後の章でまとめています)。

そして、今後同じことで困らないためにできるのが、次に紹介する「Save Page Now」です。自社サイトの重要ページや、競合の注目ページは、必要になったときではなく「今のうちに」保存しておくのが確実です。

「見つからない」=「そのページが存在しなかった」ではありません。Wayback Machineに記録がないことを、ページや情報が存在しなかった証拠として扱うのは避けたほうが無難です。

Save Page Nowでページを今すぐ保存する方法

Save Page Nowでページを保存する方法

Wayback Machineには、クローラーの巡回を待たずに、指定したページをその場で保存できる「Save Page Now」という機能があります。自社サイトのリニューアル前の状態を残しておきたいとき、競合が公開したばかりのページを記録しておきたいとき、あるいは参考にしたページが将来消えてしまう前に控えを取っておきたいときなどに役立ちます。

匿名でも1ページずつ保存できる

基本的な使い方はとても簡単です。web.archive.orgのトップページ下部にある「Save Page Now」の入力欄に保存したいURLを入力し、「SAVE PAGE」をクリックするだけです。処理が完了すると、保存されたスナップショットのURLが表示されます。

ログインしなくても利用でき、保存を依頼した利用者のIPアドレスは匿名として扱われる旨がInternet Archiveから説明されています。保存された記録に「誰が保存したか」が表示されることもありません。

無料アカウント登録で使える拡張機能

Internet Archiveの無料アカウントを作成してログインすると、Save Page Nowでより多くのオプションが使えるようになります。近年、これらの一部はログイン必須になっているため、実務で使うなら登録しておくことをおすすめします。

  • Save outlinks(アウトリンクの一括保存):指定ページからリンクされている先のページもまとめて保存します。トップページを指定すれば、そこからリンクされている主要ページを一度に記録できます
  • Save screen shot(スクリーンショットの保存):HTMLとは別に、表示状態を画像として保存します。レイアウト崩れが起きても「当時の見た目」を残せるのが利点です
  • Save error pages:4xx・5xxのエラーページも記録対象に含めます
  • Email me the results(完了メール通知):処理結果と保存先URLの一覧をメールで受け取れます。アウトリンクを含めて保存すると処理に時間がかかるため、このオプションと併用すると便利です
  • Save also in my web archive(個人アーカイブ):自分のアカウントに紐づけて保存し、あとから一覧で確認できます

なお、ブラウザ拡張機能(Wayback Machine拡張)やスマートフォンアプリからも保存を依頼できるので、日常的に使う方はそちらを導入しておくと手間が減ります。

保存に失敗する主なケース

Save Page Nowを実行しても、必ず保存できるとは限りません。次のようなケースでは、エラーが表示されたり、中身のないページが保存されたりします。

  • サイト側でInternet Archiveのクローラーを拒否する設定(IP制限やユーザーエージェント判定など)を行っている
  • SSL証明書の期限切れや設定不備があり、httpsで正常に接続できない
  • ログインや年齢確認、Cookie同意などを経ないと本文が表示されないページ
  • 短時間に大量の保存を依頼した場合のレート制限
  • ページサイズが極端に大きい、レスポンスが極端に遅い

「サイト全体を一括保存」はできない

よくある誤解として、「Save Page Nowでサイト全体をバックアップできる」と思われることがありますが、これはできません。Save Page Nowはあくまで1ページ単位の機能で、Save outlinksを使っても対象は「指定ページからリンクされている先」までです。サイト全体の控えが必要な場合は、サーバー側のバックアップやWARC形式で保存できる専用ツールを使いましょう。

リニューアルやドメイン移転の前には、主要ページをSave Page Nowで保存しておくことをおすすめします。Wayback Machineは他者が運営するサービスなので「確実に残る保証」はありませんが、順位変動の原因を後から調べる際に、旧版を手元で再現できることが大きな助けになります。

SEO担当者・サイト運営者の実務活用術

Wayback MachineのSEO実務での活用術

ここからは、Wayback MachineをSEO対策やサイト運営の実務でどう使うかを具体的に見ていきます。単に「昔のデザインを懐かしむ」ためのツールではなく、順位変動の原因分析やリスク回避に使えるところに、このサービスの価値があります。

競合サイトの過去コンテンツ・構成の変化を調べる

競合サイトの順位が上がったとき、そのページが「いつ」「どう」変わったのかを確かめるのに、Wayback Machineは最適です。順位が動いた時期の前後のスナップショットを並べて比較すれば、次のような変化を読み取れることがあります。

  • 見出し構成の変更や、コンテンツの追加・削除
  • タイトルタグやディスクリプションの書き換え
  • 内部リンクの追加、関連記事の配置変更
  • FAQや比較表など、新しいコンテンツ要素の追加
  • ページの統合やURL変更(緑=リダイレクトの丸が目印になります)

すべての変化が順位に影響したとは言い切れませんが、「何もしていないのに上がった」のか「明確に手を入れていた」のかを見分けられるだけでも、自社の打ち手を考える材料になるのではないでしょうか。

実際の手順としては、まず順位が動いた日付を特定し、その前後で最も近いスナップショットを1つずつ開きます。次に、ブラウザの「ページのソースを表示」でtitleタグやh1・h2の並びを比較すると、見た目では気づきにくい変更も拾えます。

前章で紹介した「Changes」機能で大きな変更のあった時期を先に絞り込んでおくと、この作業はさらに短時間で済みます。

被リンク元ページの消失を確認する

以前は自社サイトへの被リンクがあったのに、いつの間にかリンクが消えていたりページ自体がなくなっていたりすることがあります。被リンクツールで「消失リンク」として検出されたURLをWayback Machineで確認すれば、いつまでリンクが存在していたのか、ページが削除されたのかリンクだけが外されたのかを判断できます。相手先に再掲載を依頼する際の根拠にもなります。

リライト前の旧版と比較する

自社サイトのリライトも、履歴を残しておかないと「何を変えたから順位が動いたのか」がわからなくなりがちです。CMSの改訂履歴があれば十分な場合もありますが、公開状態の見た目や、テーマ・プラグイン側の変更まで含めて残せるのはWayback Machineの強みです。リライト前にSave Page Nowで保存しておけば、数か月後に結果を振り返るときに旧版と新版を並べて比較できます。

順位変動と外観・構成の変更を突き合わせる

検索順位の推移グラフと、Wayback Machineのスナップショットの日付を突き合わせるのは、原因分析の基本動作です。たとえば「2月中旬に順位が下がっている。同じ時期のスナップショットを見ると、ヘッダーのナビゲーションが変わって主要カテゴリへの内部リンクが減っていた」といった具合に、変更と結果の対応関係を仮説として立てられます。Googleのコアアップデートの時期と重なっていれば、アルゴリズム側の影響も含めて考える必要がありますが、いずれにせよ「当時サイトがどうなっていたか」を確認せずに原因を語ることはできません。

中古ドメインの過去の運用を評価する

中古ドメインの取得を検討する際も、Wayback Machineでの確認は欠かせません。年ごとのタイムラインとカレンダーの色を見ることで、次のような点を読み取れます。

  • 時期によってサイトの内容がまったく別のものに入れ替わっていないか
  • 緑(リダイレクト)の期間が長く続いていないか(他サイトへの転送に使われていた可能性)
  • アダルト・ギャンブルなど、ペナルティのリスクがある内容で運用されていた時期がないか
  • 被リンク目的のサテライトサイトのような薄いコンテンツで運用されていなかったか
中古ドメインを選ぶ際は、直近だけでなく、いくつかの時期に分けてスナップショットを確認しましょう。通常のサイト運用であればカレンダーはほぼ青一色になります。緑や赤が長期間まじっている場合は、SEO目的で使い回されていた痕跡の可能性があるため、慎重に判断したほうが安全です。

定点観測を効率化する

ここまで紹介した使い方はいずれも「順位が動いたあとに過去を振り返る」ものですが、そもそも自社と競合の順位を継続的に計測していなければ、「いつ動いたのか」を特定することができません。Wayback Machineが「サイトの過去」を教えてくれるツールだとすれば、その前提として「順位の過去」を記録しておく仕組みが必要になります。

順位計測や競合比較の定点観測を効率化したい場合は、キーワードファインダーのようにキーワードの順位推移と競合の動向をあわせて確認できるツールを組み合わせるのもひとつの選択肢です。順位の変化点がわかれば、Wayback Machineで見るべき日付も自然と絞られてきます。

APIで効率化する:CDX API・Availability API

CDX API・Availability APIで調査を効率化

ブラウザでURLを1件ずつ調べる方法は、数ページであれば問題ありませんが、数百URLの被リンク元をチェックしたいときや、競合サイトの主要ページを定期的に確認したいときには限界があります。そこで知っておきたいのが、Wayback Machineが公開しているAPIです。

ここでは実装の詳細よりも「何ができるのか」を中心に紹介します。

Availability API:直近のスナップショットがあるかを確認する

Availability APIは、指定したURLについて「保存されたスナップショットが存在するか」「あるなら最も近いものはどれか」を返すシンプルなAPIです。

http://archive.org/wayback/available?url=example.com

このURLにアクセスすると、JSON形式で結果が返ります。スナップショットが存在する場合は、次のような内容が含まれます。

{  "url": "example.com",  "archived_snapshots": { "closest": {"status": "200","available": true,"url": "http://web.archive.org/web/20250101000000/http://example.com/","timestamp": "20250101000000" }  }}

「timestamp」パラメータを追加すれば、「この日付に最も近いスナップショット」を指定して取得することもできます。たとえば「&timestamp=20240301」と付ければ、2024年3月1日に最も近い記録が返ります。

被リンク元URLのリストに対して「アーカイブが存在するか」を一括で確認したい、といった用途に向いています。

CDX API:存在するすべてのスナップショットを一覧で取得する

CDX APIは、指定したURLについて保存されているすべてのスナップショットの一覧を返します。Availability APIが「1件だけ」を返すのに対して、こちらは履歴全体を取得できるのが特徴です。

http://web.archive.org/cdx/search/cdx?url=example.com&output=json

返ってくる各行には、次のような項目が含まれています。

  • timestamp:保存された日時(yyyyMMddhhmmss形式)
  • original:保存時にアクセスした元のURL
  • mimetype:コンテンツの種類(text/htmlなど)
  • statuscode:保存時のHTTPステータスコード
  • digest:コンテンツのハッシュ値(内容が変わったかの判定に使えます)
  • length:データサイズ

「output=json」を付けるとJSON形式で取得でき、プログラムから扱いやすくなります。そのほか、主に次のようなパラメータが用意されています。

  • from / to:期間を絞る(例:from=2024&to=2025)
  • filter:ステータスコードなどで絞る(例:filter=statuscode:200)
  • collapse:重複をまとめる(例:collapse=timestamp:8 で1日1件に)
  • matchType:prefixやdomainを指定して、配下のURLをまとめて対象にする
  • limit:取得件数の上限

たとえば「competitor.com配下のURLで、2025年以降にステータス200で保存されたHTMLの一覧」を取得すれば、競合サイトがいつどのページを公開・更新していたのかを、ブラウザで1件ずつ調べることなく把握できます。digestの値が変わったタイミングを見れば、「内容が変更された日」の目安もつかめます。

ラッパーライブラリで複数URLを一括チェックする

APIを直接叩くのが面倒な場合は、Pythonの「waybackpy」など、Wayback MachineのAPIを扱いやすくしたラッパーライブラリが公開されています。URLのリストを渡して、最新スナップショットの有無やURLをまとめて取得したり、Save Page Nowによる保存をスクリプトから依頼したりといった処理を、比較的少ないコードで実現できます。

API利用時の注意点

APIは無料で利用できますが、短時間に大量のリクエストを送るとレート制限がかかることがあります。Internet Archiveは寄付で運営されている非営利団体のサービスですので、リクエストの間隔を空ける、必要な範囲だけ取得するなど、負荷をかけない使い方を心がけたいところです。また、APIの仕様は予告なく変更されることがあるため、実装する際は公式ドキュメントで最新の情報を確認してください。

こうしたAPIを使えば、「サイトの過去」を調べる作業はかなり自動化できます。一方で、順位や競合の変化そのものを日々追いかける部分まで自作しようとすると手間がかかるため、そこはキーワードファインダーのような順位計測・競合分析のツールに任せて、Wayback Machineは「変化点の中身を確かめる」役割に絞る、という分担も現実的です。

保存されたくない・削除したい場合の対処法

ここまではWayback Machineを「使う側」の話でしたが、サイト運営者としては「自社サイトを保存されたくない」「すでに保存されている過去のページを削除したい」と考える場面もあるでしょう。たとえば、公開すべきでない情報が一時的に掲載されていた、古い料金や誤った記載が残っている、閉鎖したサービスのページが残り続けている、といったケースです。

info@archive.orgにメールで申請する

Internet Archiveでは、アーカイブからの除外(削除)を希望する場合、「info@archive.org」宛てにメールで申請する方法が案内されています。Web上のフォームや管理画面から自分で削除する仕組みは用意されていません。

申請メールには、少なくとも次の内容を明記しておくとスムーズです。

  • 除外を希望する対象URL(ドメイン全体か、特定のページやディレクトリか)
  • 除外を希望する期間(すべての期間か、特定の期間のみか)
  • 自分がそのサイトを管理していた期間(いつからいつまで所有・運営していたか)
  • サイトの所有者・管理者であることを示す根拠(ドメインの登録者情報、サイト内に記載された連絡先メールアドレスからの送信など)

やり取りは英語で行われるため、可能であれば英文で送るのが無難です。所有者の確認は、アーカイブされたサイト内に記載されているメールアドレスや、公式SNSアカウントなどと照合して行われることがあります。

参考として、申請メールの骨子をシンプルな英文にすると次のようなイメージになります(内容は自社の状況に合わせて書き換えてください)。

Subject: Request to exclude example.com from the Wayback MachineHello,I am the owner and administrator of https://example.com/(registered and operated since March 2018 to the present).I would like to request that the following URLs be excludedfrom the Wayback Machine:- https://example.com/ (entire domain, all dates)This email is sent from the contact address listed on the site.Please let me know if you need any additional verification.Thank you,Your Name / Company Name

審査制であり、承認が保証されているわけではない

ここで押さえておきたいのは、除外申請は審査制であり、申請すれば必ず削除されるというものではないという点です。著作権侵害や個人情報の掲載など、法律上の問題がはっきりしている申請は比較的対応されやすいと考えられますが、それ以外の申請はInternet Archive側の裁量で判断されます。「以前の運用内容を消したい」といった理由だけでは、応じてもらえないこともあるようです。

また、対応までには数日から数週間程度かかることが多く、返信がない場合は改めて連絡が必要になることもあります。除外が認められると、そのURLは「This URL has been excluded from the Wayback Machine.」と表示され、閲覧できなくなります。

事前に防ぐ方法はあるのか

「削除申請するより、最初から保存されないようにしたい」と考える方も多いと思います。以前はrobots.txtにInternet Archiveのクローラーを拒否する記述を追加しておく、というのが定番の方法として広く紹介されてきました。しかし、この方法は現在では機能しない可能性が高くなっています。詳しくは次の章で説明します。

サイトを閉鎖したりサーバーを解約したりする予定がある場合は、その前に除外申請を済ませておくことをおすすめします。所有者確認は「現在そのサイトを管理していること」を示せる状態のほうが通りやすく、ドメインを手放してしまうと証明が難しくなるためです。

robots.txtとの関係・2025〜2026年の最新動向

Wayback Machineとrobots.txtの関係は、ここ10年ほどで大きく変わりました。ネット上には「robots.txtに書けばアーカイブされない」という古い情報が今も多く残っていますが、そのまま信じてしまうと対策したつもりが効いていなかった、ということになりかねません。

時系列に沿って整理します。

以前の定番だった「ia_archiver」の拒否記述

かつては、robots.txtに次のように記述しておけば、Internet Archiveのクローラーがサイトを保存しないとされていました。

User-agent: ia_archiverDisallow: /

「ia_archiver」はInternet Archiveが(提携先を含めて)長く使ってきたユーザーエージェント名で、この記述はWayback Machineからサイトを除外するための定番の方法として広く紹介されてきました。しかし、この記述は現在では効かない可能性が高いと考えておいたほうがよい状況です。

2017年:政府・軍のサイトからrobots.txtの無視を開始

転機となったのは2017年です。Internet Archiveは公式ブログで、「robots.txtは検索エンジン向けの仕組みであり、アーカイブという目的には合わない」という見解を示しました。たとえば、サイトが閉鎖されドメインが第三者に取得された際、新しい所有者がrobots.txtでクロールを拒否すると、過去のスナップショットまで一括で閲覧できなくなってしまう、といった問題が背景にあったようです。

そのうえで、まず米国の政府(.gov)や軍(.mil)のサイトについてrobots.txtを無視してアーカイブする方針を打ち出し、段階的に範囲を広げていくと表明しました。

2023年:すべてのサイトに拡大

その後、この方針は一般のサイトにも広げられ、2023年ごろにはすべてのサイトについてrobots.txtの拒否設定にかかわらずクロールが行われる運用になったとされています。つまり現在は、robots.txtで拒否していてもスナップショットが保存される可能性があり、保存されたくない場合は前章で説明した個別のメール申請が必要、というのが基本的な考え方になります。

なお、Internet Archiveの現在のクローラーのユーザーエージェントには「archive.org_bot」などが使われています。ユーザーエージェントを指定してサーバー側でアクセスを制限する(robots.txtではなく、IP制限や.htaccessなどで拒否する)方法は技術的には存在しますが、クロール経路は複数あるため、それだけで完全に保存を防げるとは言い切れません。

noarchiveメタタグはどうか

robots.txtとは別に、HTMLのhead内に次のようなメタタグを記述する方法もあります。

<meta name="robots" content="noarchive">

Wayback Machineでは、このnoarchiveタグが設定されたページについて、個別ページ単位で表示を控える対応が一定程度行われているようです。ただし、実装ミスがあったり、すでに保存された後に後付けで設定したりした場合には、効きが不安定だという報告も見られます。

確実性を求めるなら、やはりメール申請と併用するのが現実的でしょう。

ここで混同しやすいのが、Googleのnoarchiveです。Googleにおけるnoarchiveは「検索結果にキャッシュリンクを表示しない」という指示であり、Wayback Machineの保存とは別の話です。

後述するとおりGoogleのキャッシュ機能自体が2024年に廃止されたため、Google向けのnoarchiveは事実上役割を終えていますが、Wayback Machine向けの意味合いは残っている、と理解しておくとよいでしょう。

2025〜2026年:AI学習への懸念からニュースサイトがクローラーをブロックする動き

そして2025年から2026年にかけて、海外では新しい動きが広がっています。生成AIの学習データとしてアーカイブされたコンテンツが無断で利用されることへの懸念から、The New York TimesやThe Guardianをはじめとする340以上のニュースサイト(主に米国)が、Internet Archiveのクローラーを個別にブロックするようになったと報じられています。

The New York Timesは2025年末に「archive.org_bot」を拒否する設定を行ったとされ、あるアーカイブ関連の分析では、ニュース系サイトの保存数が2025年5月から10月の間に約87%減少したという数字も示されています。Internet Archive側はアーカイブの公益性を訴えていますが、出版社側は「アーカイブを経由して記事がAI企業に利用されるリスク」や「有料記事の回避に使われる懸念」を理由に挙げているようです。

ただし、この動きは主に海外の大手ニュースメディアに関する話であり、日本の一般的な企業サイトやブログの運営者に直接あてはまるものではありません。「今すぐ自社サイトもブロックすべき」という話ではなく、「アーカイブという仕組みが、AI時代にどう位置づけられるかが問い直されている」という文脈として押さえておくのがよいと思います。

日本のサイト運営者はどう考えればよいか

以上を踏まえると、日本のサイト運営者が押さえておきたいポイントは次の3つに整理できます。

  • robots.txtの「ia_archiver」拒否だけでは、現在はWayback Machineへの保存を防げない可能性が高い
  • 保存されたくないページや消したい過去の記録がある場合は、info@archive.orgへの個別申請が基本になる(ただし審査制)
  • noarchiveメタタグやサーバー側でのアクセス制限は補助的な手段であり、確実性は保証されない

裏を返せば、競合調査の観点では「robots.txtで拒否しているサイトの過去も見られる可能性が高くなった」ということでもあります。いずれの立場でも、古い情報のまま判断しないことが大切です。

著作権・法的注意点と商用利用の可否

Wayback Machineで過去のページを閲覧できるからといって、そのデータを自由に使えるわけではありません。ここでは、サイト運営者がとくに注意しておきたい法的な観点を整理します。

アーカイブされても著作権は消えない

Wayback Machineに保存されているWebページの文章、画像、動画などは、アーカイブされているだけで、著作権が消滅したり、権利者が変わったりするわけではありません。多くの場合、元のサイトの運営者や制作者がそのまま著作権を保持しています。「元のサイトが閉鎖されたから使ってもよい」という理屈も成り立ちませんので注意してください。

日本にはフェアユース規定がない

Internet Archiveは米国の団体であり、その活動は米国のフェアユース(公正利用)の考え方に基づいて行われています。しかし、日本の著作権法にはフェアユースのような包括的な規定がありません。日本国内でアーカイブのデータを自社のサイトや資料に再利用・転載する場合、原則として権利者の許諾が必要になると考えておくべきです。

引用の要件(出典の明示、主従関係、必要最小限の範囲など)を満たせば、権利者の許諾なく利用できる場合はありますが、その判断は個別の事情に左右されます。とくに商用利用や転載、再配布については、事前に権利者の許可を得るか、専門家に相談することをおすすめします。

Internet Archive自体の利用規約

Internet Archiveの利用規約でも、アーカイブされたコンテンツの利用は主に調査・研究・教育・個人的な参照といった目的を想定しており、保存データの権利がInternet Archiveに帰属するわけではないことが示されています。利用の際は、公式サイトの利用規約と著作権に関するガイドラインを確認しておきましょう。

証拠としての利用には限界がある

「過去にこう書かれていた」ことを示す資料として、Wayback Machineのスナップショットが引き合いに出されることがあります。第三者が運営するサービスの記録であるため一定の参考価値はありますが、証拠能力については次のような限界があることも知っておくべきでしょう。

  • 保存された内容がページの全体を正確に再現しているとは限らない(画像やスクリプトの欠落、リンク先の日付のずれなど)
  • Save Page Nowで誰でも保存を依頼できるため、「その日時にその内容が公開されていた」ことの証明として扱われるかは、事案や場面によって異なる
  • Internet Archiveは記録の正確性や完全性を保証していない

実際に法的な場面で利用する必要がある場合は、弁護士などの専門家に相談し、公証やタイムスタンプなど別の手段とあわせて検討するのが現実的です。

SEOや競合調査の範囲では「過去にどんなページがあったかを確認して、自社の施策を考える参考にする」という使い方にとどめ、他社のコンテンツをそのまま流用するようなことは避けましょう。競合の過去ページを見て学ぶことと、コピーすることはまったく別の話です。

代替サービスとの使い分け

Wayback Machineは最大規模のWebアーカイブですが、唯一のサービスではありません。目的によっては他のサービスのほうが向いていることもあるので、代表的なものを紹介します。

archive.today(archive.ph)

archive.todayは、利用者が手動でURLを指定して保存する形式のアーカイブサービスです。クローラーによる自動収集は行っておらず、「いま見ているページを、いまの状態で確実に残す」ことに特化しています。保存時点のスクリーンショットも同時に記録され、保存後の内容は変更されないため、改ざん防止の観点で利用されることが多いサービスです。一方で、過去にさかのぼって「誰も保存していなかったページ」を見ることはできません。

ウェブ魚拓

ウェブ魚拓は、日本国内で長く運営されている手動保存型のサービスで、日本語のWebページを対象に使われることが多いです。仕組みとしてはarchive.todayに近く、指定したページをその時点の状態で保存して公開します。国内の掲示板やSNSの投稿を記録する用途で使われることも多く、日本語サイトの保存という点では馴染みやすいサービスといえるでしょう。

WARP(国立国会図書館インターネット資料収集保存事業)

WARPは、国立国会図書館が運営する国内のWebアーカイブです。国の機関や地方自治体、大学、法人などの公的なWebサイトを中心に、定期的に収集・保存しています。日本のサイトに強く、とくに官公庁や自治体のサイトの過去の姿を調べたい場合は、Wayback Machineより充実していることが少なくありません。一方で、民間の一般的なサイトは許諾に基づく収集が中心のため、対象は限られています。

Googleキャッシュは2024年に廃止された

以前は、検索結果の「キャッシュ」リンクや「cache:」演算子を使って、Googleが保持しているページのコピーを見ることができました。しかし、Googleは2024年1月に検索結果からキャッシュリンクの表示を終了し、同年中に「cache:」演算子も停止しています。

Googleはその代替として、検索結果の「この結果について(About this result)」などからWayback Machineのアーカイブへ移動できる導線を追加しました。つまり、Google自身が「過去のページを見る手段」としてWayback Machineを位置づけたことになります。

Googleキャッシュに頼っていた「インデックス状況の確認」や「クロール時点のページ内容の確認」といった作業は、Search ConsoleのURL検査ツールとWayback Machineに役割が分かれた、と考えるとわかりやすいでしょう。

使い分けの目安

  • 過去にさかのぼって競合や自社の変化を調べたい:Wayback Machine
  • いま見ているページを確実に、改ざんされない形で残したい:archive.today、ウェブ魚拓(あわせてWayback MachineのSave Page Nowも)
  • 官公庁・自治体など日本の公的サイトの過去を調べたい:WARP
  • Googleがどう認識しているかを確認したい:Search ConsoleのURL検査ツール(Googleキャッシュの代替)

複数のサービスに同じページが保存されていれば、それぞれを見比べることで、単独のアーカイブでは欠けていた部分を補える場合もあります。

よくある質問

インターネットアーカイブとは何ですか?

インターネットアーカイブ(Internet Archive)は、1996年に設立された米国の非営利団体で、世界中のWebページや書籍、映像などのデジタル資料を保存・公開しています。過去のWebページを閲覧できるサービスは「Wayback Machine(ウェイバックマシン)」という名称で、web.archive.orgから無料で利用できます。

Wayback Machineで過去のページを検索するには?

web.archive.orgにアクセスし、入力欄に確認したいページのURLを入力して検索します。表示されたタイムラインから年を選び、カレンダー上の色付きの日付をクリックすると、その時点のスナップショットを閲覧できます。青い丸が正常に保存された記録で、緑はリダイレクト、オレンジや赤はエラー時の記録を示しています。

今すぐ特定のページを保存することはできますか?

できます。web.archive.orgの「Save Page Now」にURLを入力して「SAVE PAGE」をクリックすれば、その場でスナップショットが作成されます。ログインなしでも1ページずつ保存でき、無料アカウントでログインすると、リンク先の一括保存やスクリーンショット保存、完了メール通知などのオプションが使えます。ただし、サイト側の設定やSSLの不備などで保存できないこともあり、サイト全体の一括保存には対応していません。

インターネットアーカイブから自分のサイトの情報を削除できますか?

info@archive.orgにメールで除外申請を行うことができます。対象URL、除外を希望する期間、サイトを管理していた期間などを明記し、所有者であることを示す必要があります。ただし、申請は審査制で、著作権侵害などの明確な法的理由がある場合を除き、Internet Archive側の裁量で判断されます。必ず削除されるとは限らず、対応には数日から数週間程度かかることが一般的です。

アーカイブに保存されたデータを自由に使用できますか?

自由に使えるわけではありません。アーカイブされていても著作権は元の権利者に残っており、日本にはフェアユースの規定がないため、再利用や転載には原則として権利者の許諾が必要です。商用利用や再配布についてはとくに注意が必要で、調査や参考にとどめるのが安全です。

robots.txtでアーカイブへのクロールを拒否できますか?

以前は「User-agent: ia_archiver」「Disallow: /」と記述する方法が広く紹介されていましたが、Internet Archiveは2017年以降、段階的にrobots.txtを尊重しない方針へ移行し、2023年ごろにはすべてのサイトに拡大したとされています。そのため、現在はrobots.txtの記述だけでは保存を防げない可能性が高く、保存されたくない場合はメールでの個別申請が基本となります。noarchiveメタタグは一定程度考慮されるようですが、確実な方法とはいえません。

まとめ

今回は、過去のWebサイトの姿を調べられる「インターネットアーカイブ(Wayback Machine)」について、基本の使い方からSEO実務での活用法、API、削除申請、robots.txtをめぐる最新動向、法的な注意点、代替サービスとの使い分けまでを整理しました。

改めてポイントを振り返ると、次のようになります。

  • Wayback Machineは、URLを入力してカレンダーから日付を選ぶだけで過去のページを閲覧できる。丸の色でHTTPステータスも読み取れる
  • すべてのページが保存されているわけではないため、重要なページはSave Page Nowで「今のうちに」保存しておく
  • 競合の変化、被リンク元の消失、リライト前後の比較、中古ドメインの評価など、SEOの原因分析に幅広く使える。大量のURLはCDX APIなどで効率化できる
  • 削除はメールでの申請が必要で、審査制のため必ず認められるとは限らない。robots.txtでの拒否は現在は効かない可能性が高い
  • 保存データにも著作権は残るため、参考にとどめ、無断転載や商用利用は避ける
  • Googleキャッシュは廃止され、過去ページの確認はWayback Machineが事実上の受け皿になっている

検索順位は相対評価で決まるものだからこそ、自社だけでなく競合の「過去」を知ることが、いま評価されている要素を読み解く手がかりになります。Wayback Machineで確認した変化を、日々の順位計測データと突き合わせていくことで、思い込みではなく事実に基づいた改善の仮説を立てられるようになるはずです。

順位の推移や競合の動きを継続的に追いかけたい場合は、キーワードファインダーのような順位計測ツールとあわせて使うのもひとつの方法です。「いつ変わったのか」を順位データでつかみ、「何が変わったのか」をWayback Machineで確かめる。

この組み合わせを習慣にして、サイト改善に役立ててみてはいかがでしょうか。

必須キーワードの選定と高品質記事作成を完全自動化!
\ 短期間でアクセス数を増やす専用ツールをご案内!/
SEOツール「キーワードファインダー」を無料で見る
\ 御社サイトの必須キーワードをたった3秒で最大約1000個無料入手!/
短期間でアクセス数を増やすには、自動化が重要です!
短期間でアクセス数が増えないのはなぜ…?
短期間でアクセス数が増えない理由は、高品質ページのインデックスが遅いからです。
アクセス数の推移

例えば、サイトやページのテーマに関連するキーワードやそれらのキーワードの検索ボリューム、競合性を都度自身で手動でツールで調べて、キーワードを選定します。

必須キーワードの選定と高品質記事作成を完全自動化!
\ 短期間でアクセス数を増やす専用ツールをご案内!/
SEOツール「キーワードファインダー」を無料で見る
\ 御社サイトの必須キーワードをたった3秒で最大約1000個無料入手!/

また、選定したキーワードの検索意図を、都度自身で手動で競合上位サイトの傾向を見ながら記事構成を書きだして、記事作成をします。
この場合、記事公開までかなり時間がかかって、高品質ページをGoogleに認識させること(高品質ページのインデックス)が遅くなります。

そうなれば、Googleに評価されるまで時間もかかるので、検索順位が上がるまで数カ月、数年かかりすぐにアクセス数が増えません。
結果、短期間でアクセス数が増えないというわけです。

こうした悪い状況を回避する為に、必須キーワードの選定と高品質記事作成を完全自動化して、短期間でアクセス数を増やす専用ツールをご案内します。(無料)

検索順位を改善するには正しいSEOの知識が必要です

関連記事

【2025年最新】SEOとは?SEO対策の基本と具体的な施策方法を詳しく解説します

成功するAI×SEOの最新手法を無料紹介!
\ AIを活用したSEOポイントやテクニックをご案内!/

SEO無料オンライン相談を申し込む