Awesome Web Archiving
Web Archivingを扱う資料や関連プロジェクトをまとめたAwesomeリストです。 上流ではアーカイブ済み、または更新終了と案内されています。
目次
研修・ドキュメント
この節では、ウェブアーカイブの実務、方法論、ツールを学ぶ人向けに、研修資料、ドキュメント、教育リソースを紹介します。
ウェブアーカイブ概念の入門
- What is a web archive? - the UK Web Archive YouTube Channelからの動画
- Wikipedia’s List of Web Archiving Initiatives
- Glossary of Archive-It and Web Archiving Terms
- The Web Archiving Lifecycle Model - ウェブアーカイブの技術的およびプログラム的な側面を、どのような組織でもウェブコンテンツのアーカイブに適用できるフレームワークとして統合する試み。インターネット・アーカイブのウェブアーカイブサービスであるArchive-Itは、世界中の記憶機関との協働をもとにこのモデルを開発した。
- Retrieving and Archiving Information from Websites by Wael Eskandar and Brad Murray
研修資料
- IIPC and DPC Training materials: module for beginners (8 sessions)
- UNT Web Archiving Course
- Continuing Education to Advance Web Archiving (CEDWARC)
- A Whirlwind Tour of Common Crawl’s Datasets using Python
- A Whirlwind Tour of Common Crawl’s Datasets as a Python notebook
- A Whirlwind Tour of Common Crawl’s Datasets using Java
WARC標準
- The warc-specifications - WARC形式の仕様・標準に関する資料です。
- Offical ISO 28500 WARC specification homepage
ウェブアーカイブを利用する研究者向け
- GLAM Workbench: Web Archives - ウェブアーカイブを研究へ利用するための資料です。 参照: https://netpreserveblog.wordpress.com/2020/05/28/asking-questions-with-web-archives/
- Archives Unleashed Toolkit documentation
- Tutorial for Humanities researchers about how to explore Arquivo.pt
ウェブ公開者向けリソース
これらは、サイトを確実にアーカイブ可能にしたいウェブ公開者や組織を支援するリソースです。
- Definition of Web Archivability - ウェブコンテンツの保存可能性を高めるためのリソースです。 参照: https://web.archive.org/web/20230728211501/https://library.stanford.edu/projects/web-archiving/archivability
- Archive Ready - ウェブページを正常に保存できる可能性を推定するツールです。
ツールとソフトウェア
この一覧では、ウェブアーカイブに関する主要かつ広く利用されるツールを簡潔に紹介します。詳細は、ほかのグループによる次の資料も参照し、可能なら貢献してください。
取得
- ArchiveBox - RSSフィードやブックマーク、リンクから加算的にアーカイブを維持するツール。wget、Chromeヘッドレス、その他手法を使用(かつては
Bookmark Archiver)。(開発中) - archivenow - ウェブリソースをオンデマンドウェブアーカイブにプッシュする Python library。(安定版)
- ArchiveWeb.Page - Chromeおよびその他のChromiumベースブラウザ向けのプラグインで、ウェブページをインタラクティブにアーカイブし、再現可能にし、WARC&WACZファイルとしてエクスポートできます。また、Electronベースのデスクトップアプリケーションとしても利用可能です。
- Auto Archiver - Google Sheetsドキュメントからソーシャルメディアの投稿、動画、画像を自動でアーカイブするPythonスクリプト。article about Auto Archiver on bellingcat.comを参照。
- Browsertrix Crawler - Chromiumベースの高精度なスクレイピングシステムで、複雑かつカスタマイズ可能なブラウザベースのスクレイピングを1つのDockerコンテナで実行できます。(安定版)
- Brozzler - 実際のブラウザ(ChromeまたはChromium)を使用してページと埋め込みURLを取得し、リンクを抽出する分散型ウェブスクレイパー(爬虫)です。(安定版)
- Cairn - ウェブページを保存するnpmパッケージおよびCLIツールです。(安定版)
- Chronicler - 記録と再現機能を備えたウェブブラウザです。(開発中)
- Community Archive - アーカイブされたTwitterデータを構築するためのツールとリソースを備えたオープンなTwitterデータベースとAPIです。
- crau - ウェブアーカイブとアーカイブの再生を行うための軽量コマンドラインツールです。URLのリストだけが必要です。名前「crau」はブラジル語での「crawl」の発音から来ています。(安定版)
- Crawl - Golangで書かれたシンプルなウェブスクレイパーです。(安定版)
- crocoite - ヘッドレスGoogle Chrome/Chromiumを使用してウェブサイトをスクレイピングし、リソース、静的DOMスナップショット、ページスクリーンショットをWARCファイルに保存します。(開発中)
- DiskerNet - WARCベースではないツールで、Chromeブラウザに接続し、閲覧したすべてのコンテンツをアーカイブし、オフラインでの再現が可能にします。(開発中)
- F(b)arc - archiving data from Facebook using the Graph API. *(Stable)*向けのA commandline tool and Python library。
- freeze-dry - ページを静的かつ自立したHTMLドキュメントに変換するJavaScriptライブラリ。ブラウザ拡張に有用です。(開発中)
- grab-site - アーカイバーのウェブスクレイパー:WARC出力、すべてのスクレイピングのダッシュボード、動的な無視パターン。(安定版)
- Heritrix - オープンソースで拡張可能で、ウェブスケール、アーカイブ品質のウェブスクレイパーです。(安定版)
- Heritrix Q&A - Heritrixの使用に関する質問や答えを尋ねるためのディスカッションフォーラムです。
- Heritrix Walkthrough - (開発中)
- html2warc - オフラインデータを1つのWARCファイルに変換するためのシンプルなスクリプトです。(安定版)
- HTTrack - オープンソースのウェブサイトコピーツールです。(安定版)
- monolith - ウェブページを1つのHTMLファイルとして保存するためのCLIツールです。(安定版)
- Obelisk - ウェブページを1つのHTMLファイルとして保存するためのGoパッケージおよびCLIツールです。(安定版)
- Scoop - 高精度で、ブラウザベースの、単一ページウェブアーカイブライブラリおよびCLI。ウェブを目の前にするためのツールです。(安定版)
- SingleFile - Firefox/Chrome向けのブラウザ拡張機能と、完全なページを1つのHTMLファイルとして忠実に保存するCLIツール。(安定版)
- SiteStory - ウェブクライアント(ブラウザ)とウェブサーバー間の取引を選別してキャプチャ・保存するトランザクショナルアーカイブ。(安定版)
- Social Feed Manager - Twitter、Tumblr、Flickr、Sina Weiboの公開APIからソーシャルメディアコレクションを作成できるオープンソースソフトウェア。(安定版)
- Squidwarc - ChromeまたはChrome Headlessを直接使用する open source, high-fidelity, page interacting アーカイブスクレイパー。(開発中)
- StormCrawler - Apache Storm上で低遅延かつスケーラブルなウェブクロールを構築するためのリソースのコレクション。(安定版)
- twarc - TwitterのJSONデータをアーカイブするためのコマンドラインツールとPythonライブラリ。(安定版)
- WAIL - anyone to preserve and replay web pages; Python, Electron. *(Stable)*向けのA graphical user interface (GUI) atop multiple web archiving tools intended to be used as an easy way。
- Warcprox - WARCを書き出すMITM HTTP/Sプロキシ。(安定版)
- WARCreate - archiving an individual webpage or website to a WARC file. *(Stable)*向けのA Google Chrome extension。
- Warcworker - Squidwarcに基づくオープンソース・ドッカー化・キュー付き・高精度なウェブアーカイブツールで、シンプルなウェブGUIを備える。(安定版)
- Wayback - ウェブページをインターネットアーカイブ、archive.today、IPFSなどにスナップショット保存できるツールキット。(安定及)
- Waybackpy - Wayback MachineのSave、CDX、可用性APIをPythonおよびコマンドラインツールで提供。(安定版)
- Web2Warc - 誰でも簡単に使い、高度にカスタマイズ可能なクロールツールで、自らの小さなウェブアーカイブ(WARC/CDX)を作成できる。(安定版)
- Web Curator Tool - 選別ウェブアーカイブ用のオープンソースワークフロー管理ツール。(安定版)
- WebMemex - FirefoxおよびChrome向けのブラウザ拡張機能で、訪問したウェブページをアーカイブできる。(開発中)
- Wget - オープンソースのファイル取得ツールで version 1.14 supports writing warcs を使用。(安定版)
- Wget-lua - Lua拡張付きのWget。(安定版)
- Wpull - Wgetに適合(または再実装/クローン/置き換え/代替)されたウェブダウンローダーおよびクロールツール。(安定版)
再生
- InterPlanetary Wayback (ipwb) - 保存済みウェブアーカイブを再生するツールです。 参照: https://ipfs.io/
- OpenWayback - 世界中のウェブアーカイブで使用されているWayback Machineという主要ソフトウェアを開発するためのオープンソースプロジェクト。(安定版)
- PYWB - ウェブアーカイブ再現ツールのPython 3実装、時折「Wayback Machine」とも呼ばれる。(安定版)
- Reconstructive - クライアントサイドで複合的なメメントを再構築するためのService Workerモジュール。リソースリクエストを対応するアーカイブコピーにリダイレクト(JavaScript)
- ReplayWeb.page - ローカルおよびリモートのWARCおよびWACZファイルを対象とした、ブラウザベースの完全クライアントサイド再現エンジン。また、Electronベースのデスクトップアプリケーションとしても利用可能。(安定版)
- warc2html - WARCファイルを静的HTMLに変換し、オフライン閲覧または再ホストに適した形式に変換。
検索と発見
- hyphe - 研究用途に向けたグラフィカルユーザーインターフェースを備えたウェブクロールツールで、ウェブアクターのリストとそれらの間のリンクマップから構成されたウェブコーパスを作成できる。(安定版)
- Mink - querying Memento aggregators while browsing and integrating live-archived web navigation. *(Stable)*向けのA Google Chrome extension。
- PANDORÆ - Solrエンドポイントにプラグインできるデスクトップ研究ソフトウェアで、ウェブアーカイブのクエリ、取得、標準化および視覚的に探索が可能。 (Stable)
- PastPage - ChromeおよびFirefox向けのブラウザ拡張機能で、ウェブページが破損または変更された場合に、Wayback Machineおよびその他のウェブアーカイブを並列で検索して復元。 (Stable)
- playback - searching archived webpages from Internet Archive, archive.today, Memento and beyond. *(In Development)*向けのA toolkit。
- SecurityTrails - WHOISおよびDNS記録を対象としたウェブベースのアーカイブ。REST APIは無料で提供。
- Tempas v1 - [Delicious](https://en.wikipedia.org/wiki/Delicious_(website) タグに基づく時系列ウェブアーカイブ検索。(安定版)
- Tempas v2 - 1996年から2013年のドイツウェブサイトから抽出されたリンクとアンカーテキストをもとにした時系列ウェブアーカイブ検索(結果はドイツページに限定されない、たとえば Obama@2005-2009 in Tempas なども含まれる)。(安定版)
- webarchive-discovery - WARCおよびARCの全文インデックスと検索ツール。以下に示されたインデックスを使用できる関連ツールも多数含まれる。 (Stable)
- Shine - 研究者と共同開発されたウェブアーカイブ探索UIのプロトタイプで、Big UK Domain Data for the Arts and Humanities projectの一環として制作されました。(安定版)
- SolrWayback - Javaを用いたバックエンドとVUE JSを用いたフロントエンドのプロジェクト。自由テキスト検索と内蔵された再生エンジンを備え、WARCファイルはWarc-Indexerでインデックスされる。ウェブアプリケーションには、全体のウェブアーカイブに対して利用可能なデータ可視化ツールおよびデータエクスポートツールが多数備わっている。SolrWayback 4 Bundle release には、すべてのソフトウェアと依存関係が組み込まれた即時インストール可能なソリューションが含まれている。
- Warclight - Project Blacklightに基づくRailsエンジンで、WARCおよびARC形式に保存されたウェブアーカイブの検索が可能。 (In Development)
- Wasp - 個人用 web archive and search system の完全に機能するプロトタイプ。 (開発中)
- ほかのフロントエンド候補は
webarchive-discoverywikiのこちら.
ユーティリティ
-
ArchiveTools - WARCファイルを抽出し、操作するためのツール集(Python)。
-
bagnabit2warc - ZIPに保存された bag-nabit データセットをフルコンテンツのWARCに変換。
-
cdx-toolkit - CDXインデックスの照会やWARCのサブセット抽出を行うためのライブラリおよびCLI。Common Crawlの異常なクロール構造を抽象化。 (Stable)
-
duckdb_warc - WARCファイルをクエリするためのDuckDB拡張。 (In Development)
-
duckdb-web-archive-cdx - Internet ArchiveおよびCommonCrawlのCDX APIをSQLから直接クエリするためのDuckDB拡張。 (In Development)
-
Go Get Crawl - Wayback Machine と Common Crawl を使用してウェブアーカイブデータを抽出。 (安定版)
-
gowarcserver - -0000 をベースにしたキャプチャインデックス(CDX)とWARCレコードサーバー。WARCファイルのインデックスと提供に使用(Go)。 BadgerDB
-
har2warc - HTTPアーカイブ(HAR)→ウェブアーカイブ(WARC)フォーマットへの変換(Python)。
-
httpreserve.info - ウェブページの状態を返すサービスまたはインターネットアーカイブに保存するサービス。HTTPreserveは、よく知られたショートリンクサービスの区別を可能にする。GETによりブラウザまたはCURLからJSONを返す。インターネットアーカイブ内の最初および最終日付を用いてウェブサイトを記述し、その範囲を用いて強固なリンクの構築を示す。 (Golang)。 (Stable)
-
HTTPreserve linkstat - httpreserve.info のコマンドライン実装でウェブページの状態を記述。スクリプト化が容易で、JQなどのツールでクエリ可能。HTTPreserve Linkstatは、archive.org 上の現在の状態、最も古いおよび最も新しいリンクを記述。(Golang)。 (安定版)
-
Internet Archive Library - interacting directly with archive.org. (Python). *(Stable)*向けのA command line tool and Python library。
-
httrack2warc - HTTrackアーカイブをWARCフォーマットに変換(Java)。
-
MementoMap - ウェブアーカイブの収蔵内容を要約するツール(Python)。 (In Development)
-
MemGator - Memento AggregatorのCLIおよびサーバー(Golang)。 (Stable)
-
OutbackCDX - OpenWayback, PyWb and Heritrix. *(Stable)*向けのRocksDB-based capture index (CDX) server supporting incremental updates and compression. Can be used as backend。
-
py-wasapi-client - WASAPIからクロールデータをダウンロードするためのコマンドラインアプリケーション(Python)。 (Stable)
-
The Unarchiver - 多数のアーカイブフォーマット(WARCを含む)のコンテンツをファイルシステムに抽出するプログラム。The Archive Browserの無料バージョン(macOS専用、プロプライエタリアプリ)。
-
tikalinkextract - Apache Tikaが解析可能なドキュメントタイプのフォルダからハイパーリンクを抽出し、ウェブアーカイブのシードとして利用(Golang、Apache Tikaサーバー)。 (In Development)
-
wasapi-downloader - WASAPIからクロールデータをダウンロードするためのJavaコマンドラインアプリケーション。 (Stable)
-
Warchaeology - WARCファイルの検証、操作、重複除去、検証を行うためのツール集。 (Stable)
-
warcdb - WARCファイルをSQLiteデータベースにインポートするためのコマンドラインユーティリティ(Python)。 (Stable)
-
warcbench - WARC(Web ARChive)ファイルからデータを探索・分析・変換・再組み合わせ・抽出するためのツール
-
warcdedupe - WARCの重複除去ツール(およびWARCライブラリ).(開発中)
-
WARC Explorer - WARCファイルおよび記録に対するブラウザベースのインスペクタ(クライアントサイド)
-
warc-safe - WARCファイル内のウイルスおよびNSFWコンテンツの自動検出
-
WarcPartitioner - MIMEタイプおよび年別にWARCファイルをパーティション(分割).(安定版)
-
warcrefs - Webアーカイブの重複除去ツール.(安定版)
-
webarchive-indexing - Hadoop、EMRまたはローカルファイルシステム上でWARC/ARCファイルの大量インデックス作成に使うツール
-
wikiteam - Wikiのダウンロードおよび保存に使うツール.(安定版)
WARC入出力ライブラリ
- FastWARC - 高パフォーマンスのWARCパーサーライブラリ(Python)
- HadoopConcatGz - Concatenated GZIP Files (and
*.warc.gz). *(Stable)*向けのA Splitable Hadoop InputFormat。 - jwarc - タイプセーフなAPIでWARCファイルを読み書きする(Java)
- Jwat - WARC/ARC/GZIPファイルの読み書きおよび検証に使うライブラリ(Java).(安定版)
- Jwat-Tools - WARC/ARC/GZIPファイルの読み書きおよび検証に使うツール(Java).(安定版)
- node-warc - WARCファイルを解析するか、WARCファイルを作成するには、いずれも Electron または chrome-remote-interface(Node.js)を使用できます。(安定版)
- Sparkling - インターネットアーカイブのSparklingデータ処理ライブラリ.(安定版)
- Unwarcit - WARCおよびWACZファイルをunzipするためのコマンドラインインターフェース(Python)
- warc - Rustで書かれたWARCファイルの読み書き用ライブラリ.(安定版)
- Warcat - Web ARChive(WARC)ファイルを扱うためのツールおよびライブラリ(Python).(安定版)
- Warcat-rs - Web ARChive(WARC)ファイルを扱うためのコマンドラインツールおよびRustライブラリ.(開発中)
- warcio - WARC/ARCライブラリで高速なウェブアーカイブIOを実現するストリーミングライブラリ(Python).(安定版)
- warctools - ARCおよびWARCファイルを扱うためのライブラン(Python)
- webarchive - ARCおよびWARCウェブアーカイブフォーマット向けのGolangリーダー(Golang)
分析
- Archives Research Compute Hub - Archive-Itウェブアーカイブコレクションの分散計算分析を行うウェブアプリケーション。 (安定版)
- ArchiveSpark - Webアーカイブ向けのApache Sparkフレームワーク(Apache Sparkを用いたものに限らず)で、データ処理、抽出、導出を容易に実現。 (安定版)
- Archives Unleashed Notebooks - Archives Unleashed Toolkitでウェブアーカイブを操作するノートブック、およびArchives Unleashed Toolkitによって生成された導出データ。 (安定版)
- Archives Unleashed Toolkit - Apache Sparkを用いたウェブアーカイブ分析を行うオープンソースプラットフォーム。 (安定版)
- Common Crawl Columnar Index - SQLクエリ可能なインデックス、CDX情報および言語分類を含む。 (安定版)
- Common Crawl Web Graph - ウェブのホストまたはドメインレベルのグラフ、およびランキング情報。 (安定版)
- Common Crawl Jupyter notebooks - Common Crawlのさまざまなデータセットを用いたノートブックのコレクション。 (安定版)
- Tweet Archvies Unleashed Toolkit - Apache Sparkを用いた、行ごとのJSON形式のTwitterアーカイブ分析を行うオープンソースツールキット。 (開発中)
- Web Data Commons - Common Crawlから抽出された構造化データ。 (安定版)
品質保証
- Chrome Check My Links - ブラウザ拡張機能:より多くのオプションを備えたリンクチェックツール。
- Chrome link checker - ブラウザ拡張機能:基本的なリンクチェックツール。
- Chrome link gopher - ブラウザ拡バージョン:ページ内のリンクを収集するツール。
- Chrome Open Multiple URLs - ブラウザ拡張機能:複数のURLを開き、テキストからURLを抽出する。
- Chrome Revolver - ブラウザ拡張機能:ブラウザのタブを切り替えられる。
- FlameShot - Ubuntuでのスクリーンキャプチャと注釈。
- PlayOnLinux - Ubuntu上でXenuおよびNotepad++を実行するための環境。
- PlayOnMac - macOS上でXenuおよびNotepad++を実行するための環境。
- Windows Snipping Tool - Windowsの標準機能による部分スクリーンキャプチャと注釈。macOSではCommand + Shift + 4(部分スクリーンキャプチャのキーボードショートカット)を使用可能です。
- WineBottler - macOS上でXenuおよびNotepad++を実行するための環境。
- xDoTool - Ubuntu上でクリック自動化。
- Xenu - Windows用のデスクトップリンクチェックツール
キュレーション
- Zotero Robust Links Extension - ウェブアーカイブの選定・整理を支援するツールです。 参照: https://www.zotero.org/ / https://github.com/lanl/Zotero-Robust-Links-Extension / https://github.com/leonkt/zotero-memento
コミュニティリソース
ほかのAwesomeリスト
ブログと研究
- IIPC Blog
- Web Archiving Roundtable - ウェブアーカイブラウンドテーブルの unofficial ブログ。Society of American Archivists のメンバが運営しています。
- The Web as History - オープンソースの書籍でウェブアーカイブ研究の概念的概観および複数の事例研究を提供
- WS-DL Blog - ウェブ科学およびデジタルライブラリ研究グループが、さまざまなウェブアーカイブ関連トピック、学術的な研究、および学術旅行報告についてブログ記事を公開
- DSHR’s Blog - デイビッド・ローゼンタールが、デジタル保存分野における研究のレビューと要約を行う
- UK Web Archive Blog
- Common Crawl Foundation Blog - rss
メーリングリスト
Slack
- IIPC Slack - access向けのAsk @netpreserve。
- Archives Unleashed Slack - access to a researcher group of people working with web archives向けのFill out this request form。
- Archivers Slack - archiving projects run in affiliation with and 向けの to a multi-disciplinary effort。 Invite yourself EDGI Data Together
- Common Crawl Foundation Partners - an invite)向けの(ask greg zat commoncrawl zot org。
Discord
- @commoncrawl - Common Crawl Foundationの公式ハンドル
- @NetPreserve - IIPCの公式ハンドル
- @WebSciDL - ODUウェブ科学およびデジタルライブラリ研究グループ
- #WebArchiving
- #WebArchiveWednesday
ウェブアーカイブサービス事業者
標準形式(WARCまたはWACZ)でウェブアーカイブをエクスポートできるサービスのみを掲載します。掲載は推薦を意味しないため、各自の要件に基づいて確認・評価してください。
セルフホスト可能なオープンソース
- Browsertrix - Webrecorder から、ソースコードは https://github.com/webrecorder/browsertrix に公開されています。
- Conifer - Rhizome から、ソースコードは https://github.com/Rhizome-Conifer に公開されています。
ホスト型クローズドソース
- Archive-It - ホスト型の商用ウェブアーカイブサービスです。
- Arkiwera
- Hanzo
- MirrorWeb
- PageFreezer
- Smarsh
公開データ
公開されているWARC、Wayback Machine、CDX APIエンドポイント、各種インデックスなどの一覧です。
- Common Crawl files - WARCs、CDXファイル、パラクエットURLインデックス、パラクエットホストインデックスなど
- Common Crawl CDX API - Common CrawlのCDX URLインデックスを検索
- Dead-Web Index - トップ1000万ドメインの到達可能性ラベル(生きている/ブロッキングされた/死んでいる)および2つのプローブアーム(礼儀正しいHTTPおよびブラウザTLSフィンガープリント)、2026年。CC BY 4、JSONL
- End of Term Archive - WARCs、CDXファイル、パラクエットURLインデックス
- Internet Archive Wayback - IAのウェイバックマシンのベースURL
- Webrecorder US GovArchive - 高精度再現
- UK Government Web Archive - UKGWAのメインページ