08Archives & traçabilité16 outils
Retrouver ce qui a disparu, prouver ce qu’on a vu
Une page retirée n’est pas perdue, et une capture d’écran ne vaut rien sans horodatage vérifiable. Ces outils servent autant à retrouver un contenu supprimé qu’à figer une preuve dont la date sera opposable.
- Outils
- 16
- Sous licence libre
- 13
- Plateformes
- 2
Apprendre Archives & traçabilité
avant les outils
Par où commencer
On commence par figer la page avant même de la lire : l’enregistrement immédiat proposé par Wayback Machine produit un instantané daté et une adresse stable, tandis qu’archive.today en rend une copie aplatie qui survit mieux aux pages dynamiques. On consulte ensuite le calendrier des captures antérieures, car l’information utile se trouve souvent dans l’écart entre deux versions.
Progression
1Découverte
Figer une page, remonter son historique
On enregistre l’adresse dans Wayback Machine puis dans archive.today, et l’extension Web Archives interroge d’un seul geste les autres archives publiques pour voir ce qui existe déjà. SingleFile complète le dispositif en gardant sur le disque une copie autonome de la page telle qu’elle s’affichait.
- Wayback Machine
- archive.today
- Web Archives
- SingleFile
2Pratique
Documenter la collecte, pas seulement la page
Hunchly capture en arrière-plan chaque page consultée pendant une session et en conserve l’empreinte, ce qui évite les captures d’écran reconstituées après coup ; Perma.cc fournit un lien pérenne citable et ArchiveBox garde l’ensemble sur une instance maîtrisée. Un horodatage OpenTimestamps appliqué à l’empreinte du fichier atteste ensuite que la copie existait bien à cette date.
- Hunchly
- Perma.cc
- ArchiveBox
- OpenTimestamps
3Approfondissement
Passer à l’échelle et rejouer hors ligne
waymore ratisse les URL historiques d’un domaine, waybackpack et Wayback Machine Downloader rapatrient les versions successives, waybackpy sert de socle pour scripter l’ensemble. Pour une collecte qu’on veut rejouer telle quelle, Browsertrix Crawler et ArchiveWeb.page produisent des archives que ReplayWeb.page rouvre sans réseau, et Auto Archiver industrialise le suivi d’une liste de liens.
- waymore
- waybackpack
- Wayback Machine Downloader
- waybackpy
- Browsertrix Crawler
- ArchiveWeb.page
- ReplayWeb.page
- Auto Archiver
Ce qu’on apprend à ses dépens
Archiver n’est pas un geste discret : une capture demandée à Wayback Machine ou à archive.today s’exécute depuis les serveurs de l’archive, laisse une trace dans les journaux du site visé et fait apparaître l’instantané dans un calendrier public que le propriétaire de l’adresse peut surveiller. L’archive publique n’est pas non plus définitive, puisque des captures sont retirées à la demande, et la date affichée porte sur le document principal, pas sur les images ou les scripts rejoués, qui peuvent provenir d’autres dates. Ce qui tient dans la durée, c’est une copie locale dont l’empreinte a été horodatée indépendamment, avec l’URL exacte, l’heure et la méthode de collecte consignées au moment même.
Les outils
16 entrées
3 outils de cette catégorie ne sont pas sous licence libre : ils portent la mention « non libre » ou « service hébergé ». Leur code n’est pas public, ou leur usage dépend d’un service tiers.
Consulte et enregistre les versions archivées d’une page web depuis 1996
Service hébergé par un tiers, sans dépôt logiciel à suivre.
web.archive.org
Fige une page dans une capture datée, y compris quand le Wayback Machine échoue
Service hébergé par un tiers, sans dépôt logiciel à suivre.
archive.ph
Crée un lien de citation permanent vers une capture horodatée, hébergée par des bibliothèques
perma.cc
Cherche la version archivée d’une page dans plusieurs archives depuis le menu contextuel
github.com
Enregistre automatiquement chaque page visitée avec URL, horodatage, empreinte et capture
Service hébergé par un tiers, sans dépôt logiciel à suivre.
hunch.ly
Archive en lot des URL, vidéos et publications sociales avec leurs métadonnées et empreintes
github.com
Auto-héberge une archive personnelle des pages soumises, en HTML, PDF, WARC et captures
github.com
Explore un site avec un navigateur réel et produit une archive WARC ou WACZ rejouable
github.com
Enregistre la navigation en cours, pages authentifiées comprises, dans un fichier WACZ
github.com
Rejoue une archive WARC ou WACZ dans le navigateur, sans serveur ni téléversement
github.com
Enregistre une page complète, images et styles compris, dans un seul fichier HTML
github.com
Collecte les URL connues d’un domaine dans sept archives et télécharge les réponses stockées
github.com
Télécharge en ligne de commande toutes les versions archivées d’une URL, datées par dossier
Le dépôt reçoit encore des corrections, mais aucune version depuis plus d’un an.
github.com
Horodate un fichier de preuve dans la blockchain Bitcoin, vérifiable par un tiers
Le dépôt reçoit encore des corrections, mais aucune version depuis plus d’un an.
github.com
Interroge et alimente le Wayback Machine depuis Python ou la ligne de commande
Le projet n’est plus maintenu : aucun correctif n’est à attendre, y compris pour une faille.
À la place waybackpack — Couvre le même besoin et reste maintenu.
github.com
Reconstitue localement un site entier à partir de ses captures du Wayback Machine
Le projet n’est plus maintenu : aucun correctif n’est à attendre, y compris pour une faille.
À la place wayback-machine-downloader-straw — Couvre le même besoin et reste maintenu.
github.com