Retour au projet dans le portfolio

Anonymisation des données de production

Un déclencheur planifié GitHub Actions lance, sur l'instance d'administration, un dump de la base de production, son anonymisation, puis sa restauration dans la base de staging. Les deux bases ne sont jointes que par un tunnel : rien ne transite en dehors de l'instance.

Schéma générique : instances, dépôts, canaux et modules sont désignés par leur fonction. L'architecture est présentée à titre illustratif, indépendamment de toute organisation.

Étape du pipeline Service externe Données en clair Données anonymisées Instance d'administration
01 — dump, anonymisation, restauration

Pipeline production → staging

Le point qui compte : la donnée en clair n'existe que dans la moitié haute du schéma, à l'intérieur de l'instance. Ce qui traverse vers staging est déjà anonymisé.

GitHub Actions déclenchement planifié (schedule) instance d'administration 1 · extraction Dump script pg_dump Données de prod en clair Anonymisation script d'anonymisation dump anonymisé 2 · restauration Données anonymisées prêtes pour staging Restore script pg_restore Aucune donnée en clair ne quitte l'instance : le dump est anonymisé sur place avant restauration. RDS production données en clair connexion par tunnel RDS staging données anonymisées connexion par tunnel
Les deux tunnels ne sont jamais ouverts pour la même donnée : celui de gauche ne transporte que du dump brut vers l'instance, celui de droite ne transporte que de l'anonymisé vers staging.

Tous les schémas d'architecture