CodeAgeBy Sitezack
Python appliqué pour ProsFichiers, CSV et API0 XP
Progression du chapitre0/6

Leçon 6 sur 7

Extraire des données du HTML

Le scraping consiste à extraire des données structurées d'une page HTML. Pour des motifs simples, re.findall suffit.

re.findall(r"<h2>(.*?)</h2>", html) renvoie la liste des contenus capturés par les parenthèses — le .*? non gourmand s'arrête à la première balise fermante.

import re
names = re.findall(r"<h2>(.*?)</h2>", html)

🎯 Exercice

Extrayez de HTML la liste names des trois noms de produits (contenus des balises h2) avec re.findall, puis affichez names.

Leçon PRO

Ce chapitre avancé fait partie de CodeAge PRO. Débloque-le pour continuer ton aventure.

Découvrir PRO