Leçon 6 sur 7
Extraire des données du HTML
Le scraping consiste à extraire des données structurées d'une page HTML. Pour des motifs simples, re.findall suffit.
re.findall(r"<h2>(.*?)</h2>", html) renvoie la liste des contenus capturés par les parenthèses — le .*? non gourmand s'arrête à la première balise fermante.
import re names = re.findall(r"<h2>(.*?)</h2>", html)
🎯 Exercice
Extrayez de HTML la liste names des trois noms de produits (contenus des balises h2) avec re.findall, puis affichez names.
Leçon PRO
Ce chapitre avancé fait partie de CodeAge PRO. Débloque-le pour continuer ton aventure.
Découvrir PRO →