Banc d'Essai d'Ingénierie · Extraction & Parsing PDF

Colonnes, tableaux, icônes :
Ce qui survit vraiment au parsing de CV

En bref

Un parseur de CV ne voit pas une mise en page : il voit une suite de caractères qu'il doit remettre dans l'ordre. Certains éléments graphiques traversent cette étape intacts, d'autres la traversent dégradés, d'autres n'existent tout simplement pas pour lui. Une icône, une barre de niveau, un QR code ne sont pas du texte : ce sont des dessins, et un dessin ne s'extrait pas. Les colonnes et les tableaux, eux, ne disparaissent pas — ils se mélangent, ce qui est parfois pire, car le résultat reste lisible tout en étant faux.

Nous avons soumis chaque brique de design (colonnes, tableaux, badges, jauges, icônes, puces) à 5 moteurs d'extraction de référence. Voici le verdict d'ingénierie élément par élément.

ML
Maël Le Gal Expert Recrutement & Alternance

Fondateur de CV Mastery • Données issues de l'Observatoire & Études de Marché

📅 Mis à jour : 19 Août 2026⏱️ 30 min de lectureLinkedIn

Cet article traite un élément à la fois. Pour le trajet complet du document, de l'octet à la fiche du recruteur, voyez ce que les ATS font de votre CV ; pour les fautes de composition les plus fréquentes, les erreurs qui cassent la lecture automatique. Les principes de composition applicables se trouvent dans la mise en page d'un CV d'alternance.

1Les familles de moteurs d'extraction, et ce qui les sépare

Pour obtenir un verdict universel, nous avons soumis chaque élément de design à 5 briques d'extraction représentatives des architectures logicielles utilisées dans l'industrie du recrutement :

1. Sovren / DaXtra Engine

Le moteur d'analyse sémantique haut de gamme utilisé par Greenhouse, Lever, et des dizaines de plateformes RH d'entreprises technologiques. Utilise des modèles avancés de reconstruction spatiale.

2. Textkernel v8

Le leader européen du parsing multilingue, intégré dans de nombreux portails de grands comptes, d'agences d'intérim et de cabinets de recrutement internationaux.

3. Apache Tika (Moteur Standard)

La bibliothèque open-source d'extraction de métadonnées et de texte la plus répandue au monde, servant de base aux architectures cloud sur mesure (AWS, GCP, Azure).

4. pdfminer.six (Python Core)

L'outil d'analyse structurelle de référence utilisé pour disséquer les coordonnées géométriques ($X, Y$), la table des fontes et l'arborescence des objets PDF.

5. Poppler pdftotext (-layout mode)

Le binaire de référence sous Linux pour émuler l'extraction de texte respectant la grille visuelle de la page.

2Le verdict détaillé par élément graphique

2.1 Les Doubles et Triples Colonnes

Le cas : un CV avec une colonne gauche étroite (contact, compétences, langues) et une colonne droite large (profil, expériences, formation) — la mise en page la plus répandue dans les modèles gratuits.

Sovren / Textkernel :
✅ Colonnes lues séparément, dans l'ordre
Apache Tika :
❌ Lecture horizontale : les deux colonnes fusionnent
pdfminer :
⚠️ Dépend du paramètre LAParams

Verdict d'ingénierie : Les doubles colonnes sont tolérées par les ATS de scale-ups, mais présentent un risque critique sur les plateformes de grands groupes (Workday, Taleo, Tika).

2.2 Les Tableaux Simples vs Imbriqués

Cas A — tableau simple à une ligne : Date à gauche (09/2024 - 08/2025) et Titre de poste à droite (Chef de Projet Data).

✅ Traverse le parsing intact. La proximité horizontale immédiate suffit à associer la date au poste.

Cas B — tableaux imbriqués (grille de mise en page) : Grille de compétences avec 4 cellules contenant chacune un sous-tableau avec logos et notes.

❌ Ne traverse pas le parsing. Les cellules internes sortent dans un ordre arbitraire, mêlant les noms de logiciels aux descriptions d'autres rubriques.

2.3 Les Icônes SVG, PNG et FontAwesome

Le cas : un glyphe d'enveloppe pour l'email, un pictogramme de combiné pour le téléphone, le logo GitHub pour le portfolio — sans le mot correspondant écrit à côté.

Rendu extrait :
<Image Object /X3> jean.dupont@email.com
 06 12 34 56 78
<Path Vector> (Lien GitHub perdu si absence d'URL textuelle)

Verdict d'ingénierie : Les icônes n'apportent aucune valeur technique à l'extraction. Si une information dépend exclusivement d'une icône pour être comprise, elle est perdue.

2.4 Les Barres de Progression et Étoiles

Le cas : « Python » suivi d'une barre de progression partiellement remplie (un rectangle vectoriel coloré).

⚠️ Le mot « Python » est indexé, le rectangle est ignoré — ce n'est pas du texte. Le niveau que la barre représentait n'existe nulle part dans la fiche : ni « avancé », ni rien.

2.5 Les Hyperliens et QR Codes

Cas A — hyperlien écrit en toutes lettres : linkedin.com/in/jean-dupont, cliquable. → ✅ L'URL est du texte, donc elle est extraite.

Cas B — QR code vers le portfolio : une image en haut à droite. → ❌ Invisible pour un parseur : aucune information n'en sort. Écrivez l'URL à côté.

3Récapitulatif : ce qui traverse le parsing, et ce qui n'en sort pas

Élément par élément, ce que le parsing en fait. Les verdicts sont qualitatifs : nous ne publions pas de taux, parce que nous n'en avons pas mesuré.

Élément de DesignVerdictCe qui se passeRecommandation
Texte Unicolonne LinéaireTraverse intactExtraction parfaite, chronologie intacte.FORTEMENT CONSEILLÉ
Tableau simple 1 ligne (alignement)Traverse intactSérialisation propre des paires clé/valeur.AUTORISÉ
Hyperlien URL en clairTraverse intactExtraction de l'ancre et du dictionnaire /URI.CONSEILLÉ
Double Colonne (Sidebar gauche)Dépend du moteurPasse sur ATS modernes, casse sur ATS legacy.À MANIER AVEC PRÉCAUTION
Barres de progression graphiquesPerd le niveauMot-clé conservé, niveau d'expertise perdu.À PROSCRIRE
Tableaux imbriqués complexesSe mélangeMélange anarchique des blocs de texte.À PROSCRIRE
QR CodesDisparaîtTotalement ignoré par la couche textuelle.INUTILE
Accélérateur de recherche

Marre de te faire ghoster par les recruteurs ? 🕵️‍♂️

Découvre notre Radar à Offres Cachées et accède à 2000+ entreprises qui recrutent en alternance en ce moment même.

Noté 4.8/5 par nos utilisateurs
Tester le Radar Gratuitement

⚡️ Sans carte bancaire • Résultats en 60s

4Commandes CLI pour tester votre CV en local (Reproduction)

Pour vérifier scientifiquement la robustesse de votre fichier PDF avant de candidater, vous pouvez exécuter ces commandes dans votre terminal (macOS ou Linux) :

# 1. Tester l'ordre séquentiel brut avec Poppler
pdftotext -layout mon_cv.pdf test_layout.txt
cat test_layout.txt
# 2. Vérifier la présence de polices corrompues ou sans table ToUnicode
pdffonts mon_cv.pdf
# 3. Extraire le texte avec pdfminer en Python
python3 -m pdfminer.high_level extract_text mon_cv.pdf

Foire aux questions sur les éléments de design

1. Les CV à 2 colonnes sont-ils totalement éliminés par les ATS ?

Cela dépend entièrement du moteur d'extraction. Les parseurs récents disposent d'heuristiques de reconstruction spatiale qui identifient les colonnes et les lisent dans le bon ordre. Les extracteurs bas niveau (Apache Tika sans heuristique de disposition, pdfminer brut) et les déploiements anciens n'en ont pas : ils lisent chaque ligne sur toute la largeur de la page et fusionnent le contenu des deux colonnes. Comme vous ne savez jamais lequel lira votre CV, une seule colonne reste le choix qui ne dépend pas du destinataire.

2. Les icônes de contact (téléphone, enveloppe, LinkedIn) sont-elles reconnues ?

Les icônes graphiques (images raster ou tracés vectoriels) sont totalement invisibles aux parseurs textuels. Si vous remplacez le mot 'Email :' par un dessin d'enveloppe, l'ATS ne voit pas le dessin, mais il détectera l'adresse email grâce à une expression régulière sur le motif '@'. En revanche, pour le profil LinkedIn ou GitHub, si vous mettez uniquement le logo sans lien URL en clair, le profil sera ignoré.

3. Les tableaux Word simples survivent-ils au parsing ?

Oui, les tableaux simples à une ligne et deux colonnes (utilisés pour aligner une date à gauche et un poste à droite) sont correctement sérialisés par la quasi-totalité des parseurs. Ce sont les tableaux imbriqués (un tableau inséré à l'intérieur d'une cellule) et les tableaux sans en-têtes définis qui provoquent des corruptions de texte.

4. Pourquoi les QR codes sur un CV sont-ils une erreur pour les ATS ?

Un QR code est une image matricielle (bitmap) qui ne contient aucune information textuelle dans la couche vectorielle du PDF. Aucun ATS ne décode les QR codes lors de l'ingestion automatique de documents. L'espace occupé par le QR code est un espace perdu pour des mots-clés utiles.

5. Quelle est la différence entre un tableau HTML/Word et un tableau vectoriel PDF ?

Dans Word ou HTML, les balises de tableau (<table>, <tr>, <td>) indiquent formellement les relations logiques entre les données. Dans un PDF standard non balisé, les lignes du tableau ne sont que des tracés géométriques (/Path) et le texte est positionné librement : le parseur doit 'deviner' s'il s'agit d'un tableau ou de deux paragraphes côte à côte.

6. Les hyperliens cliquables sont-ils conservés lors de l'extraction ATS ?

Oui, la majorité des ATS extraient les dictionnaires d'annotations de liens (/Annot /Subtype /Link). Toutefois, il est fortement recommandé d'écrire l'URL sous une forme lisible (ex: 'linkedin.com/in/nom-prenom') plutôt qu'un texte masqué (ex: 'Cliquez ici'), afin que le lien reste exploitable si le recruteur imprime le document ou si le lien est converti en texte brut.

7. Les bordures décoratives ou fonds colorés bloquent-ils la lecture ?

Les fonds colorés et bordures vectorielles sont ignorés par les parseurs de texte, à condition que le texte situé au-dessus reste encodé en caractères vectoriels standards et qu'il ne soit pas fusionné dans une image aplatie. Attention toutefois au contraste : un texte blanc sur fond sombre peut devenir illisible si l'ATS convertit le document en noir et blanc.

8. Comment tester la disposition de mon CV en ligne de commande ?

Vous pouvez utiliser l'utilitaire open-source Poppler en exécutant la commande 'pdftotext -layout mon_cv.pdf test.txt'. Le fichier texte généré reproduit exactement la disposition spatiale et l'ordre des tokens tels qu'ils sont perçus par les parseurs standards du marché.

9. Les polices d'icônes comme FontAwesome sont-elles risquées ?

Oui. Les polices d'icônes utilisent des points de code Unicode situés dans la 'Private Use Area' (U+E000 à U+F8FF). Pour un ATS, ces codes ne correspondent à aucune lettre de l'alphabet et génèrent des caractères corrompus (mojibake) qui peuvent couper une phrase en deux.

10. Vaut-il mieux un CV unicolonne 'moche' ou un CV 2 colonnes 'design' ?

C'est un faux dilemme. Un CV peut être visuellement soigné, élégant et typographiquement remarquable tout en conservant une structure sémantique unicolonne ou un modèle à 2 colonnes strictement balisé et ordonné dans le flux d'instructions PDF.

Vérifiez la résistance de vos colonnes et tableaux

Notre analyseur inspecte directement la couche vectorielle de votre PDF pour détecter toute anomalie de lecture avant qu'un recruteur ne reçoive votre dossier.