Du PDF à la fiche : comment avps.nc se construit tout seul

Dans l’article précédent, je te présentais avps.nc, le site qui rassemble toutes les offres d’emploi de la fonction publique calédonienne. Aujourd’hui, les coulisses. Pas pour faire une démonstration technique : pour que tu comprennes, si tu travailles dans une collectivité ou une organisation qui publie des PDFPortable document Format. Format d’échange de document permettant une lecture identique quelque soit le device ou l’OS sur lequel le document est utilisé., ce que tes propres documents pourraient devenir.
L’idée tient en une image. Imagine une usine où la matière première entre d’un côté, un PDF, et où trois produits finis sortent de l’autre : une page web, une ligne dans un jeu de données réutilisable, et une offre qui remonte dans Google. Sans qu’un ouvrier touche à rien.
Étape 1 : lire la source, et seulement ce qui a changé
Tout part de la DRHFPNC, qui publie chaque avis en données ouvertes sur data.gouv.nc : un tableau avec des colonnes (référence, dates, employeur, corps, nombre de postes…) et le PDF officiel.
Chaque nuit, un petit programme lit ce tableau. Il ne garde que les avis publiés, non clôturés, dont le PDF est disponible. Puis il compare chaque fichier à une empreinte qu’il a gardée de la veille. Nouveau ou modifié : on le traite. Identique : on ne touche à rien. Disparu : la fiche est archivée.
Ce point paraît anodin. C’est lui qui fait qu’un site peut tourner un an sans doublon ni fiche fantôme.
Étape 2 : faire lire le PDF par une IA, sans la laisser décider
Le tableau de la source est précieux, mais il ne dit pas tout : les missions, le contexte du poste, les habilitations, l’organigramme sont dans le PDF. C’est là qu’intervient une intelligence artificielle générativeL'IA générative est une catégorie d'intelligence artificielle capable de créer de nouveaux contenus (texte, images, sons, vidéos, code) à partir d'une… (GeminiGemini est l'assistant d'intelligence artificielle générative développé par Google, capable de dialoguer, de rédiger, d'analyser des images et de…). On lui donne le document et un gabarit strict, et elle renvoie une fiche structurée : intitulé, missions, profil, pièces à fournir, lieu, dates.
Et on applique une règle simple partout : quand la source donne déjà l’information, c’est la source qui gagne. Une date, un nombre de postes, une référence : le tableau est structuré, il ne se trompe pas. Un modèle qui relit un PDF peut se tromper. Il complète, il ne contredit pas.
Deux autres garde-fous : la fiche affiche toujours le lien vers le PDF officiel, qui fait seul foi, et une mention rappelle sur chaque page que le texte a été produit automatiquement. Ce n’est pas de la modestie, c’est de l’honnêteté envers le lecteur, et c’est ce que la réglementation européenne sur l’IAL'IA (Intelligence Artificielle) est un ensemble de technologies qui permettent à une machine d'imiter des fonctions cognitives humaines, telles que… demande désormais.

Étape 3 : relier aux référentiels
Une fiche isolée n’est pas très utile. Il faut la ranger.
Chaque offre est rapprochée du référentiel officiel des emplois de la fonction publique calédonienne, le RESPNC : 368 fiches d’emploi, regroupées en 41 familles. C’est ce rattachement qui place un poste dans « Santé publique soins » ou dans « Finances et budget », et qui lui donne un code ROME, la classification française des métiers que les outils d’emploi comprennent.
Le lieu de travail est géocodé pour apparaître sur la carte. Et chaque fiche reçoit une représentation mathématique de son sens (un « embeddingUn embedding (ou plongement) est la transformation d'un texte, d'une image ou d'un son en une longue liste de nombres qui en capture le sens. »), ce qui permet la recherche par le sens : « un poste d’encadrement en informatique à Nouméa » trouve les bonnes offres même si aucune ne contient exactement ces mots.
Étape 4 : publier, et prévenir les moteurs de recherche
La fiche est écrite dans un format texte tout simple (Markdown) et déposée dans le dépôt du site, qui se reconstruit automatiquement. Le site est statique : des pages toutes prêtes, pas de base de donnéesEnsemble d'informations, structurées ou non, accessibles au moyen d'un logiciel informatique de gestion de base de données. Il existe plusieurs types de… exposée, chargement instantané, empreinte minimale.
Dans la foulée, Google et Bing sont prévenus qu’une nouvelle page existe. Pourquoi ne pas attendre qu’ils la découvrent ? Parce qu’une offre vit trois à six semaines. Sur un site récent, la découverte naturelle peut prendre une bonne partie de ce délai. Une offre indexée le jour de sa clôture ne sert à personne.
Chaque page porte aussi le balisage standard que Google lit pour ses résultats emploi. C’est ce qui fait qu’un candidat qui tape « infirmier Koné » peut tomber sur l’offre sans connaître le site.

Étape 5 : rediffuser
La même donnée est ensuite servie sous plusieurs formes, pour que d’autres puissent la réutiliser sans rien demander : un catalogue complet des offres en JSON, une fiche structurée à côté de chaque page, des flux RSS par métier et par collectivité, un flux pour les agrégateurs d’emploi. Tout est décrit sur la page À propos.

Ce que ça coûte
C’est la question qu’on me pose en premier, alors répondons. La fonction publique calédonienne publie environ 2 300 avis par an. La lecture par IA de ces 2 300 documents coûte quelques euros par an. Les illustrations générées, une centaine. Ce qui pèse vraiment, c’est l’hébergement des images et le temps de maintenance.
Autrement dit : le coût n’est pas la barrière. La barrière, c’est de prendre le temps de concevoir la chaîne une fois, proprement.
Pourquoi ça dépasse l’emploi
Rien dans cette chaîne n’est propre aux offres d’emploi. Elle a besoin de trois choses : un corpus de PDF publiés régulièrement à un endroit stable, un gabarit qui décrit ce qu’on veut lire à la sortie, et un ou deux référentiels pour ranger.
Des textes juridiques publiés au Journal officiel. Des avis de marchés publics. Des comptes rendus de conseil municipal. Des arrêtés d’urbanisme. Des rapports d’activité. Tous ces documents dorment aujourd’hui dans des PDF, parfaitement publics et parfaitement invisibles. Structurés, ils deviennent cherchables par le sens, suivables par alerte, reliés entre eux, citables par une adresse stable. Et le document officiel reste, toujours, le seul qui fait foi : la structure s’ajoute autour de lui, elle ne le remplace pas.
C’est ce que j’ai voulu prouver avec avps.nc, sur un cas réel, en production, ouvert à tous. Si tu te demandes ce que tes propres PDF pourraient devenir, écris-moi : je te le montre sur tes documents plutôt que sur les miens.






