L’un des apports les plus décisifs de l’intelligence artificielle à l’architecture n’est ni la vitesse d’exécution, ni la génération d’images spectaculaires, mais la possibilité de construire ce que les chercheurs appellent un espace latent : un espace mathématique où les formes, les proportions, les matériaux et les usages d’un corpus architectural sont représentés sous forme de relations continues.
Pour lire le début de l’article, cliquer ici
NB : Cet article s’appuie sur un ensemble de retours recueillis auprès de collègues ABF autour des usages et des enjeux de l’IA dans nos pratiques. Il propose une synthèse collective, rédigée et structurée par France Chapron et Marc Louail.
Chaînage : articuler plusieurs modèles pour stabiliser l’interprétation
Dans les systèmes contemporains, l’intelligence artificielle n’agit jamais comme un bloc monolithique : elle procède par étapes successives, chacune confiée à un type de modèle spécialisé. La chaîne la plus couramment mobilisée dans la littérature —encodeur → transformeur → générateur → classificateur → vérificateur— décrit ce séquençage ; elle ne dit pas comment la machine “pense”, mais comment elle décompose.
L’encodeur extrait les caractéristiques essentielles d’une image ou d’un plan ; le transformeur les organise ; le générateur propose une reconstruction ou une variante ; le classificateur en évalue la cohérence ; le vérificateur contrôle si la sortie respecte des conditions préétablies. Cette logique est au fondement du Chain-of-Thought décrit par Wei et al. (OpenAI, 2022)1 , où un problème complexe n’est jamais traité d’un bloc mais distribué en opérations élémentaires.
Les modèles dits de diffusion —théorisés par Ho et al. (2020)2 — prolongent cette idée sous une autre forme : générer une image ou une forme, ce n’est pas produire un résultat instantané, mais parcourir un chemin, étape après étape, depuis un bruit initial jusqu’à une proposition stabilisée.
Appliquée au champ architectural, cette approche signifie que les tâches qui intéressent un service instructeur —reconnaître une typologie, détecter une rupture, vérifier une proportion, proposer une variante— ne relèvent jamais d’un seul modèle. Chacune est confiée au moteur statistique qui lui correspond.
L’intérêt pour les UDAP apparaît alors clairement : un enchaînement de modèles spécialisés pourrait préanalyser les pièces, repérer les incohérences, filtrer les erreurs matérielles, structurer les enjeux d’un dossier, sans jamais se substituer à l’arbitrage humain.
L’IA ne produit pas un jugement : elle segmente, ordonne et prépare le terrain du discernement.

Pixel et vecteur : deux visions du monde, deux capacités d’analyse

Le deep learning mobilise deux paradigmes complémentaires.
Le pixel : reconnaître la présence
Dans les approches basées sur l’image, la machine lit le réel comme une grille d’intensités. Elle excelle à détecter les textures, les motifs, les matériaux, les fissures, les menuiseries, les rythmes. C’est le domaine de la vision par ordinateur, développé notamment au MIT, à Stanford, à FAIR (Facebook AI Research).
Le vecteur : comprendre la structure
Dans les approches géométriques, la machine manipule des relations spatiales : segments, courbes, surfaces, topologies. Ces travaux —DeepSVG3 (Google Brain, 2020), ShapeNet4 (Princeton), le Geometry Processing5 Group du MIT— permettent de générer, ajuster ou corriger des formes vectorielles : aligner des ouvertures, proposer une variante de plan, ajuster une toiture.
Des expérimentations récentes —comme celles de Stanislas Chaillou6 sur la génération de plans à partir de corpus typologiques (2019/2024) — montrent comment un modèle peut proposer des variantes plausibles à partir de représentations vectorielles. Sans constituer un outil opérationnel, ces travaux donnent un aperçu des potentialités d’une géométrie apprenante appliquée au projet.
Ce second paradigme est essentiel pour l’architecture, car il permet de traiter non seulement la perception du bâti, mais sa logique constructive.
Puissance de calcul : accélération, seuils et limites physiques
L’essor récent du machine learning ne provient pas seulement d’innovations théoriques ; il est inséparable d’une montée en puissance spectaculaire des capacités de calcul. Les architectures profondes -réseaux convolutifs, transformeurs, modèles de diffusion— sont des machines statistiques gourmandes, qui exigent des milliards d’opérations pour apprendre, comparer, ajuster.
Depuis quinze ans, cette croissance repose essentiellement sur une industrie : NVIDIA, dont les GPU (Graphics Processing Units) ont transformé la recherche en IA en rendant possible une parallélisation massive des calculs. Les rapports techniques de NVIDIA, tout comme les analyses synthétiques de Patterson & Hennessy (A New Golden Age for Computer Architecture, 2018)7 , montrent que la puissance de calcul mobilisée pour l’entraînement des modèles double tous les six à neuf mois, suivant une cadence plus rapide que la loi de Moore.
Cette accélération a une conséquence directe : la capacité des modèles à absorber des corpus gigantesques —parfois « la quasi-totalité d’Internet » selon les estimations avancées par Gao et al. (2022)8 pour les grands modèles de langage). Elle explique également la rapidité avec laquelle les modèles peuvent parcourir l’espace latent, le raffiner, le re-projeter, et générer en quelques secondes des représentations complexes.
Mais cette croissance n’est pas indéfinie. Les ingénieurs eux-mêmes évoquent un horizon de saturation : limites thermiques des puces, coûts énergétiques croissants, rareté des matériaux, allongement des temps d’entraînement. NVIDIA parle désormais d’un “compute plateau”9 , un palier où l’augmentation brute de puissance cesse d’être soutenable sans innovations profondes (tensor cores spécialisés, architectures distribuées, optimisation algorithmique).
Pour le domaine architectural et patrimonial, ce constat a deux implications. D’une part, il explique la vélocité des outils actuels, capables de segmenter, reconnaître, proposer ou comparer à une vitesse autrefois inconcevable. D’autre part, il rappelle que cette accélération est elle-même une ressource rare, qui devra être pensée dans une logique de sobriété et de pertinence : ne pas demander à des modèles gigantesques ce qu’un modèle spécialisé, plus modeste et localisé, peut accomplir avec une efficacité suffisante.
Niveaux d’usage : situer l’IA dans les pratiques professionnelles
Cette montée en complexité s’accompagne d’une distinction nécessaire entre les différents niveaux d’usage de l’IA dans les métiers du projet. Comme le souligne Fabricio Vayra10 dans Machine Learning in Design Practice (ETH Zürich, 2022), quatre positions se dégagent :
- l’utilisateur, qui interroge un modèle comme un outil de consultation ;
- l’utilisateur-entraîneur, qui l’adapte ou l’affine en lui fournissant un corpus local ;
- l’ingénieur des données, qui conçoit les chaînes de traitement et organise les modèles en pipeline ;
- et enfin le chercheur, qui élabore les architectures profondes et les théories qui les sous-tendent.
Cette gradation ne relève pas d’une hiérarchie technicienne, mais d’une clarification des responsabilités : les services instructeurs ne deviendront pas des laboratoires d’IA, mais ils pourront orienter les modèles, choisir les corpus, définir les annotations et stabiliser les critères patrimoniaux qui guideront l’apprentissage. C’est à ce niveau —celui de l’utilisateur averti et de l’utilisateur-entraîneur— que se situe la contribution propre des UDAP : offrir à la machine un terrain d’apprentissage cohérent, pour qu’elle prépare la lecture sans jamais s’y substituer.
Applications à l’instruction : vers un modèle apprenant du projet patrimonial
Préparer le corpus : textes, images, avis
L’un des apports majeurs des modèles apprenants est de pouvoir absorber un corpus hétérogène —pièces écrites, pièces graphiques, registres photographiques, relevés numériques— et d’en extraire des régularités que l’œil humain repère intuitivement mais peine à formaliser. Pour le champ patrimonial, cette matière est abondante : notices descriptives, mémoires de matériaux, plans et façades, photographies contextuelles, relevés laser ou photogrammétriques, mais aussi et surtout le vaste corpus des avis émis par les architectes des bâtiments de France.
Chacun de ces corpus joue un rôle distinct :
- Les pièces écrites permettent de capter les intentions, le degré de transformation, le vocabulaire de justification ;
- Les pièces graphiques constituent la matière géométrique de l’espace latent : rythme des ouvertures, modénatures, profondeurs, gabarits, signatures matérielles ;
- Les photographies articulent l’objet au site, introduisant les notions de covisibilité, d’ambiance, de texture ;
- Enfin, les avis ABF forment un ensemble doctrinal d’une valeur exceptionnelle : ils expriment, de manière constante, les critères patrimoniaux à l’œuvre dans l’analyse et donc les dimensions mêmes qu’un modèle pourrait apprendre.
Ce corpus, au-delà d’un matériau d’entraînement, devient l’expression cumulative d’une culture du projet, d’une manière de lire les formes, d’identifier les ruptures, de qualifier les seuils de pertinence.
Construire un espace latent patrimonial : formes, matériaux, typologies
À partir de cette matière, un modèle apprenant pourrait construire un espace latent patrimonial, c’est-à-dire une géométrie statistique des formes locales. On y retrouverait les invariants d’un centre ancien —pentes de toiture, échelles de baies, trames de façades, rapports pleins-vides— mais aussi les variations plus fines : inclinaisons, textures, gabarits, transitions morphologiques.
Cet espace reproduit la logique des typologies patrimoniales —telles que définies par exemple par Philippe Panerai11 — employées pour modéliser des styles typographiques, des visages ou des formes urbaines qui pourrait structurer l’analyse patrimoniale.
L’intérêt, pour l’instruction, n’est donc pas dans la génération d’images, mais dans la capacité de cet espace latent à fournir un diagnostic de cohérence : non pas dire si un projet est acceptable, mais identifier ce qui, dans ses formes ou ses matériaux, s’écarte des régularités observées.
L’espace latent devient alors un outil de comparaison, un instrument d’écart, un révélateur.
Détecter les ruptures : matériaux, volumes, rythmes, covisibilités
L’un des points les plus délicats de l’instruction patrimoniale réside dans la détection des ruptures : celles qui portent sur les matériaux (PVC, enduits, teintes), celles qui relèvent de la volumétrie, celles qui tiennent à la répétition des baies, aux rythmes, aux rapports verticaux ou horizontaux, à la convenance de l’échelle.
Les approches fondées sur l’image —segmentation, classification, analyse texturale— permettent déjà d’identifier des artefacts :
- une menuiserie non conforme,
- une toiture discordante,
- une rupture d’alignement,
- une discontinuité de couleur.
Les approches vectorielles, elles, introduisent la possibilité d’analyser les relations spatiales : proportions, alignements, trames, épannelages.
Ces outils ne “décident” pas, mais ils signalent des points d’attention. Ils révèlent des zones où la forme se détache de son environnement morphologique, et où l’expertise humaine devient décisive.
Pré-instruction assistée : extraction, hiérarchisation, structuration
L’intérêt de ces outils n’est pas de produire un avis, mais de préparer la lecture. Une chaîne d’analyse pourrait :
- vérifier la complétude d’un dossier ;
- extraire les éléments significatifs d’une notice ;
- reconnaître la typologie d’un bâtiment ;
- identifier des incohérences graphiques ;
- confronter un projet aux régularités morphologiques du site ;
- proposer une hiérarchisation des enjeux : matière, volumétrie, covisibilité, réversibilité.
Dans cette logique, la machine ne remplace aucune étape du raisonnement ; elle en organise les préalables. L’ABF retrouve un terrain clarifié, où l’attention peut se porter immédiatement sur l’essentiel —ce qui, dans un projet, affecte l’identité d’un lieu.
Une UDAP recentrée sur le discernement
Ces transformations ne déplacent ni la responsabilité ni la doctrine des UDAP ; elles redistribuent les tâches. Là où l’instruction est aujourd’hui saturée par la complétude, la vérification formelle, la correction répétitive et l’accumulation de micro-gestes administratifs, les modèles apprenants pourraient restituer du temps aux dimensions les plus essentielles du métier : qualifier l’enjeu, contextualiser le projet, confronter les hypothèses, nourrir la discussion.
Le travail patrimonial ne trouve pas sa valeur dans la production d’avis en série, mais dans la part dialogique du métier —dans ce moment où l’on explique, où l’on argumente, où l’on accompagne. Les analyses du monde du travail montrent que le plaisir professionnel naît précisément de là : de la possibilité de débattre, d’exercer un jugement, d’interpréter une situation singulière plutôt que d’appliquer mécaniquement une procédure. L’autorité de l’ABF ne provient ni de la règle, ni du guichet, mais de cette capacité à faire dialoguer un lieu, un projet, une histoire.
Dans cette perspective, l’IA n’a pas vocation à automatiser l’instruction ; elle peut, au contraire, contribuer à réinstaller le métier au bon endroit. En confiant aux modèles apprenants la préparation du terrain —tri, structuration, extraction des points saillants— elle permet de consacrer l’essentiel du temps aux tâches qui constituent le cœur de la fonction : discerner, interpréter, négocier, arbitrer.
Les UDAP ne deviendront ni des centres de calcul, ni des laboratoires d’intelligence artificielle. Elles resteront des instances de médiation et de jugement. Mais elles pourront s’appuyer sur des outils qui organisent la matière brute, clarifient les écarts et stabilisent les critères, afin que le débat professionnel —ce qui fait la valeur du métier— puisse retrouver toute sa place.
Ces outils ne promettent pas une instruction plus mécanique : ils offrent la possibilité d’un travail plus juste, plus intelligible et plus profondément ancré dans l’essence même de la mission patrimoniale.
- Wei, Jason et al. Chain-of-Thought Prompting, Google/Stanford/OpenAI, 2022 ↩
- Ho, Jonathan et al. Denoising Diffusion Probabilistic Models, 2020 ↩
- DeepSVG, Google Brain, 2020 ↩
- ShapeNet: Chang et al., Princeton, 2015. ↩
- MIT Geometry Processing Group: travaux de Justin Solomon. ↩
- Chaillou, Stanislas. AI & Architecture. An Experimental Perspective. In Artificial Intelligence and Architecture : From Research to Practice, Birkhäuser / Taylor & Francis, 2024 ↩
- Patterson, David ; Hennessy, John. A New Golden Age for Computer Architecture, Communications of the ACM, 2018 ↩
- Gao et al. Scaling Laws for Neural Language Models, 2022 (estimations corpus). ↩
- NVIDIA Technical Reports, 2015–2023. ↩
- Vayra, Fabricio. Machine Learning in Design Practice. ETH Zürich, 2022 ↩
- Panerai, Philippe et al. Formes urbaines, Parenthèses, 1999. ↩
