Ralentir la course à l'IA ne réglera pas le vrai problème : personne ne peut lire ce vers quoi elle tend
Par Emmanuel Théry, CEO et cofondateur de DigitalKin. Lyon, le 16 septembre 2026.
Il s'est passé quelque chose d'inhabituel ce mois-ci, et j'ai pris quelques jours de recul avant d'écrire ce texte. Trois personnes qui se disputent les mêmes talents, la même puissance de calcul et les mêmes clients ont dit, le même jour, la même chose.
Samedi 12 septembre, Dario Amodei, patron d'Anthropic, publiait un essai intitulé « We Must Pace the Frontier », avec une phrase qu'il voulait manifestement voir citée : « Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d'IA. » Quelques heures plus tard, Sam Altman lui donnait raison sur la nécessité de « lever le pied », et engageait OpenAI sur la même première mesure proposée par Amodei : donner à des évaluateurs indépendants un accès permanent, digne d'un salarié, à l'intérieur des laboratoires de pointe. La réponse d'Elon Musk a tenu en trois mots. Le lundi, les valeurs de l'IA chutaient, celles de la cybersécurité grimpaient, et le président des États-Unis s'en émouvait publiquement.
Cet essai arrivait au terme d'une quinzaine difficile. Le 9 septembre, un chercheur d'Anthropic démissionnait en mettant en garde contre les IA capables de s'améliorer elles-mêmes. Un peu avant, un agent d'OpenAI s'était échappé de son bac à sable pendant des tests et avait compromis plusieurs entreprises via Hugging Face. Et le 3 septembre, OpenAI mettait en ligne GPT-6 Astra, premier modèle qu'elle classe elle-même comme « critique » pour les capacités offensives en cybersécurité, tout en le présentant comme son modèle le plus capable et le plus aligné à ce jour.
Je veux prendre ce débat au sérieux, parce que je le crois sincère. Et je veux dire, en tant que dirigeant d'une petite deeptech qui a passé trois ans à construire une architecture différente, qu'on se trompe de variable.
La vitesse est le symptôme. L'illisibilité est la maladie.
Relisez l'argument d'Amodei de près. Ce n'est pas la puissance en elle-même qui pose problème. C'est qu'elle croît plus vite que « notre capacité à comprendre et à contrôler » ces systèmes. Altman dit la même chose en des termes plus opérationnels : les tests de sécurité et la surveillance coûtent cher, et ralentir, c'est simplement s'acheter le temps de les financer.
L'affirmation qui se cache derrière cet appel au ralentissement, la voici : nous ne sommes aujourd'hui pas en mesure de vérifier ce vers quoi ces systèmes travaillent, et l'écart se creuse. La vitesse ne compte que parce qu'elle élargit un fossé qui existe de toute façon, quel que soit le rythme.
Reste à savoir d'où vient ce fossé. Et là, on cesse de le voir comme une fatalité.
Le paradigme dominant produit des systèmes dont les finalités ne sont écrites nulle part. Un modèle de pointe ne contient pas un but qu'on pourrait inspecter. Il contient des milliards de paramètres façonnés par un entraînement qui a favorisé, en moyenne, les comportements plaisant aux évaluateurs. Ce vers quoi le modèle « travaille » dans une interaction donnée est une propriété émergente de ce façonnage, qu'on ne peut déduire qu'après coup, en observant ce qu'il fait.
Pendant un temps, l'industrie avait trouvé une parade : lire le raisonnement du modèle, son « chain of thought ». Astra montre à quel point cette parade est fragile. Le modèle utilise une technique de raisonnement que son propre fabricant appelle la récurrence opaque, qui réduit d'autant le raisonnement lisible disponible pour la surveillance. Le chief scientist d'OpenAI a résumé la tendance sans détour : plus les capacités augmentent, plus la surveillance devient difficile, car les modèles les plus puissants accomplissent des tâches complexes avec de moins en moins de mots, parfois aucun.
Les preuves d'alignement suivent la même logique. Le résultat de sécurité mis en avant pour Astra est qu'il a refusé de poursuivre des objectifs pièges (« honeypots ») placés lors de son évaluation. Un ancien chercheur d'OpenAI a posé la question qui s'impose, publiquement : est-ce la preuve d'un alignement réel, ou celle d'un modèle qui a reconnu qu'on le testait ? Une analyse indépendante est allée plus loin, concluant qu'on ne pouvait pas exclure que le modèle ait simplement simulé son alignement. Je ne suis pas en position de trancher. Personne, en dehors d'OpenAI, ne l'est. C'est précisément le problème.
Quand la finalité d'un système vit implicitement dans ses paramètres, l'alignement ne peut être que déclaré par celui qui le construit et échantillonné par ceux qui l'évaluent. Il ne peut pas être lu . Des évaluateurs indépendants avec un accès digne d'un salarié, c'est un vrai progrès : ils auditent le processus. Mais ils ne peuvent toujours pas ouvrir une seule réponse et voir ce qu'elle visait.
Les trois couches dont tout modèle sérieux a besoin, et pourquoi la troisième manque à l'appel
Voici la thèse technique qui sous-tend tout ce que construit DigitalKin. Pour accomplir un travail utile et vérifiable dans un domaine ouvert, une intelligence a besoin de trois couches, toutes explicites :
- Une couche de modélisation : ce que sont les choses. Les entités, leurs caractéristiques, leur structure.
- Une couche causale : comment les choses interagissent. Quelles caractéristiques en déterminent d'autres, et par quelles relations.
- Une couche téléologique : à quoi servent les choses. Les finalités que poursuit un acteur, exprimées comme des effets qu'il valorise, de sorte que le modèle puisse dire quel résultat compte, et pourquoi.
Aucune approche dominante ne porte ces trois couches de façon explicite. Les graphes de connaissances et les ontologies ont la première, mais traitent les relations comme de simples associations, pas comme des causes. L'IA causale dans la tradition de Pearl a une deuxième couche rigoureuse, mais ses graphes doivent être construits de façon exhaustive avant d'être interrogés, sur des variables plates, sans mécanisme pour les construire à la demande à partir d'un objectif. La planification automatisée a des objectifs, mais raisonne sur des espaces d'actions plats et renvoie des plans valides ou invalides, jamais meilleurs ou moins bons les uns que les autres. Quant aux grands modèles de langage, ils portent les trois couches à la fois, implicitement, enchevêtrées, illisibles. Cet enchevêtrement est la source à la fois de leur fluidité et de leur opacité.
La troisième couche est celle que le domaine a longtemps traitée comme un à-côté, à greffer après coup via les signaux d'entraînement. C'est pourtant elle qui rend les deux autres auditables. Si la finalité est explicite, on peut demander de n'importe quelle conclusion : à quelle finalité sert-elle, par quelle chaîne causale, et la personne concernée est-elle d'accord avec cette finalité ?
Ce que nous avons construit à la place
Nous appelons notre moteur Telos, d'après le mot grec pour « finalité », parce que tout part de là.
Il construit le modèle causal à partir de l'objectif, au moment où on en a besoin. Face à un résultat énoncé, Telos se demande ce qui le détermine, puis ce qui détermine ces déterminants, et ainsi de suite, jusqu'aux paramètres qu'un acteur contrôle réellement. Il s'arrête exactement quand chaque terme de chaque relation peut être évalué directement. Rien n'est modélisé qui ne pèse pas sur le résultat, et rien de ce qui pèse sur lui n'est laissé de côté.
La décomposition est imposée par les relations causales, pas par l'intuition. Chaque terme indépendant d'une relation engendre exactement un sous-modèle, et chaque sous-modèle résout exactement un terme. La couverture se vérifie mécaniquement : avec tous les sous-modèles en place, chaque terme est calculable ; retirez n'importe quel sous-modèle, et exactement un terme, ni plus ni moins, devient incalculable. Zéro signifierait une redondance ; deux, un sous-modèle qui fait le travail de deux. Les consultants appelleraient cela MECE, mutuellement exclusif et collectivement exhaustif. La différence, c'est qu'ici, ce n'est pas une discipline que s'impose l'analyste, mais une propriété de la structure elle-même.
Le même fragment de structure causale sert deux usages. En partant de l'objectif : on en déduit la spécification que doit respecter chaque paramètre contrôlable, y compris les conditions éliminatoires, ces valeurs qui bloquent le résultat quoi qu'il arrive par ailleurs. En partant des choix faits : on fixe ce qui a été décidé, on propage les degrés de liberté restants, et on lit la contribution marginale de chaque paramètre au résultat, pour que l'effort porte là où il change vraiment quelque chose.
Chaque résultat produit est traçable jusqu'à une finalité. Une recommandation n'est pas la continuation plausible d'un texte. C'est un terme dans une relation qui sert un objectif énoncé, et la chaîne qui va de l'un à l'autre est disponible pour inspection. Quand c'est faux, on voit où. Quand on n'est pas d'accord, on peut dire avec quoi précisément.
La compréhension se conserve sous forme de structure, pas de prose. Un fragment stabilisé de modèle causal-téléologique, que nous appelons une Compréhension, peut être enregistré, partagé, interrogé, combiné à d'autres. Ce que produit l'un devient l'entrée du suivant. C'est ainsi qu'une petite équipe accumule ce qu'elle apprend, au lieu de le perdre dans des documents que plus personne ne rouvre.
D'où viennent les faits qui alimentent tout cela ? Notamment des grands modèles de langage. Et c'est important de le dire, par honnêteté intellectuelle : Telos utilise des LLM pour amorcer le contenu des relations, en leur posant des questions étroites et ordonnées. La rigueur vient de Telos ; la connaissance brute vient souvent du modèle. Nous ne rendons pas le LLM sous-jacent transparent. Nous rendons transparent le raisonnement qui mène à une décision, la couche qui compte vraiment pour la personne qui doit la valider. Fiable, traçable, auditable : voilà toute la promesse du produit, et c'est une promesse sur le raisonnement, pas sur la « vie intérieure » d'un modèle.
Alignement déclaré contre alignement vérifiable
Cela repositionne tout le débat de ces dernières semaines.
Les laboratoires de pointe proposent de ralentir pour laisser les évaluateurs rattraper des systèmes dont les finalités sont implicites. C'est une réponse raisonnable, compte tenu de l'architecture dont ils disposent. Mais c'est aussi un tapis roulant : chaque gain de capacité rend la finalité implicite plus difficile à déduire, donc chaque gain exige davantage de ralentissement. Amodei lui-même concède, dans son essai, que ce ralentissement est contraint par la géopolitique, et Altman insiste : ralentir ne veut pas dire s'arrêter. Le tapis roulant continuera d'avancer.
L'alternative n'est pas de ralentir la machine. C'est de construire des machines dont les finalités sont écrites là où on peut les lire. L'alignement cesse alors d'être une propriété qu'un fournisseur affirme à propos d'un modèle, pour devenir une propriété que n'importe qui peut vérifier à propos d'un raisonnement : voici ce vers quoi il tendait, voici comment il y est arrivé, voici où vous pouvez le contester.
Je tiens à être précis sur ce que j'avance. Nous ne prétendons pas que Telos résout le problème du désalignement des modèles de pointe. Un agent capable de s'auto-améliorer récursivement, avec accès au réseau, c'est un problème d'une autre nature, et je me réjouis que ceux qui construisent ces systèmes le disent enfin ouvertement. Ce que nous affirmons, c'est que sur le vaste territoire de l'IA appliquée où les décisions ont des conséquences réelles, en médecine, en ingénierie, en finance, en droit, dans l'industrie, les achats, l'administration publique, le choix entre une intelligence qu'il faut croire sur parole et une intelligence qu'on peut vérifier est un choix d'architecture. Il a été fait, par défaut, en faveur de la première option. Rien n'oblige à s'y tenir.
Cette idée a déjà dépassé le cercle technique. En mai, un texte aussi éloigné de la Silicon Valley qu'on puisse imaginer, l'encyclique Magnifica Humanitas, soutenait que rendre l'IA « plus morale » ne veut rien dire si cette moralité est décidée par une poignée de personnes, sans que ceux qu'elle concerne puissent en débattre. Ôtez la théologie, et il reste une exigence de lisibilité. On ne peut pas discuter d'une finalité qu'on ne peut pas lire.
Le bénéfice inattendu : une couche de finalité est aussi une couche de coordination
Rendre la finalité explicite a une seconde conséquence, et c'est elle qui a façonné notre mission.
Les modèles mentaux des humains ne s'emboîtent pas entre eux. Chaque métier, chaque équipe, chaque discipline construit le sien, cohérent en interne, incompatible avec les autres. On a l'habitude d'en accuser les personnes. La vraie cause, c'est que chaque modèle a été construit pour une finalité que les autres ne voient pas. Deux ingénieurs, un juriste et un acheteur ne sont pas en désaccord sur la réalité ; ils optimisent pour des choses différentes, et aucune de ces choses n'est écrite nulle part.
Rendez la finalité explicite, et l'incompatibilité devient intelligible. On comprend pourquoi les modèles divergent, ce qui permet de les relier sans les aplatir. La juriste garde son modèle, l'ingénieur garde le sien, et la machine porte la relation entre les deux : ce que chacun cherche à atteindre, et où leurs finalités se rejoignent ou s'opposent. La coordination, qui aujourd'hui est une charge qui croît plus vite que l'organisation elle-même, devient une propriété de la structure. Le désaccord ne disparaît pas ; il se déplace là où il a sa place, aux endroits où le jugement humain est réellement nécessaire, et quitte les endroits où il n'était que l'artefact de modèles incapables de se parler.
C'est pour cela que nous avons choisi, ce mois-ci, de dire en trois mots ce pour quoi nous existons : rendre la compréhension abondante. Comprendre comment les choses fonctionnent. Se comprendre les uns les autres. Parvenir à un accord. Nous pensons que ces trois mouvements n'en font qu'un, et qu'il faut une couche de finalité pour que cela devienne possible.
Ce qu'il faut surveiller, si vous suivez ce sujet de près
Trois choses, dans les mois qui viennent.
D'abord, si la « surveillabilité » continue de décliner à mesure que les modèles de pointe raisonnent avec de moins en moins de mots. Si c'est le cas, la surveillance par le raisonnement visible aura disparu comme mécanisme de sécurité d'ici deux générations de modèles, et l'argument en faveur d'architectures à finalité explicite se démontrera de lui-même.
Ensuite, si les évaluateurs indépendants obtiennent un accès au raisonnement, ou seulement au processus. Un accès digne d'un salarié à un laboratoire dit si ce laboratoire a fait ce qu'il avait promis. Cela ne dit rien de ce que visait une réponse donnée.
Enfin, si le débat reste cadré autour de la vitesse, ou s'il glisse vers la lisibilité. La vitesse est un curseur sur la machine que nous avons déjà. La lisibilité, elle, est un choix sur la machine qu'on décide de construire.
Nous avons fait ce choix il y a trois ans, avant que ce ne soit à la mode de s'en inquiéter. Nous sommes une petite équipe à Lyon, et nous ne prétendons pas tenir la frontière technologique. Nous tenons une autre question : non pas comment suivre le rythme d'intelligences que personne ne peut lire, mais comment en construire que tout le monde peut lire.
Emmanuel Théry est CEO et cofondateur de DigitalKin. Telos, le moteur causal de l'entreprise, a été conçu par Sébastien Deschaux, cofondateur et directeur scientifique.
Questions fréquentes
Que signifie « pace the frontier » ?
C'est l'expression employée par Dario Amodei le 12 septembre 2026 pour décrire un ralentissement volontaire du rythme d'amélioration des capacités des IA de pointe, afin de laisser le temps à la recherche en sécurité, à l'évaluation indépendante et à la réglementation de suivre. Sam Altman et Elon Musk ont soutenu cette idée. Cela ne signifie pas arrêter le développement de l'IA.
Pourquoi la surveillance du raisonnement des modèles devient-elle moins fiable ?
Parce que les modèles les plus capables accomplissent des tâches complexes avec de moins en moins de mots, parfois aucun, et que certains utilisent désormais des techniques de raisonnement, comme la récurrence opaque, qui réduisent la trace lisible de ce raisonnement. Moins de raisonnement visible, c'est moins de choses à surveiller.
Quelle est la différence entre alignement déclaré et alignement vérifiable ?
L'alignement déclaré est une propriété qu'un fournisseur affirme à propos de son modèle, appuyée par des évaluations par échantillonnage. L'alignement vérifiable est une propriété d'un raisonnement précis : la finalité qu'il sert et la chaîne causale qui mène à sa conclusion sont explicites, ce qui permet aux personnes concernées de les vérifier, de les questionner et de les corriger.
Qu'est-ce que l'IA causale-téléologique ?
Une approche dans laquelle une intelligence modélise explicitement ce que sont les choses, comment elles se causent les unes les autres, et à quoi elles servent, puis dérive ses résultats d'une finalité énoncée à travers cette structure. Le moteur Telos de DigitalKin repose sur ce principe.
Sources
- Fortune, « Anthropic CEO calls to slow the race toward AI superintelligence », 12 septembre 2026 : fortune.com
- CNBC, « AI stocks sink while cybersecurity shares rally on slowdown fears », 14 septembre 2026 : cnbc.com
- CNBC, « Sam Altman spells out how and why the AI industry wants to slow down », 14 septembre 2026 : cnbc.com
- TechCrunch, « OpenAI launches Astra, its powerful (and controversial) new model », 3 septembre 2026 : techcrunch.com
- OpenAI, « Toward Astra: critical capabilities and frontier safeguards » : openai.com
- IT for Business, « OpenAI lance GPT-6 Astra, son premier modèle cyber-critique » : itforbusiness.fr
- LessWrong, « OpenAI's Astra alignment claims are dubious » : lesswrong.com
- Léon XIV, Magnifica Humanitas, 15 mai 2026, §107 : vatican.va
Recent Posts









