Il est tard, et une question arrive comme elles arrivent d’habitude, de biais, à partir d’une lecture à moitié faite : quelle est la différence entre un virus et un viroïde ? Je n’ouvre pas le navigateur et ses onze onglets, ni l’un des grands modèles hébergés. Je tape la question dans une fenêtre de ma propre machine et, quelques secondes plus tard, une réponse s’affiche. Un viroïde est une boucle nue d’ARN, sans capside, sans gène codant pour une protéine, un parasite réduit presque à un seul geste. La réponse n’est pas brillante. Elle est suffisante, elle est immédiate, et elle n’a jamais quitté la pièce.

La machine est un Mac doté d’une puce M4 et de 24 gigaoctets de mémoire, modeste pour qui entraîne des modèles et parfaitement ordinaire pour qui n’en entraîne pas. Il n’écrit pas mon code. Il ne fait pas mes recherches. Il ne peut rivaliser avec les systèmes de pointe sur une démonstration difficile ou une longue synthèse, et je ne le lui demande pas. Je m’en sers comme d’autres générations se servaient du Petit Larousse posé sur l’étagère, celui qui « sème à tout vent » : comme du premier arrêt pour une question trop petite pour justifier un déplacement.

I. Un dictionnaire, pas un oracle

« Petit » est une relation, non un verdict. Un modèle qui se ridiculiserait à un test d’ingénierie logicielle peut encore expliquer pourquoi le ciel est plus sombre au zénith qu’à l’horizon, ce que veut dire satisficing, ou comment un ribosome lit un codon. Herbert Simon a forgé ce mot pour la décision assez bonne plutôt qu’optimale, et il n’y voyait pas un aveu de paresse. Avec un temps et une attention limités, soutenait-il, c’est à cela que ressemble la rationalité limitée quand elle fonctionne.

Ce qui rend l’arrangement possible tient surtout à l’arithmétique. Un modèle de huit à quatorze milliards de paramètres, quantifié de seize bits par poids à environ quatre, tient dans cinq à neuf gigaoctets, assez peu pour partager la mémoire avec tout ce que fait par ailleurs un ordinateur portable. Des projets comme llama.cpp et MLX, chez Apple, ont fait de cette compression quelque chose qu’un non-spécialiste peut installer en un après-midi. Le nombre de paramètres ne mesure pas toute la qualité, et la quantification a un coût, mais pour les définitions, les explications et les premières orientations, la perte est souvent moindre que le gain en proximité.

Les ouvrages de référence n’ont jamais été infaillibles, et personne ne l’attendait d’eux. Le Dictionary of the English Language de Samuel Johnson (1755) définissait le pastern, le paturon, comme « le genou du cheval ». Ce n’en est pas un. Quand une dame lui demanda comment il avait pu commettre pareille erreur, Boswell rapporte la réponse : « L’ignorance, madame, la pure ignorance. » Le livre resta indispensable pendant un siècle. Ses lecteurs savaient quel genre d’objet ils tenaient entre les mains.

II. Qui d’autre est dans la pièce

La différence entre un modèle local et un modèle hébergé n’est pas l’intelligence. C’est le nombre de parties à la conversation.

Une question envoyée à un service de pointe devient un enregistrement détenu par une entreprise, régi par sa politique de conservation, stocké sur son infrastructure et accessible à toute loi qui atteint cette entreprise. Aux États-Unis, cette portée est large. La doctrine du tiers, bâtie sur United States v. Miller (1976) et Smith v. Maryland (1979), veut qu’une information confiée volontairement à un tiers ne bénéficie que d’une attente de confidentialité réduite. Carpenter v. United States (2018) l’a restreinte pour les données de localisation des téléphones, sans l’abolir. Le CLOUD Act de la même année a précisé que les fournisseurs américains doivent produire les données sous leur garde, où que se trouvent les serveurs. Et en 2025, un tribunal fédéral, dans l’affaire The New York Times v. Microsoft and OpenAI, a ordonné à OpenAI de conserver des conversations d’utilisateurs qu’elle aurait autrement effacées, y compris celles que les utilisateurs avaient eux-mêmes supprimées.

Rien de cela ne signifie que quelqu’un lit ma question sur les viroïdes. La plupart des requêtes ne sont jamais vues par un humain, et les entreprises publient des rapports de transparence et contestent certaines demandes en justice. Le propos est plus étroit. Chaque question envoyée ailleurs me demande de faire confiance à une chaîne de politiques, d’employés, de sous-traitants et de juridictions que je ne peux pas inspecter. Pour un contrat, une base de code ou un problème de recherche difficile, cette confiance peut valoir la peine. Pour le sens d’un mot, c’est un drôle de prix à payer par défaut.

III. Le bureau de renseignements ne demandait jamais pourquoi

Les bibliothèques l’ont compris bien avant le logiciel. L’entretien de référence apprend aux bibliothécaires à préciser ce dont un lecteur a besoin sans exiger qu’il dise pourquoi. En 2005, quatre bibliothécaires du Connecticut, membres d’un consortium nommé Library Connection, reçurent une National Security Letter réclamant des fichiers de lecteurs et, sous le coup d’une interdiction de divulgation, saisirent la justice plutôt que d’obtempérer en silence ; l’affaire devint Doe v. Gonzales. L’instinct de la profession était qu’une question posée au comptoir appartient à celui qui l’a posée.

Il existe des preuves que cet instinct compte. Après les révélations d’Edward Snowden en 2013 sur des programmes comme PRISM, le juriste Jonathon Penney a mesuré la fréquentation des articles de Wikipédia consacrés au terrorisme et à la sécurité et constaté une chute nette et durable. Personne n’avait été arrêté pour avoir lu sur Al-Qaïda. Les gens étaient simplement devenus moins disposés à regarder. C’est cela, un effet dissuasif : non une punition, mais le retrait silencieux de la curiosité par anticipation d’être vu.

Certaines questions sont banales, d’autres gênantes, d’autres touchent à la santé ou à la politique, et d’autres ne regardent personne sans raison particulière. Un modèle local abaisse le coût de les poser toutes. Cela ne les rend pas plus importantes. Cela les rend plus faciles à poser.

IV. Ce que « local » ne veut pas dire

Le mot « local » peut devenir sa propre superstition. Les poids sont sur mon disque et le calcul se fait sur ma puce, mais l’application qui les enveloppe peut encore envoyer de la télémétrie, garder l’historique des échanges dans un fichier en clair, synchroniser ce fichier vers une sauvegarde dans le nuage, ou appeler un outil de recherche web quand j’oublie qu’il est activé. Le système d’exploitation indexe ce qu’il trouve. Une extension du navigateur peut lire la fenêtre. Le profil du NIST sur les risques de l’IA générative énumère précisément ces fuites, requêtes, journaux et intégrations, comme autant d’endroits par où les données s’échappent de systèmes qui semblent clos.

L’affirmation honnête est donc modeste. L’inférence locale supprime une dépendance importante sans les supprimer toutes. L’idée d’intégrité contextuelle d’Helen Nissenbaum donne le bon cadre : la vie privée n’est pas le secret, mais l’attente que l’information circule selon les normes du contexte d’où elle vient. La France l’avait pressenti dès 1974, quand Le Monde titra « Safari ou la chasse aux Français » à propos du projet SAFARI d’interconnexion des fichiers administratifs ; l’émoi produisit la loi Informatique et libertés de 1978 et la CNIL. Le principe d’ingénierie qui en découle est ancien et sans éclat, la minimisation des données : ne pas transmettre ce qui n’a pas besoin de l’être.

V. L’année sur le dos du volume

Le petit modèle a les défauts d’un ouvrage de référence, plus quelques-uns qui lui sont propres. Son savoir s’arrête à une date, comme une encyclopédie imprimée porte son année sur le dos. Il invente avec la même voix tranquille qu’il emploie pour rapporter, et il invente plus volontiers qu’un modèle plus grand. Interrogez-le sur un botaniste mineur du XVIIIe siècle, et il vous tendra peut-être une année de naissance sortie de nulle part.

Borges a bâti une nouvelle sur ce risque. Dans « Tlön, Uqbar, Orbis Tertius », Bioy Casares trouve un article sur le pays d’Uqbar dans un seul exemplaire d’une encyclopédie et dans aucun autre exemplaire de la même édition. L’article est fluide, précis, plein de renvois, et ne décrit rien. Un modèle de langage est une presse capable d’imprimer ce volume à la demande. Sa réponse est une carte de ce que les gens ont écrit, non le territoire dont ils parlaient, et, comme dans la Bibliothèque de Babel, l’entrée fidèle et l’entrée fausse partagent le même rayon et la même reliure.

C’est pourquoi le rôle reste borné. Le modèle sert à la première explication, à nommer une question, à distinguer deux idées voisines et à savoir quoi lire ensuite. Quand quelque chose compte, une posologie, une date dans un argument, une affirmation que j’ai l’intention de répéter, la réponse est un pointeur, non une source. Je la suis jusqu’à un livre, un article ou un meilleur outil. Les livres de poche de la valise de mon père fonctionnaient de la même manière : leur valeur était qu’ils finissaient, et qu’ils montraient au-delà de leur propre bord. Ils avaient une autre vertu que je ne reconnais que maintenant. Personne ne savait ce que je lisais.

VI. Tout près de chez soi

La question que j’ai cessé de poser est « quel modèle est le plus intelligent ? ». La question utile est « quel est l’outil le moins puissant qui serve bien cette question ? ». Le code, la recherche spécialisée et la synthèse difficile peuvent justifier les systèmes de pointe et leurs contreparties. Un mot, un phénomène ou une idée à moitié retenue d’un podcast, rarement.

Ce qu’un petit modèle posé sur le bureau change, ce n’est pas l’étendue de mon savoir, mais le seuil à partir duquel je le cherche. Une question qui se serait dissoute parce qu’ouvrir un onglet semblait un effort de trop reçoit désormais une réponse, imparfaite et immédiate, tant qu’elle est encore vivante. La plupart de ces réponses ne compteront jamais. Quelques-unes deviennent la première page de quelque chose de plus long. Aucune n’a eu à être annoncée à qui que ce soit.

Pour aller plus loin