L'étude
Déterministe + règles + un petit modèle.
wordspace affirme qu'un travail approfondi sur des notes personnelles est possible avec peu de ressources, sans que rien ne quitte votre Mac. Cette page est la vérification — et elle dit aussi où cela ne tient pas.
11 août 2026 · 18 000 cas déterministes, 1 800 cas avec le modèle, 144 archives de lecture, six langues.
Ce que nous promettons, et où cela se vérifie
Certaines promesses sont vraies par construction — il n'y a pas de serveur, donc rien à mesurer — et d'autres sont des affirmations sur le comportement, qui ne se vérifient qu'en les mesurant. Les confondre est la façon la plus simple de croire qu'on a tout vérifié.
| ce que nous promettons | comment cela se vérifie |
|---|---|
| « Vos mots restent sur votre Mac » | construction : aucun compte, aucun point d'accès. Le réseau ne sert qu'une fois, pour télécharger le modèle. |
| « Le modèle observe, il ne dicte pas » | construction : les blocs générés sont exclus du prompt en amont. |
| « Il vous montre où vous vous êtes contredit » | mesure : précision 0,998 et rappel 0,949 avec le petit modèle. |
| « Il cite ses sources » | mesure : chaque citation comparée caractère par caractère à la note ; trois n'ont pas tenu et ont été arrêtées. |
| « La réponse naît uniquement de ce que vous avez écrit » | mesure : 144 réponses, 144 justes, et 144 occasions d'inventer un chiffre sur une question sans réponse — aucune saisie. |
| « Avec l'intelligence entièrement sur votre ordinateur » | mesure : 2,73 Go résidents, attente de 3,5 s en charge. |
| « Six langues » | le site, l'interface et le wiki parlent désormais les mêmes six langues — le portugais est arrivé en dernier, avec lexique, mesures et traduction de l'app. |
Une promesse mérite son propre paragraphe, et tout le reste repose dessus : « le signe que ça fonctionne, c'est quand il vous montre une friction qui vous dérange ». Une friction ne dérange que si elle est vraie. Une contradiction inventée dérange autant qu'une vraie, et après la deuxième ou la troisième on cesse de les regarder toutes. C'est pourquoi ici la précision compte plus que le rappel : un conflit manqué coûte une occasion, un conflit inventé coûte l'outil.
La thèse
Ce qui est décidable se décide dans le code ; les règles écartent les erreurs typiques du modèle ; il ne reste au modèle que ce qui exige de comprendre une langue. Avec cette division, un petit modèle fait un travail qu'il ne saurait pas faire seul.
Aucune mesure de cette étude ne demande à un modèle d'en juger un autre : un juge coûte autant que le travail qu'il juge, et il déplace le problème au lieu de le résoudre. Ce qui se compte, se compte — une contradiction est attendue ou non par construction du cas, un chiffre est dans les notes ou il n'y est pas, une citation résiste à la comparaison caractère par caractère ou elle est inventée.
Le code seul ne se trompe jamais
Dix-huit mille cas, trois mille par langue, aucun modèle chargé : seulement l'extraction des faits, l'appariement et les règles de suppression.
| langue | cas | alertes | fausses | rappel |
|---|---|---|---|---|
| italien | 3000 | 1350 | 0 | 0,900 |
| anglais | 3000 | 1089 | 0 | 0,726 |
| espagnol | 3000 | 1299 | 0 | 0,866 |
| français | 3000 | 1238 | 0 | 0,825 |
| allemand | 3000 | 1050 | 0 | 0,700 |
| portugais | 3000 | 1307 | 0 | 0,871 |
| total | 18 000 | 7 333 | 0 | 0,815 |
Sept mille trois cent trente-trois alertes, aucune fausse. Et non parce que le système serait prudent au point de se taire : les alertes représentent 41 % des cas. Il faut dire précisément ce que cela signifie : les cas ne sont pas des observations indépendantes — le générateur possède quelques dizaines de combinaisons répétées de nombreuses fois — donc la lecture correcte est zéro erreur sur tout ce que le générateur sait produire, en six langues, et non une estimation du risque de se tromper sur de vraies notes.
Le même code, en revanche, plafonne à 0,815 de rappel : presque un conflit sur cinq lui échappe, et ce n'est pas une question de finition. Les conflits implicites — « pour le retour on prend le train » contre « j'ai réservé l'avion » — ne laissent aucun fait mesurable. Là, il faut comprendre ce que les phrases veulent dire, et c'est le travail du modèle.
Ce que cela coûte, en ressources réelles
| profil | en mémoire | attente (p90) | Mac |
|---|---|---|---|
| Essentiel | 2,73 Go | 3,50 s | 8 Go |
| Complet | 7,06 Go | 6,76 s | 16 Go |
| Réactif | 9,52 Go | 2,23 s | 24 Go |
2,73 Go, c'est moins qu'un navigateur avec une douzaine d'onglets. Tout ce que cette étude mesure y tient — extraction, règles, jugement, résumés, recherche — et rien ne quitte le Mac. Il y a aussi une ressource qui ne se mesure pas en gigaoctets : sur ce corpus, près de la moitié des cas ne produit même pas une paire à envoyer au modèle.
Les règles valent plus que la taille du modèle
L'ablation : mêmes cas, même modèle, mêmes notes, en n'éteignant que les suppressions déterministes. La précision passe de 0,986 à 0,818, et les fausses alertes de 1 à 16. Quelques dizaines de lignes de marqueurs linguistiques écartent quinze fausses alertes sur seize — et coûtent moins que rien, car sans elles le modèle reçoit de 16 % à 19 % d'appels en plus. Nous avons aussi essayé l'inverse, enseigner les distinctions difficiles avec des mots dans le prompt : sur mille cas, 0,703 contre 0,705. Déplacer un seuil n'enseigne pas une distinction.
La frontière entre code et modèle était mal tracée
C'est le résultat que l'étude ne s'attendait pas à trouver, et il est apparu en classant les erreurs plutôt qu'en les comptant. La frontière était fausse en deux points opposés.
| le problème | le remède | l'effet |
|---|---|---|
| Le modèle pouvait nier ce que le code avait trouvé : 26 vrais conflits sur 374 avec le petit modèle, 0 avec le grand. | Le code n'est pas révocable : le modèle peut ajouter, pas retirer. | Rappel de 0,891 à 0,949, précision de 0,9975 à 0,9977. |
| Le modèle affirmait là où le code avait déjà exclu : toutes ses fausses alertes naissaient là. | On ne lui pose pas ce cas : si les sujets des deux faits ne se touchent pas, la paire ne part pas. | 9 fausses alertes sur 9 supprimées, 0 conflit perdu, 7,5 % d'appels en moins. |
Dans aucun des deux cas on ne touche au modèle, au prompt ou à la taille : ce qui bouge, c'est la ligne de qui décide quoi. Et la différence entre les deux modèles n'est pas que le petit comprend moins — c'est qu'il fait moins confiance, et sa prudence dévorait le travail du code.
Un recalcul n'est pas une mesure : la règle a été écrite et les neuf cents cas refaits de zéro. La prédiction a visé juste sur les deux chiffres — mais elle a aussi montré que la première version ne couvrait qu'une branche sur deux, car trois conflits se perdaient non par un refus du modèle, mais parce que ses citations ne résistaient pas à la comparaison avec les notes.
Résumés et recherche
Cent quarante-quatre archives, douze par langue et par modèle. La moitié des questions n'ont pas de réponse dans le contexte, et c'est la moitié qui compte : un modèle qui répond quand même, avec un chiffre absent, produit quelque chose qui ressemble à votre propre note sans en être une.
| grand modèle | petit modèle | |
|---|---|---|
| réponses justes | 72/72 | 72/72 |
| inventions sur questions sans réponse | 0/72 | 0/72 |
| chiffres inventés dans les résumés | 3 | 21 |
| couverture des chiffres des notes | 100 % | 80 % |
Sur la recherche, les deux modèles sont indiscernables, et c'est le résultat qui compte le plus pour une archive personnelle : cent quarante-quatre occasions d'inventer, aucune saisie. Sur les résumés, la taille se voit — et c'est là le vrai prix du profil Essentiel : sur une page de wiki, un chiffre inventé pèse plus qu'un chiffre manquant, car la page est ce qu'on relit à la place des notes.
Les trois profils
Un profil n'est pas un modèle : c'est une répartition des tâches entre deux modèles. Pages et contradictions au modèle intense, recherche au modèle rapide.
| profil | mémoire | contradictions | résumés | recherche |
|---|---|---|---|---|
| Essentiel | 2,73 Go | 0,998 · 0,949 | 35 · 85 % | 72/72 · 0 invention |
| Complet | 7,06 Go | 0,968 · 0,956 | 5 · 100 % | 72/72 · 0 invention |
| Réactif | 9,52 Go | 0,968 · 0,956 | 5 · 100 % | 72/72 · 0 invention |
Choisir Essentiel ne vous achète pas de moins bonnes contradictions — cela vous achète des pages moins complètes.
Ce que cette étude ne prouve PAS
- Elle ne prouve pas que cela fonctionne sur vos notes. Les corpus sont construits : les cas sont inventés, les contradictions sont posées. Les vraies notes sont plus négligées, plus elliptiques et plus ambiguës.
- Les cas ne sont pas des observations indépendantes. Dix-huit mille cas, ce sont quelques dizaines de combinaisons répétées de nombreuses fois.
- Le corpus est plus facile que la réalité sur un point décisif : la phrase du fait commence toujours par le sujet, ce qui est la meilleure condition pour l'extracteur. La précision de 1,0000 sur laquelle tout repose est mesurée là où l'extraction travaille le mieux.
- Les langues ne sont pas équivalentes. L'italien a mille cas derrière lui ; les cinq autres ont cette étude et un jeu de référence de seize cas écrit à la main.
Une mesure fausse, et comment elle a été découverte
Les chiffres de la lecture ont été refaits de zéro. La première version du banc appelait les prompts du moteur précédent : le code compilait, les tests passaient, et les chiffres appartenaient à un autre pipeline. Le soupçon est venu d'un résultat trop net pour être vrai — le petit modèle écrivait dans la mauvaise langue douze fois sur douze en anglais. Cela vaut la peine d'être dit, car c'est le type d'erreur qu'une étude ne devrait pas contenir et qu'aucun contrôle automatique n'aurait intercepté. Les rapports erronés restent dans le dépôt à côté des bons : ils servent à montrer la différence, pas à soutenir une conclusion.
Ce que cette étude dit aux références de L'idée
- Bush — La valeur est dans les liens, pas dans les documents. Dans le Memex, les pistes sont tracées par l'utilisateur ; ici elles sont proposées par le code, et la question devient : jusqu'où faire confiance à un lien qu'on n'a pas tracé soi-même. Le chiffre : zéro conflit faux proposé sur dix-huit mille cas.
- Luhmann — La structure émerge des liens, elle ne se conçoit pas. Mais Luhmann faisait les liens à la main et savait pourquoi ; ici le pourquoi doit être montré — d'où le fait que chaque contradiction porte les deux phrases littérales qui la fondent.
- Ahrens — Reformuler, c'est déjà penser : la note permanente doit donc être écrite par la personne. C'est exactement pourquoi le wiki ne revient pas dans les notes : si le texte du modèle y rentrait, l'app reformulerait à votre place.
- Park — La reflection consolide, sinon le volume étouffe le sens. Cette étude ajoute un détail que ce travail n'aborde pas : consolider est le moment où l'on invente. Une reflection sans contrôle sur les chiffres consolide aussi les erreurs, sous une forme plus autorisée que celle où elles sont nées.
- Karpathy — La proposition la plus proche de ce que nous faisons : un wiki que le modèle entretient, où il « lit, distille, met à jour et signale les conflits ». Sur ce dernier point nos mesures disent le contraire, et c'est le résultat ci-dessous.
Demander au modèle de signaler les conflits pendant qu'il écrit la page est la première chose que nous avons essayée, et c'est celle qui fonctionne le plus mal : quatre conflits trouvés sur quarante. Pas à cause de la taille du modèle — une tâche de vérification glissée dans une tâche d'écriture est mal faite par n'importe qui. En la retirant au modèle pour la donner au code : rappel 1,000 et précision 0,911.
Dans un wiki entretenu par un LLM, la détection des conflits n'est pas une tâche du LLM.
Et une promesse que cette étude ne touche pas
L'idée dit que « le système ne vous rend pas ce que vous savez — il vous fait écrire ce que vous ne saviez pas penser ». C'est l'affirmation la plus ambitieuse, et aucun chiffre ici ne la soutient. On peut mesurer si une contradiction est vraie, si un chiffre était là, si une citation tient. On ne peut pas mesurer si une question vous a fait penser : cela, seul celui qui la lit le sait, sur ses propres notes, quelques mois plus tard. Une étude comme celle-ci peut tout au plus écarter les raisons pour lesquelles la promesse échouerait à coup sûr.