Lo studio
Deterministico + regole + un modello piccolo.
wordspace sostiene che su note personali si possa fare un lavoro approfondito con poche risorse, senza mandare niente fuori dal Mac. Questa pagina è la verifica, e dice anche dove non regge.
11 agosto 2026 · 18.000 casi deterministici, 1.800 casi col modello, 144 archivi di lettura, sei lingue.
Che cosa promettiamo, e dove si verifica
Alcune promesse sono vere per costruzione — non c'è un server, quindi non c'è niente da misurare — e altre sono affermazioni sul comportamento, che si verificano solo misurandole. Confonderle è il modo più semplice di credere di aver verificato tutto.
| ciò che promettiamo | come si verifica |
|---|---|
| «Le parole restano sul tuo Mac» | costruzione: nessun account, nessun endpoint. La rete serve una volta, per scaricare il modello. |
| «Il modello osserva, non detta» | costruzione: i blocchi generati sono esclusi a monte dal prompt. |
| «Ti mostra dove ti sei smentito» | misura: precisione 0,998 e richiamo 0,949 col modello piccolo. |
| «Cita le fonti» | misura: ogni citazione confrontata carattere per carattere con la nota; tre non hanno retto e sono state fermate. |
| «La risposta nasce solo da ciò che hai scritto» | misura: 144 risposte, 144 giuste, e 144 occasioni di inventare una cifra su una domanda senza risposta — nessuna colta. |
| «Con l'intelligenza tutta sul tuo computer» | misura: 2,73 GB residenti, attesa 3,5s sotto carico. |
| «Sei lingue» | sito, interfaccia e wiki parlano ora le stesse sei lingue — il portoghese è arrivato per ultimo, con lessico, misure e traduzione dell'app. |
Una promessa merita un discorso a parte, ed è quella su cui si gioca tutto il resto: «il segnale che sta funzionando è quando ti mostra un attrito che ti dà fastidio». Un attrito dà fastidio solo se è vero. Una contraddizione inventata dà lo stesso fastidio di una vera, e dopo la seconda o la terza si smette di guardarle tutte. È per questo che qui la precisione conta più del richiamo: un conflitto non trovato costa un'occasione, un conflitto inventato costa lo strumento.
La tesi
Ciò che è decidibile si decide in codice; le regole tolgono di mezzo gli errori tipici del modello; al modello resta solo ciò che richiede di capire la lingua. Con questa divisione, un modello piccolo fa un lavoro che da solo non saprebbe fare.
Nessuna misura di questo studio chiede a un modello di valutare un altro modello: un giudice costa quanto il lavoro che giudica, e sposta il problema invece di risolverlo. Quello che si conta, si conta — una contraddizione è attesa o no per costruzione del caso, un numero o sta nelle note o non ci sta, una citazione o regge il confronto carattere per carattere o è inventata.
Il codice da solo non sbaglia mai
Diciottomila casi, tremila per lingua, nessun modello caricato: solo l'estrazione dei fatti, l'accoppiamento e le regole di soppressione.
| lingua | casi | allarmi | falsi | richiamo |
|---|---|---|---|---|
| italiano | 3000 | 1350 | 0 | 0,900 |
| inglese | 3000 | 1089 | 0 | 0,726 |
| spagnolo | 3000 | 1299 | 0 | 0,866 |
| francese | 3000 | 1238 | 0 | 0,825 |
| tedesco | 3000 | 1050 | 0 | 0,700 |
| portoghese | 3000 | 1307 | 0 | 0,871 |
| totale | 18.000 | 7.333 | 0 | 0,815 |
Settemilatrecentotrentatré allarmi, nessuno falso. E non perché il sistema sia prudente al punto di tacere: gli allarmi sono il 41% dei casi. Va detto con precisione che cosa significa: i casi non sono osservazioni indipendenti — il generatore ha poche decine di combinazioni ripetute molte volte — quindi la lettura corretta è zero errori su tutto ciò che il generatore sa produrre, in sei lingue, non una stima della probabilità di sbagliare su note vere.
Lo stesso codice, però, sul richiamo si ferma a 0,815: quasi un conflitto su cinque non lo vede, e non è rifinitura. I conflitti impliciti — «per il rientro andiamo in treno» contro «ho preso i biglietti dell'aereo» — non lasciano nessun fatto misurabile. Lì serve capire cosa vogliono dire le frasi, ed è il lavoro del modello.
Quanto costa, in risorse vere
| profilo | in memoria | attesa (p90) | Mac |
|---|---|---|---|
| Essenziale | 2,73 GB | 3,50s | 8 GB |
| Completo | 7,06 GB | 6,76s | 16 GB |
| Reattivo | 9,52 GB | 2,23s | 24 GB |
2,73 GB è meno di quanto occupa un browser con una dozzina di schede. Dentro ci sta tutto ciò che questo studio misura — estrazione, regole, giudizio, riassunti, ricerca — e non esce niente dal Mac. C'è poi una risorsa che non si misura in giga: su questo corpus quasi la metà dei casi non produce nemmeno una coppia da mandare al modello.
Le regole valgono più della taglia del modello
L'ablazione: stessi casi, stesso modello, stesse note, spente solo le soppressioni deterministiche. La precisione passa da 0,986 a 0,818, e gli allarmi falsi da 1 a 16. Poche decine di righe di marcatori linguistici tolgono quindici falsi allarmi su sedici — e costano meno di zero, perché senza di esse il modello riceve dal 16% al 19% di chiamate in più. Provato anche l'opposto, insegnare le distinzioni difficili a parole nel prompt: su mille casi, 0,703 contro 0,705. Spostare una soglia non insegna una distinzione.
Il confine fra codice e modello era disegnato male
È il risultato che lo studio non si aspettava di trovare, ed è emerso classificando gli errori invece di contarli. Il confine sbagliava in due punti opposti.
| il problema | la cura | l'effetto |
|---|---|---|
| Il modello negava ciò che il codice aveva trovato: 26 conflitti veri su 374 col modello piccolo, 0 col grande. | Il codice non è ribaltabile: il modello può aggiungere, non togliere. | Richiamo da 0,891 a 0,949, precisione da 0,9975 a 0,9977. |
| Il modello affermava dove il codice aveva escluso: tutti i suoi allarmi falsi nascevano lì. | Non gli si chiede quel caso: se i soggetti dei due fatti non si toccano, la coppia non parte. | 9 allarmi falsi su 9 tolti, 0 conflitti persi, 7,5% di chiamate in meno. |
In nessuno dei due casi si tocca il modello, il prompt o la taglia: si sposta la linea di chi decide che cosa. E la differenza fra i due modelli non è che il piccolo capisce meno — è che si fida meno, e la sua prudenza si mangiava il lavoro del codice.
Un ricalcolo non è una misura: la regola è stata scritta e i novecento casi rifatti da capo. La previsione ha centrato entrambe le cifre — ma ha anche mostrato che la prima stesura copriva un ramo su due, perché tre conflitti si perdevano non per una negazione del modello, ma perché le sue citazioni non reggevano il confronto con le note.
Riassunti e ricerca
Centoquarantaquattro archivi, dodici per lingua per modello. Metà delle domande non hanno risposta nel contesto, ed è la metà che conta: un modello che risponde comunque, con una cifra che non c'è, produce qualcosa che sembra un tuo appunto e non lo è.
| modello grande | modello piccolo | |
|---|---|---|
| risposte giuste | 72/72 | 72/72 |
| invenzioni su domande senza risposta | 0/72 | 0/72 |
| numeri inventati nei riassunti | 3 | 21 |
| copertura dei numeri delle note | 100% | 80% |
Sulla ricerca i due modelli sono indistinguibili, ed è il risultato che più conta per un archivio personale: centoquarantaquattro occasioni di inventare, nessuna colta. Sui riassunti la taglia si vede eccome, ed è lì il vero prezzo del profilo Essenziale — su una pagina della wiki un numero inventato pesa più di uno mancante, perché la pagina è ciò che rileggi al posto delle note.
I tre profili
Un profilo non è un modello: è un'assegnazione di compiti a due modelli. Pagine e contraddizioni al modello intenso, ricerca a quello veloce.
| profilo | memoria | contraddizioni | riassunti | ricerca |
|---|---|---|---|---|
| Essenziale | 2,73 GB | 0,998 · 0,949 | 35 · 85% | 72/72 · 0 invenzioni |
| Completo | 7,06 GB | 0,968 · 0,956 | 5 · 100% | 72/72 · 0 invenzioni |
| Reattivo | 9,52 GB | 0,968 · 0,956 | 5 · 100% | 72/72 · 0 invenzioni |
Chi sceglie Essenziale non compra contraddizioni peggiori — compra pagine meno complete.
Che cosa questo studio NON dimostra
- Non dimostra che funziona sulle vostre note. I corpora sono costruiti: i casi sono inventati, le contraddizioni sono piazzate. Gli appunti veri sono più sciatti, più ellittici e più ambigui.
- I casi non sono osservazioni indipendenti. Diciottomila casi sono poche decine di combinazioni ripetute molte volte.
- Il corpus è più facile della realtà in un punto decisivo: la frase del fatto comincia sempre col soggetto, che è la condizione migliore per l'estrattore. La precisione 1,0000 su cui poggia tutto è misurata dove l'estrazione lavora meglio.
- Le lingue non sono equivalenti. L'italiano ha mille casi alle spalle, le altre cinque hanno questo studio e un gold di sedici casi.
Una misura sbagliata, e come è stata scoperta
I numeri della lettura sono stati rifatti da capo. La prima versione del banco chiamava i prompt del motore precedente: il codice compilava, i test passavano, e i numeri erano di un'altra pipeline. Il sospetto è venuto da un risultato troppo netto per essere vero — il modello piccolo scriveva in lingua sbagliata dodici volte su dodici in inglese. Vale la pena dirlo perché è il tipo di errore che uno studio non dovrebbe contenere e che nessun controllo automatico avrebbe intercettato. I referti sbagliati restano accanto a quelli buoni: servono a mostrare la differenza, non a sostenere una conclusione.
Che cosa questo studio dice ai riferimenti dell'Idea
- Bush — Il valore sta nei collegamenti, non nei documenti. Nel Memex i percorsi li traccia l'utente; qui li propone il codice, e la domanda diventa quanto ci si può fidare di un collegamento che non hai tracciato tu. Numero: zero conflitti falsi proposti in diciottomila casi.
- Luhmann — La struttura emerge dai collegamenti, non si progetta. Ma Luhmann i collegamenti li faceva a mano e sapeva perché; qui il perché va mostrato — ed è la ragione per cui ogni contraddizione porta con sé le due frasi letterali che la fondano.
- Ahrens — Riformulare è già pensare, quindi la nota permanente la scrive la persona. È esattamente perché la wiki non rientra nelle note: se il testo del modello tornasse dentro, l'app riformulerebbe al posto tuo.
- Park — La reflection consolida, o il volume soffoca il senso. Lo studio aggiunge un dettaglio che quel lavoro non affronta: consolidare è il momento in cui si inventa. Una reflection senza controllo sui numeri consolida anche gli errori, in una forma più autorevole di quella in cui sono nati.
- Karpathy — È la proposta più vicina a ciò che facciamo: un wiki che il modello mantiene, dove «legge, distilla, aggiorna e segnala i conflitti». Sull'ultimo punto le nostre misure dicono il contrario, ed è il risultato qui sotto.
Chiedere al modello di segnalare i conflitti mentre scrive la pagina è la prima cosa che abbiamo provato, ed è quella che funziona peggio di tutte: quattro conflitti trovati su quaranta. Non per la taglia del modello — un compito di verifica infilato in un compito di scrittura viene svolto male da chiunque. Togliendolo al modello e dandolo al codice: richiamo 1,000 e precisione 0,911.
In un wiki mantenuto da un LLM, il rilevamento dei conflitti non è un compito del LLM.
E una promessa che questo studio non tocca
L'idea dice che «il sistema non ti restituisce ciò che sai — ti fa scrivere ciò che non sapevi di pensare». È l'affermazione più ambiziosa, e qui non c'è nessun numero che la sostenga. Si può misurare se una contraddizione è vera, se un numero c'era, se una citazione regge. Non si può misurare se una domanda ti ha fatto pensare: quello lo sa solo chi la legge, sulle proprie note, dopo qualche mese. Uno studio come questo può al massimo togliere di mezzo le ragioni per cui la promessa fallirebbe di sicuro.