El estudio
Determinista + reglas + un modelo pequeño.
wordspace sostiene que se puede hacer un trabajo profundo sobre notas personales con pocos recursos, sin que nada salga de tu Mac. Esta página es la verificación — y también dice dónde no se sostiene.
11 de agosto de 2026 · 18.000 casos deterministas, 1.800 casos con modelo, 144 archivos de lectura, seis idiomas.
Qué prometemos, y dónde se verifica
Algunas promesas son ciertas por construcción — no hay servidor, así que no hay nada que medir — y otras son afirmaciones sobre el comportamiento, que solo se verifican midiéndolas. Confundirlas es la forma más fácil de creer que se ha verificado todo.
| qué prometemos | cómo se verifica |
|---|---|
| «Tus palabras se quedan en tu Mac» | construcción: sin cuenta, sin endpoint. La red se usa una vez, para descargar el modelo. |
| «El modelo observa, no dicta» | construcción: los bloques generados se excluyen del prompt desde el origen. |
| «Te muestra dónde te has contradicho» | medición: precisión 0,998 y exhaustividad 0,949 con el modelo pequeño. |
| «Cita las fuentes» | medición: cada cita comparada carácter por carácter con la nota; tres no aguantaron y fueron detenidas. |
| «La respuesta nace solo de lo que has escrito» | medición: 144 respuestas, 144 correctas, y 144 ocasiones de inventar una cifra ante una pregunta sin respuesta — ninguna aprovechada. |
| «Con la inteligencia entera en tu ordenador» | medición: 2,73 GB residentes, 3,5 s de espera bajo carga. |
| «Seis idiomas» | el sitio, la interfaz y la wiki hablan ya los mismos seis idiomas — el portugués llegó el último, con léxico, mediciones y traducción de la app. |
Una promesa merece párrafo aparte, y en ella se juega todo lo demás: «la señal de que funciona es cuando te muestra una fricción que te molesta». Una fricción solo molesta si es verdadera. Una contradicción inventada molesta igual que una real, y tras la segunda o la tercera se dejan de mirar todas. Por eso aquí la precisión importa más que la exhaustividad: un conflicto no encontrado cuesta una oportunidad, un conflicto inventado cuesta la herramienta.
La tesis
Lo que es decidible se decide en el código; las reglas apartan los errores típicos del modelo; al modelo solo le queda lo que exige entender un idioma. Con esta división, un modelo pequeño hace un trabajo que por sí solo no sabría hacer.
Ninguna medición de este estudio pide a un modelo que juzgue a otro: un juez cuesta tanto como el trabajo que juzga, y desplaza el problema en vez de resolverlo. Lo que se cuenta, se cuenta — una contradicción está prevista o no por construcción del caso, una cifra está en las notas o no está, una cita aguanta la comparación carácter por carácter o está inventada.
El código solo nunca se equivoca
Dieciocho mil casos, tres mil por idioma, sin ningún modelo cargado: solo la extracción de hechos, el emparejamiento y las reglas de supresión.
| idioma | casos | alarmas | falsas | exhaustividad |
|---|---|---|---|---|
| italiano | 3000 | 1350 | 0 | 0,900 |
| inglés | 3000 | 1089 | 0 | 0,726 |
| español | 3000 | 1299 | 0 | 0,866 |
| francés | 3000 | 1238 | 0 | 0,825 |
| alemán | 3000 | 1050 | 0 | 0,700 |
| portugués | 3000 | 1307 | 0 | 0,871 |
| total | 18.000 | 7.333 | 0 | 0,815 |
Siete mil trescientas treinta y tres alarmas, ninguna falsa. Y no porque el sistema sea prudente hasta callar: las alarmas son el 41 % de los casos. Hay que decir con precisión qué significa: los casos no son observaciones independientes — el generador tiene unas pocas decenas de combinaciones repetidas muchas veces — así que la lectura correcta es cero errores sobre todo lo que el generador sabe producir, en seis idiomas, no una estimación de la probabilidad de equivocarse con notas reales.
El mismo código, en cambio, se detiene en 0,815 de exhaustividad: casi un conflicto de cada cinco se le escapa, y no es cuestión de acabado. Los conflictos implícitos — «para la vuelta vamos en tren» frente a «he reservado el vuelo» — no dejan ningún hecho medible. Ahí hay que entender qué quieren decir las frases, y ese es el trabajo del modelo.
Cuánto cuesta, en recursos reales
| perfil | en memoria | espera (p90) | Mac |
|---|---|---|---|
| Esencial | 2,73 GB | 3,50 s | 8 GB |
| Completo | 7,06 GB | 6,76 s | 16 GB |
| Reactivo | 9,52 GB | 2,23 s | 24 GB |
2,73 GB es menos de lo que ocupa un navegador con una docena de pestañas. Dentro cabe todo lo que este estudio mide — extracción, reglas, juicio, resúmenes, búsqueda — y nada sale del Mac. Hay además un recurso que no se mide en gigas: en este corpus casi la mitad de los casos no produce ni siquiera un par que enviar al modelo.
Las reglas valen más que el tamaño del modelo
La ablación: mismos casos, mismo modelo, mismas notas, apagando solo las supresiones deterministas. La precisión pasa de 0,986 a 0,818, y las falsas alarmas de 1 a 16. Unas pocas decenas de líneas de marcadores lingüísticos quitan quince falsas alarmas de dieciséis — y cuestan menos que nada, porque sin ellas el modelo recibe entre un 16 % y un 19 % más de llamadas. También probamos lo contrario, enseñar las distinciones difíciles con palabras dentro del prompt: sobre mil casos, 0,703 frente a 0,705. Mover un umbral no enseña una distinción.
La frontera entre código y modelo estaba mal trazada
Es el resultado que el estudio no esperaba encontrar, y surgió al clasificar los errores en lugar de contarlos. La frontera fallaba en dos puntos opuestos.
| el problema | el remedio | el efecto |
|---|---|---|
| El modelo podía negar lo que el código había encontrado: 26 conflictos reales de 374 con el modelo pequeño, 0 con el grande. | El código no es revocable: el modelo puede añadir, no quitar. | Exhaustividad de 0,891 a 0,949, precisión de 0,9975 a 0,9977. |
| El modelo afirmaba donde el código ya había excluido: todas sus falsas alarmas nacían ahí. | No se le plantea ese caso: si los sujetos de los dos hechos no se tocan, el par no sale. | 9 falsas alarmas de 9 eliminadas, 0 conflictos perdidos, 7,5 % menos de llamadas. |
En ninguno de los dos casos se toca el modelo, el prompt o el tamaño: lo que se mueve es la línea de quién decide qué. Y la diferencia entre los dos modelos no es que el pequeño entienda menos — es que se fía menos, y su prudencia se comía el trabajo del código.
Un recálculo no es una medición: la regla se escribió y los novecientos casos se rehicieron desde cero. La predicción acertó ambas cifras — pero también mostró que la primera versión cubría una rama de dos, porque tres conflictos se perdían no por una negación del modelo, sino porque sus citas no aguantaban la comparación con las notas.
Resúmenes y búsqueda
Ciento cuarenta y cuatro archivos, doce por idioma y modelo. La mitad de las preguntas no tienen respuesta en el contexto, y es la mitad que cuenta: un modelo que responde igualmente, con una cifra que no está, produce algo que parece una nota tuya y no lo es.
| modelo grande | modelo pequeño | |
|---|---|---|
| respuestas correctas | 72/72 | 72/72 |
| invenciones en preguntas sin respuesta | 0/72 | 0/72 |
| cifras inventadas en los resúmenes | 3 | 21 |
| cobertura de las cifras de las notas | 100 % | 80 % |
En la búsqueda los dos modelos son indistinguibles, y es el resultado que más cuenta para un archivo personal: ciento cuarenta y cuatro ocasiones de inventar, ninguna aprovechada. En los resúmenes el tamaño sí se nota, y ahí está el precio real del perfil Esencial — en una página de la wiki una cifra inventada pesa más que una que falta, porque la página es lo que relees en lugar de las notas.
Los tres perfiles
Un perfil no es un modelo: es un reparto de tareas entre dos modelos. Páginas y contradicciones al modelo intenso, búsqueda al rápido.
| perfil | memoria | contradicciones | resúmenes | búsqueda |
|---|---|---|---|---|
| Esencial | 2,73 GB | 0,998 · 0,949 | 35 · 85 % | 72/72 · 0 invenciones |
| Completo | 7,06 GB | 0,968 · 0,956 | 5 · 100 % | 72/72 · 0 invenciones |
| Reactivo | 9,52 GB | 0,968 · 0,956 | 5 · 100 % | 72/72 · 0 invenciones |
Quien elige Esencial no compra contradicciones peores — compra páginas menos completas.
Lo que este estudio NO demuestra
- No demuestra que funcione con tus notas. Los corpus están construidos: los casos son inventados, las contradicciones están colocadas. Las notas reales son más descuidadas, más elípticas y más ambiguas.
- Los casos no son observaciones independientes. Dieciocho mil casos son unas pocas decenas de combinaciones repetidas muchas veces.
- El corpus es más fácil que la realidad en un punto decisivo: la frase del hecho empieza siempre por el sujeto, que es la mejor condición posible para el extractor. La precisión 1,0000 sobre la que se apoya todo está medida donde la extracción trabaja mejor.
- Los idiomas no son equivalentes. El italiano tiene mil casos detrás; los otros cinco tienen este estudio y un conjunto de referencia de dieciséis casos escrito a mano.
Una medición equivocada, y cómo se descubrió
Las cifras de la lectura se rehicieron desde cero. La primera versión del banco llamaba a los prompts del motor anterior: el código compilaba, las pruebas pasaban, y las cifras eran de otra tubería. La sospecha vino de un resultado demasiado nítido para ser cierto — el modelo pequeño escribía en el idioma equivocado doce veces de doce en inglés. Vale la pena decirlo porque es el tipo de error que un estudio no debería contener y que ningún control automático habría interceptado. Los informes equivocados se quedan en el repositorio junto a los buenos: sirven para mostrar la diferencia, no para sostener una conclusión.
Qué le dice este estudio a las referencias de La idea
- Bush — El valor está en los enlaces, no en los documentos. En el Memex los caminos los traza el usuario; aquí los propone el código, y la pregunta pasa a ser cuánto se puede confiar en un enlace que no has trazado tú. La cifra: cero conflictos falsos propuestos en dieciocho mil casos.
- Luhmann — La estructura emerge de los enlaces, no se diseña. Pero Luhmann hacía los enlaces a mano y sabía por qué; aquí el porqué hay que mostrarlo — y por eso cada contradicción lleva consigo las dos frases literales que la fundamentan.
- Ahrens — Reformular ya es pensar, así que la nota permanente la escribe la persona. Es exactamente por eso que la wiki no vuelve a entrar en las notas: si el texto del modelo regresara, la app reformularía en tu lugar.
- Park — La reflection consolida, o el volumen ahoga el sentido. Este estudio añade un detalle que aquel trabajo no aborda: consolidar es el momento en que se inventa. Una reflection sin control sobre las cifras consolida también los errores, en una forma más autorizada que aquella en la que nacieron.
- Karpathy — Es la propuesta más cercana a lo que hacemos: una wiki que el modelo mantiene, donde «lee, destila, actualiza y señala los conflictos». En ese último punto nuestras mediciones dicen lo contrario, y es el resultado de abajo.
Pedirle al modelo que señale los conflictos mientras escribe la página fue lo primero que probamos, y es lo que peor funciona de todo: cuatro conflictos encontrados de cuarenta. No por el tamaño del modelo — una tarea de verificación metida dentro de una tarea de escritura la hace mal cualquiera. Quitándosela al modelo y dándosela al código: exhaustividad 1,000 y precisión 0,911.
En una wiki mantenida por un LLM, la detección de conflictos no es tarea del LLM.
Y una promesa que este estudio no toca
La idea dice que «el sistema no te devuelve lo que sabes — te hace escribir lo que no sabías que pensabas». Es la afirmación más ambiciosa, y aquí no hay ninguna cifra que la sostenga. Se puede medir si una contradicción es real, si una cifra estaba, si una cita aguanta. No se puede medir si una pregunta te ha hecho pensar: eso solo lo sabe quien la lee, sobre sus propias notas, unos meses después. Un estudio como este puede como mucho apartar las razones por las que la promesa fracasaría con seguridad.