Mnemosyne OS
Nuevo La documentación está en línea: cada motor, paso a paso. docs.mnemosyne-os.io →

Cuaderno de laboratorio

Lo que medimos, y lo que resultó ser falso.

La superficie de investigación de Mnemosyne OS. Qué está depositado, qué afirman las cifras y qué no, cómo se producen, y la idea que más nos importaba y que hubo que soltar. No hay un sitio de investigación aparte. Es esta página.

Trabajo depositado

Dos artefactos están archivados bajo identificadores permanentes, publicados con licencia CC BY 4.0 y vinculados a un ORCID. Se pueden citar, no solo enlazar. Un tercero podrá señalarlos dentro de diez años, pase lo que pase con este sitio.

Whitepaper técnico, DOI 10.5281/zenodo.21728284Kit de auditoría del benchmark, DOI 10.5281/zenodo.21727140ORCID 0009-0009-1087-3917

La cifra, y lo que no afirma

77,1 % en LongMemEval-M, variante full-haystack, con el juez estricto. Ese ajuste entierra cada pregunta bajo unas 480 sesiones distractoras, en lugar de la porción reducida de la que salen la mayoría de las cifras publicadas.

Es una ejecución real de 48 preguntas, repetida una segunda vez y coincidente veredicto a veredicto, y la mejora que la sostiene se confirmó en un conjunto de preguntas apartado. Las mismas respuestas puntúan 81,3 % con el juez más flexible. El suelo publicado de julio, 72,9 %, queda archivado con su composición declarada, bajo su propio DOI. Dos jueces son dos instrumentos: ninguna de estas cifras es la progresión de otra.

No dice nada sobre sistemas evaluados en otros benchmarks. Comparar una cifra de aquí con otra de fuera no tendría sentido, en ninguna dirección.

Audita la puntuación tú mismoEl expediente completo

Cómo medimos

Los protocolos se registran antes de las ejecuciones decisivas, para que una hipótesis no pueda ajustarse en silencio una vez conocido el resultado. Cada brazo se compara con brazos de control, incluidos algunos deliberadamente sin sentido. Un efecto que un control aleatorio reproduce no es un efecto.

Cuando la comparación es estadística, es una prueba de permutación con semilla fija, no una diferencia juzgada a ojo. Cuando un modelo de lenguaje evalúa una respuesta, medimos el suelo de ruido y lo declaramos. Una diferencia menor que ese suelo se informa como ruido.

En qué nos equivocamos

El fundador sostuvo durante meses que una estructura matemática concreta aportaría señal dentro de un motor de memoria. Era la idea que más le importaba. La medimos en varias tareas independientes, en todas las formulaciones que pudimos construirle, incluida la versión que él consideraba la buena.

No aportaba señal en ninguna parte. Controles aleatorios reproducían cada efecto que parecía tener. Una sonda estructural no halló nada en los datos a lo que pudiera engancharse. La hipótesis se abandonó.

Ese fracaso es lo más útil de esta página. Llevarlo a cabo correctamente es lo que hizo aparecer el diseño que sí se entregó: una consolidación que aumenta la memoria en lugar de reemplazarla. Conserva el registro en bruto y le añade, en vez de resumir por encima.

Sobre qué se apoya

El linaje se expone con sus referencias en el whitepaper, sección 12. Ahí están el encuadre de «sistema operativo», el benchmark al que nos sometemos, las arquitecturas publicadas más cercanas, y el trabajo que defiende que un bucle de evaluación debe poder reproducirse en lugar de creerse. Un único lugar canónico vale más que dos que divergen.

Whitepaper, §12 Related Work

Programa de investigación interno: registro previo ciego · brazos de control · 336 generaciones analizadas · resultados negativos conservados

Volver al enrutador de audiencias

Notas de laboratorio

Nuestro benchmark nos mintió. Esta es la prueba de 40 líneas que lo descubrió. Instrumentos, ruido, y por qué verificamos el prompt, no los contadores. Sin cifras; el artículo de las mediciones llegará por separado.