13 de septiembre de 2026·8 min de lectura·Ruly Altamirano, QualiSynth

El informe que cambiaba

Un revisor nos dijo que el mismo estudio daba dos numeros distintos. Tenia razon, y el problema que habia debajo era mucho mayor que el que el habia encontrado.

La queja

Un revisor externo miro uno de nuestros decks de fintech y dijo que una cifra no cuadraba con el export. En eso tenia razon. Lo que habia encontrado en realidad, sin saberlo, es que reanalizar un estudio cambiaba su informe.

Nunca lo habiamos comprobado. Y lo que hay publicado mide otra capa: PyMC Labs situo a los respondentes sinteticos en el 90% de la fiabilidad test-retest humana sobre 57 encuestas, y un estudio de Stanford y Google DeepMind llego al 83-86% de la consistencia test-retest a dos semanas de los propios participantes, segun el agente se construyera con entrevistas, con encuestas o con ambas, frente al 74% de los agentes hechos solo con demografia. Eso es test-retest del respondente: si la persona simulada contesta igual dos veces. Lo que se nos rompio a nosotros esta aguas abajo: si el mismo corpus de respuestas se convierte en el mismo informe. Un respondente perfectamente estable y una tuberia de analisis inestable se ven igual desde fuera.

Lo que medimos

Repetimos el analisis completo de nuestros dos estudios fintech en produccion: 980 respuestas cada uno, tres pasadas nuevas cada uno, contra una pasada de referencia ya guardada en produccion con el mismo modelo y la misma version de prompt.

  • 1 de 5 conceptos de la diapositiva principal seguian ahi en las tres pasadas.
  • 2 / 0 / 2 barreras de compra publicaba el estudio britanico segun la pasada. Y las dos pasadas que publicaron algo publicaron barreras distintas.
  • 0,010 a 0,035 de solapamiento Jaccard entre pasadas para barreras y necesidades. Practicamente ninguna etiqueta se repetia igual.
  • 0,75 a 0,87 de Jaccard para menciones de competidores. Los nombres propios no se mueven; los conceptos si.
  • 100% de las 3.577 citas eran literales y trazables a un respondente y a un turno. La trazabilidad nunca fue el problema.

3.920 llamadas nuevas al modelo. Cero fallidas.

El caso mas claro: "falta de responsabilidad humana" valia 12 respondentes en una pasada, y 6 + 3 + 3 repartidos en tres etiquetas en otra. Ninguno de los tres trozos alcanzaba el umbral de publicacion, asi que el hallazgo principal del deck desaparecia. No porque los respondentes cambiaran de opinion, sino porque el paso de agrupacion trazo la linea en otro sitio.

El instrumento no distinguia conceptos

Agrupabamos conceptos por similitud coseno entre etiquetas cortas, con un umbral de 0,65. Asi que medimos que separa de verdad ese instrumento, usando nuestras propias etiquetas reales:

  • Dos formas de decir la misma idea: 0,444 a 0,622
  • Dos conceptos genuinamente distintos: 0,283 a 0,648

Se solapan. "Las herramientas automaticas no te conocen" y "miedo a que la herramienta se equivoque", ideas distintas, estan a 0,648: mas cerca que dos redacciones de una misma idea, que llegan a estar a 0,444. Ningun umbral las separa, con ningun valor.

Bajarlo a 0,50 parecia el arreglo, y la continuidad subia de 1 a 4 de 5. Entonces miramos que estaba fundiendo, y metia "falta de historial verificable" dentro de "falta de responsabilidad humana": los dos hallazgos principales y genuinamente distintos del estudio, colapsados en uno.

Estable y equivocado es peor que inestable. Una tuberia que lo mete todo en un cubo es perfectamente reproducible y no dice nada.

La estabilidad no es una metrica de calidad por si sola, y esa frase esta ahora escrita en nuestras reglas de ingenieria.

El arreglo: leer una vez y luego decidir

El sistema decidia respuesta a respuesta, 980 veces, y despues cosia los trozos. El cosido es donde se rompia.

La alternativa es como trabaja un investigador de verdad: leer las entrevistas y luego escribir los codigos. Asi que extraemos solo evidencia literal por respuesta, y despues hacemos una unica pasada de sintesis sobre el corpus entero, unos 133.000 tokens de citas, que decide la lista de conceptos una sola vez. Un punto de decision en lugar de 980.

  • 10 de 10 conceptos presentes en tres corridas independientes del estudio estadounidense. El criterio se declaro antes de mirar: 8 de 10.
  • 5 de 5 para la cabeza de la lista, que es lo que publica el deck, en las ocho comparaciones de los dos estudios.
  • Las tres corridas de sintesis cuestan una fraccion de lo que costaba una sola de las extracciones antiguas.

La parte que nos salio en contra

La sintesis se invento citas. El 7,1% de lo que devolvio no existia en ninguna parte del corpus. Una de ellas era "Una maquina no puede sentarse enfrente y verme la cara." Suena perfecta. No la dijo nadie. Todas las cazo la comprobacion de literalidad que ya teniamos, que es la unica razon por la que este parrafo es una nota al pie y no un desastre.

Tambien teniamos una intuicion que resulto ser exactamente al reves. Repetir el paso barato, la clasificacion, habria costado mil veces menos que repetir la extraccion. Lo medimos: clasificar el mismo corpus tres veces da recuentos identicos en 15/20, 12/16, 16/20 y 18/18 conceptos. La clasificacion es practicamente determinista, asi que la opcion barata habria devuelto 3 de 3 en casi todo y nos habria dado un sello que no significaba nada.

Y aparecieron ocho defectos de implementacion por el camino. Los ocho se encontraron ejecutando el codigo contra datos reales o abriendo el fichero que le entregamos a un cliente. Nuestros 1.844 tests unitarios estaban en verde con todos ellos dentro. La regla que escribimos despues: una funcion de analisis no esta terminada hasta haberla ejecutado contra un estudio real.

Lo que publica el informe ahora

No "lo que supero el umbral en una extraccion", sino "lo que aparecio en las tres, con la mediana de las tres". Dos preguntas distintas, y cada una la contesta quien sabe: si un hallazgo es real lo dice su presencia en las corridas; si merece el titular lo dice su tamano.

La linea que lee un cliente:

Entre 8 y 13 de 67 respondentes lo plantean como necesidad no cubierta. Presente en los 3 analisis.

Dos hallazgos cuyos rangos se solapan se nombran como grupo, no como primero y segundo. Ordenarlos seria publicar una precision que sabemos que se da la vuelta.

En produccionAntesDespues
Reino Unido - barreras y necesidades2 / 014 / 9
Estados Unidos - barreras y necesidades3 / 012 / 12
Tarjetas del deck con cita1 de 44 de 4
Filas de la hoja de calculo con cita0 de 1616 de 16

Lo que se cambia, y lo que sigue abierto

Reproducibilidad significa extraer tres veces, asi que el paso de analisis cuesta unas tres veces lo que costaba. El aumento es irrelevante frente a lo que vale un estudio, asi que el coste nunca fue la pregunta. La pregunta era si la reproducibilidad merecia la pena, y la merecia. El reparto importa mas que el total: casi todo son las tres extracciones, y la sintesis, que es la parte que arregla el problema, es un error de redondeo. Si alguna vez hay que bajarlo, se pasa a dos extracciones y la sintesis se queda.

Sigue abierto, y preferimos decirlo a que nos lo encuentren: por encima de 1.500 respuestas la comprobacion de respaldo no se ejecuta y el informe sale por el camino antiguo. El orden dentro de un grupo no esta cerrado del todo. Y nada de esto dice absolutamente nada sobre si los respondentes sinteticos se parecen a los humanos. Por esta plataforma aun no ha pasado ningun humano; el estudio que los va a comparar esta disenado y pre-registrado, y lo contaremos igual que contamos todo lo demas.

Por que lo publicamos

Porque la capa que se esta midiendo no es la unica que se mueve. Si una muestra sintetica se parece a los humanos es la pregunta importante, y el sector la esta respondiendo en serio: fiabilidad test-retest, back-tests contra encuestas publicadas, Gallup con investigacion formal ya iniciada. Todo eso mide al respondente. Nada de eso te dice si la maquinaria que hay entre las respuestas y el deck es estable, y la nuestra no lo era.

Comprobarlo es barato. Ejecuta tu analisis dos veces sobre un estudio terminado y compara las listas de conceptos por cadena exacta. Sin juez y sin coseno. Si las dos listas difieren, cualquier comparacion contra humanos que hagas encima de eso esta midiendo tu propio ruido.

Preferimos decirte nuestro numero a que supongas que era el 100%.

El metodo detras de estos estudios esta escrito entero, con sus limites.

Leer el paper en SSRN