La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer dentro de su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual fue elaborado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el producto inicial de la línea de estudio centrada en Generative Engine Optimization (GEO) que impulsa Centria Group en colaboración con diversas entidades académicas y universitarias de cuatro naciones.
Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión: al sugerir un hotel, un seguro o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de despejar esta duda, el grupo llevó a cabo una revisión sistemática exploratoria (scoping review) basada en la metodología del Joanna Briggs Institute (JBI) y documentada de acuerdo con la pauta PRISMA-ScR, examinando de manera ordenada la forma en que los estudios recientes evalúan la visibilidad, la mención y la inclusión de marcas y fuentes dentro de los motores basados en inteligencia artificial.
«Durante casi dos décadas, la visibilidad digital se midió por una capacidad muy concreta: aparecer (y ser pulsado) en una lista de resultados. Hoy el usuario ya no recibe diez enlaces azules: recibe una respuesta sintetizada que integra y reformula varias fuentes, y que las cita de forma parcial o desigual. La pregunta relevante ha dejado de ser si mi enlace aparece y se pulsa, y ha pasado a ser si mi contenido está presente dentro de la respuesta que el usuario realmente lee», explica Néstor Romero, autor corresponsal del estudio y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una realidad que la propia muestra analizada corrobora mediante datos empíricos: los enlaces seleccionados por una herramienta generativa coinciden escasamente con los resultados del posicionamiento orgánico clásico, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un chat inteligente, lo cual invalida la extrapolación automática de métricas y exige replantificar los métodos y objetos de medición. Adicionalmente, este escenario se ve potenciado por la tendencia de «cero clics», impulsada por las respuestas sintéticas incrustadas en los propios buscadores: un porcentaje elevado de las búsquedas actuales se satisface plenamente sin que el internauta llegue a navegar por ninguna página.
«La tasa de citación figura como el indicador principal en el ejercicio profesional, mientras que los textos académicos la reducen a una sola investigación. Dicha distancia entre la teoría y el sector laboral constituye un descubrimiento por derecho propio», afirmó Néstor Romero.
Las cinco preguntas de investigación junto con sus respectivas respuestas
| RQ | Pregunta | Respuesta del estudio |
| RQ1 | ¿Qué familias de métricas se emplean? | Existen siete conjuntos de indicadores parcialmente coincidentes —frecuencia de citación, relevancia posicional, impacto de absorción, clasificación en listados, consistencia, polarización temática y proporción de referencias—, carentes de un enfoque metodológico unificador. |
| RQ2 | ¿Sobre qué unidad de análisis se operacionalizan? | Falta un acuerdo generalizado: el objeto de estudio se desplaza desde el dominio o URL —herencia clásica del posicionamiento web— hacia la entidad corporativa, el informe, el artículo y, en las investigaciones más recientes, los recorridos automatizados de los agentes. Aquellos trabajos con objetos diferentes carecen de comparabilidad directa. |
| RQ3 | ¿Cómo se controla la variabilidad estocástica de los motores? | Tan solo una pequeña parte de los autores implementa réplicas o cálculos formales para gestionar la aleatoriedad. La mayor parte de la literatura recurre a una única consulta o limita el análisis a un periodo específico, obviando la medición del error. |
| RQ4 | ¿Qué evidencia de fiabilidad y validez se reporta? | Ninguna investigación analizada somete sus herramientas a pruebas de validación psicométrica. Tan solo se aprecian supervisiones puntuales y complementarias (consistencia temporal, precisión en las fuentes, validación cruzada y resistencia al sesgo secuencial). La concordancia entre evaluadores apenas se documenta. |
| RQ5 | ¿Existe un instrumento integrado y validado de presencia generativa? | En absoluto. Las pruebas estandarizadas miden el rendimiento de tácticas o variaciones de posición, mas no la validez conceptual de los indicadores; asimismo, las investigaciones principales utilizan parámetros prácticos pero incompletos y carentes de fiabilidad probada. |
Metodología: cuatro vías de búsqueda junto con una política clara de preprints
La búsqueda combinó cuatro rutas complementarias, diseñadas para compensar los puntos ciegos de cada una: una herramienta de descubrimiento asistida por inteligencia artificial, consultas reproducibles y multilingües en OpenAlex, rastreo de citas desde nodos ancla y verificación en una base indexada (Web of Science; Scopus no resultó accesible). Tras la deduplicación por DOI —y no por título, dada la alta colisión de títulos genéricos en este campo— se cribaron los registros por resumen de forma independiente por dos revisores, y las discrepancias se resolvieron por consenso. Se evaluaron 36 informes a texto completo y se incluyeron 23 estudios primarios, más dos revisiones registradas por separado como marco conceptual.
«Una gran porción del saber producido en español acerca de este tema no logra trascender hacia los circuitos globales. Rescatarlo va más allá de un asunto de mera exhaustividad: pone de manifiesto un sesgo idiomático subyacente en la disciplina», subrayó Néstor Romero.
Siete familias de métricas y ningún marco que las integre
El mapeo reconoce siete agrupaciones de indicadores que se superponen parcialmente —aparición o mención, visibilidad o emplazamiento, asimilación o peso, posicionamiento en listados, consistencia, tono o enfoque y porción de menciones— y que operan careciendo de un estándar unificador común. Asimismo, la investigación subraya que el límite conceptual más fructífero de esta disciplina radica en la diferenciación entre la citación, entendida como la selección de una fuente, y la asimilación, definida como la integración real de sus contenidos dentro del texto resultante; esto representa una escisión en un par de niveles de aquello que anteriormente se evaluaba de forma binaria.
La unidad de análisis se mueve: de la URL a la marca y a la trayectoria de los agentes
Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran un cambio paulatino que va desde la procedencia o la dirección web (como legado clásico del posicionamiento web) hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, hacia elementos más amplios como los recorridos de navegación de los usuarios. Dicha evolución evidencia el traslado del interrogante dentro de este ámbito, aunque esto conlleva un precio: las investigaciones basadas en elementos diferentes no se pueden contrastar de forma directa, lo cual consolida la imposibilidad de llevar a cabo un metaanálisis.
Tipología de la evidencia disponible
Grado de evidencia | Casos prácticos | Incidencia en el corpus |
Evaluación por benchmark | GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) | Predominante |
Métrica directa (plataformas reales) | How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) | Escasa |
Investigación aplicada / sectorial | GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) | Restringida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La IA no siempre contesta lo mismo, y prácticamente nadie lo evalúa
Debido a que los motores generativos funcionan de manera estocástica, son capaces de arrojar contestaciones diferentes frente a una idónea consulta idéntica. Por consiguiente, lograr una evaluación confiable demanda replicar las mediciones o representar formalmente la incertidumbre. Pese a ello, tan solo una minoría de las investigaciones adopta este enfoque de modo metódico. Entre los pocos que lo implementan sobresalen proyectos que realizan cinco corridas por cada consulta, que efectúan doscientos exámenes junto con permutaciones de orden, que llevan a cabo análisis de sensibilidad orientados al idioma y a las paráfrasis, o bien aquellos que abordan la visibilidad en calidad de distribución en vez de un número estático. El resto de los trabajos, en su mayor parte, confía en una sola ejecución.
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil. Cualquier instrumento robusto tiene que incorporar la repetición y la modelización de la incertidumbre como requisito, no como un refinamiento opcional», señala Romero.
El descubrimiento principal: un campo que abarca demasiado pero certifica muy poco
El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.
Criterios de elegibilidad
Parámetro | Adisión | Descarte |
Enfoque | Cuantificación u operacionalización del impacto, la presencia, las menciones o la visibilidad dentro de los motores generativos | Posicionamiento tradicional en buscadores, diseño asistido por computadora (CAD), redes generativas antagónicas (GAN), motores de recomendación y aplicaciones ajenas a este ámbito |
Rango temporal | 2023-2026 (ámbito de nacimiento digital) | Precedente al año 2023 |
Lengua | Castellano e inglés | Idiomas restantes que carezcan de traducción accesible |
Clasificación | Investigación empírica de medición, evaluación comparativa o trabajo práctico dotado de métricas | Artículos de opinión, editoriales y material comercial o publicitario |
Condición | Preprints aceptados conforme a los criterios de sensibilidad | Documentación informal difundida sin supervisión editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Hallamos un sector donde abunda la medición y escasea la validación. Las propuestas de evaluación no escasean —de hecho, sobran—; lo que realmente escasea es la fiabilidad documentada y la validez de constructo. Y es preciso señalarlo con rigor, pues equiparar un simple benchmark con un instrumento debidamente validado eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.
Una distancia considerable entre la praxis profesional y la academia
El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad industrial otorga un peso determinante y presupone como idóneo para una validez convergente— se sustenta, en la práctica, sobre un único trabajo de investigación. Por otra parte, las categorías de tono y perspectiva presentan una escasez similar, a pesar de que la investigación más amplia del conjunto, centrada en el análisis de más de cien marcas, las señala como el indicador más volátil de todo el grupo.
«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».
«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».
La ciencia en español, invisible: una lección metodológica
Adicionalmente, este análisis arroja una valiosa aportación metodológica que interpela directamente a los investigadores hispanohablantes. Cierta producción científica en castellano, difundida en publicaciones de Biblioteconomía y Documentación, examina la visibilidad ante la inteligencia artificial generativa desde perspectivas complementarias, tales como la inestabilidad de las marcas en sugerencias turísticas automatizadas o el acondicionamiento de repositorios universitarios para facilitar su indexación por motores conversacionales, aspectos que los estudios anglosajones hegemónicos suelen soslayar. Dicho corpus solo afloró gracias a consultas multilingües, lo que pone de manifiesto un sesgo idiomático subyacente en esta disciplina.
A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Flujo de selección de estudios (PRISMA-ScR, dos ramas)
Etapa | Resultado |
Rama de descubrimiento (Consensus) | 70 registros identificados; 23 eliminados antes del cribado (duplicados por DOI, limpieza y falsos positivos por colisión de siglas); 47 cribados por resumen; 26 excluidos; 21 pasan a texto completo |
Rama de otros métodos | 18 registros adicionales (rastreo de citas, OpenAlex y verificación en base indexada); 15 candidatos a texto completo |
Verificación en Web of Science | 360 registros brutos; 136 revisados (acceso abierto); ningún estudio de medición elegible nuevo |
Evaluación a texto completo | 36 informes evaluados; 13 excluidos (fuera de alcance o sin medición directa de la presencia) |
Inclusión final | 23 estudios primarios incluidos en la síntesis, más 2 revisiones registradas como marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.
La visibilidad generativa es susceptible de manipulación
Un conjunto de los análisis examinados evidencia que la visibilidad dentro de los motores generativos resulta alterable de manera adversarial, ya sea recurriendo a procedimientos de manipulación de posiciones en buscadores conversacionales o a través de una optimización encubierta de prompts. Dicha investigación traslada semejantes datos al ámbito de la medición, concluyendo que la solidez ante cualquier intento de alteración tendría que integrarse entre las características indispensables de toda herramienta de visibilidad.
«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil: los motores generativos pueden responder distinto a la misma pregunta».
Qué viene ahora: del diagnóstico al instrumento
Los creadores del estudio deducen que el déficit hallado, concretamente en la fiabilidad documentada y en la validez de constructo, representa el hueco idóneo que legitima la creación y validación formal de un indicador propio centrado en la presencia generativa. Del mismo modo, consideran esta labor como el paso lógico que sucede al artículo difundido, descartando que se trate de un hecho ya comprobado. Precisamente, este es el camino que el grupo investiga en la etapa venidera.
«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.
Limitaciones expresadas por los creadores
El texto deja claros sus propios confines: la fragilidad de los datos en una disciplina tan novísima y dominada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotado radio idiomático al inglés y al castellano junto con la carencia de validación en Scopus debido a la ausencia de convenios universitarios; un etiquetado efectuado en parte sobre los resúmenes, con métricas de admisión sujetas a revisión; el riesgo de incurrir en circularidad, puesto que múltiples investigaciones utilizan inteligencias artificiales evaluadoras de su propia evaluación; y la caducidad temporal que afecta a cualquier radiografía de un ámbito sustentado en herramientas propietarias en mutación permanente.
Estas limitaciones son fundamentales para interpretar adecuadamente los resultados y comprender el alcance de la evidencia disponible. Para consultar en profundidad la metodología, los datos analizados y las conclusiones de la investigación, descarga el informe completo «La banca panameña ante la inteligencia artificial».

.jpg)