El vacío que abre una oportunidad: la medición del GEO (Generative Engine Optimization) carece de validez de constructo y fiabilidad documentada

La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha publicado en su volumen 2, número 24 (2026), el estudio «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», firmado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. El trabajo, disponible en acceso abierto, es el primer resultado publicado de la línea de investigación sobre Generative Engine Optimization (GEO) que Centria Group desarrolla junto a instituciones académicas y universitarias de cuatro países.

El artículo da respuesta a una incógnita que el marketing digital aún no logra resolver con precisión: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para darles solución, el equipo llevó a cabo una revisión de alcance (scoping review) basada en la metodología del Joanna Briggs Institute (JBI) y divulgada según la extensión PRISMA-ScR, la cual examina de manera metódica el modo en que la bibliografía reciente evalúa la aparición, la visibilidad y el posicionamiento de fuentes y marcas dentro de los motores generativos.

Durante cerca de veinte años, la presencia en internet se evaluaba a partir de una aptitud muy específica: salir —y recibir clics— en un listado de opciones. Hoy en día, las personas ya no se encuentran con diez vínculos de tono azul; ahora obtienen una contestación condensada que combina y reelabora distintos orígenes, mencionándolos de manera incompleta o desequilibrada. La cuestión verdaderamente importante ya no gira en torno a si el enlace propio sale y es seleccionado, sino a si el material informativo se integra dentro del texto que el consumidor finaliza consultando, señala Néstor Romero, investigador responsable del análisis y director de operaciones (COO) de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El análisis arranca de una realidad que el propio corpus corrobora mediante datos empíricos: las referencias empleadas por una inteligencia artificial generativa coinciden escasamente con los resultados orgánicos clásicos, y el criterio de elección difiere según la plataforma. En otras palabras, aparecer en los primeros puestos de Google no garantiza presencia en un chatbot conversacional, lo que echa por tierra la traslación automática de métricas y exige replantizar las mediciones y los métodos. A este escenario se une el impacto de las «cero clics», potenciado por las respuestas sintéticas que ofrecen los motores de búsqueda actuales: gran parte de las búsquedas culminan sin que el internauta navegue hacia ninguna página web.

La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo, dijo Néstor Romero.

¿Qué varía del SEO al GEO?

Dimensión SEO (búsqueda tradicional) GEO (motores generativos)
Unidad de visibilidad Un puesto en una lista de diez enlaces La presencia dentro de una única respuesta sintetizada
Métrica central Posición orgánica, clics, impresiones, CTR Citación, prominencia, absorción textual, cuota de citación
Decisión del usuario Elige entre varias fuentes que ve Recibe una respuesta que integra y reformula fuentes, citándolas de forma parcial o desigual
Comportamiento del sistema Determinista y relativamente estable Estocástico: la misma pregunta puede producir respuestas distintas
Transferencia de indicadores No transferible: las fuentes que cita un motor generativo se solapan poco con las que posicionan en la búsqueda tradicional

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

Se integraron cuatro vías complementarias en la búsqueda, pensadas para contrarrestar las limitaciones específicas de cada una: un sistema de hallazgo impulsado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y comprobación en una plataforma indexada (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la frecuente coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores analizaron los resúmenes de forma autónoma, alcanzando acuerdos por consenso ante cualquier desacuerdo. Se examinaron 36 documentos íntegros, incorporando 23 investigaciones originales junto a dos revisiones catalogadas de manera independiente a modo de marco teórico.

Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo, recalcó Néstor Romero.

Siete familias de métricas y ningún marco que las integre

El análisis señala siete familias de indicadores parcialmente interconectadas —aparición/citación, relevancia/ubicación, absorción/influencia, clasificación en listados, consistencia, tono/marco y porcentaje de citación— que operan careciendo de un estándar unificado común. Asimismo, la investigación subraya que el límite teórico más fructífero de esta disciplina radica en la separación entre citación (la elección de una referencia) y absorción (la integración real de sus datos dentro del texto generado), dividiendo así en dos planos lo que tradicionalmente se evaluaba como una simple dicotomía.

Las siete familias de métricas identificadas

Familia Definición operativa Ejemplos en la literatura
Aparición / citación Se alude o menciona directamente a la marca o fuente Aggarwal et al. (2024); Khedekar y Bansal (2026)
Prominencia / posición Saliencia y ubicación que ocupa la cita Aggarwal et al. (2024); Murár (2025)
Absorción / influencia Aporte textual real proveniente de la fuente Zhang et al. (2026)
Ranking en listas Modificación en la jerarquía del elemento Bagga et al. (2025); Nimase et al. (2026); Kumar y Lakkaraju (2024)
Estabilidad Grado de consistencia temporal y entre distintas ejecuciones Schulte et al. (2026); Chen et al. (2025)
Sentimiento / encuadre Contexto y valencia asociados a la referencia Khedekar y Bansal (2026); Kumar (2026)
Cuota de citación Porcentaje de menciones en comparación con la competencia Khedekar y Bansal (2026)

El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los actores

No existe consenso sobre qué se mide exactamente. El corpus revela un desplazamiento progresivo desde la fuente o la URL —herencia directa del SEO— hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, hacia unidades de orden superior como la trayectoria de navegación de los agentes. Ese desplazamiento refleja la migración de la pregunta del campo, pero tiene un coste: los estudios con unidades distintas no son directamente comparables, lo que refuerza la imposibilidad de realizar un metaanálisis.

La IA no responde siempre lo mismo, y casi nadie lo mide

Dado que los motores generativos funcionan de manera estocástica, son capaces de arrojar contestaciones diferentes frente a una idónea idéntica consulta. Una evaluación certera demanda, por ende, duplicar las pruebas o bien representar de forma explícita la variabilidad. No obstante, tan solo una pequeña parte de las investigaciones procede de este modo riguroso. Dentro del grupo que sí implementa estas prácticas sobresalen iniciativas que realizan cinco corridas por cada petición, completan doscientos exámenes junto a variaciones de secuencia, aplican estudios de sensibilidad para idioma y refraseo, o bien consideran la visibilidad en calidad de distribución en vez de como un dato aislado. El porcentaje restante suele fundamentarse en una única ejecución.

«En este ámbito, registrar una única ejecución resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la modelización de la incertidumbre y la repetición como exigencias ineludibles, más allá de considerarlas un simple adorno opcional», puntualiza Romero.

El descubrimiento fundamental: un ámbito que abarca de más y constata de menos

El hallazgo principal de la investigación revela que ninguno de los trabajos analizados somete su herramienta de medición a una validación psicométrica rigurosa. En su lugar, se implementan controles periféricos y fragmentados —como índices de estabilidad, precisión en la asignación, contrastación metodológica o resistencia a alteraciones de secuencia—, mientras que la consistencia entre evaluadores, condición elemental para cualquier dispositivo, rara vez se documenta. Por otro lado, la validez se sostiene en la consistencia interna de referencias concebidas para la ocasión, relegando a un segundo plano las características métricas propiamente dichas. De este modo, la premisa fundamental del estudio es contundente: aún no se cuenta con un instrumento consolidado y contrastado que permita evaluar la huella generativa de las marcas.

«Descubrimos un ámbito donde se mide en exceso pero se valida de manera escasa. No escasean las propuestas para medir, de hecho sobran; lo que realmente escasea es la fiabilidad debidamente documentada y la validez de constructo. Hay que decirlo con total exactitud, puesto que equiparar un benchmark con un test validado magnifica de forma artificial la supuesta madurez metodológica del sector. Justamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.

Existe una separación entre la formación académica y la práctica profesional

El artículo documenta un desajuste llamativo entre lo que la industria considera central y lo que la ciencia ha formalizado. La cuota de citación (citation share) —métrica que la práctica profesional trata como decisiva y candidata natural a validez convergente— está formalizada en esencialmente un solo estudio. Y la familia de sentimiento y encuadre es igualmente escasa, pese a que el trabajo de mayor escala del corpus, que analiza más de un centenar de marcas, la identifica como la señal más inestable de todas.

«La visibilidad en Google no predice la visibilidad en un asistente generativo. Eso invalida la transferencia directa de indicadores y obliga a repensar qué medimos y cómo».

«La visibilidad generativa resulta manipulable, lo que impone a la medición una exigencia ajena a sus estándares habituales: la resistencia a la manipulación concebida como cualidad intrínseca del instrumento».

La ciencia en español, invisible: una lección metodológica

Además, el análisis arroja una aportación metodológica de notable interés para el ámbito hispanohablante. Dentro de las publicaciones periódicas de Biblioteconomía y Documentación, circula una vertiente investigadora en español que examina el posicionamiento frente a la inteligencia artificial generativa desde perspectivas diversas —como la inestabilidad de las marcas en sugerencias turísticas propiciadas por IA, o bien el ajuste de archivos académicos para facilitar su indexación por parte de sistemas generativos—, aspectos que el corpus académico en inglés suele omitir. Dicha producción científica únicamente pudo rescatarse gracias a la exploración en varios idiomas, lo que pone de manifiesto la existencia de un sesgo idiomático implícito en esta disciplina.

A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

La visibilidad generativa es susceptible de manipulación

Un subconjunto de los trabajos revisados demuestra que la visibilidad en motores generativos es manipulable de forma adversarial, mediante técnicas de manipulación del ranking en buscadores conversacionales o mediante optimización sigilosa de prompts. El estudio traslada esa evidencia al terreno de la medición: la robustez frente a la manipulación debería formar parte de las propiedades exigibles a cualquier instrumento de presencia.

«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».

«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil: los motores generativos pueden responder distinto a la misma pregunta».

Próximos pasos: del diagnóstico al instrumento

Los investigadores deducen que el vacío observado —tanto en validez de constructo como en fiabilidad documentada— representa el hueco que legitima la creación y validación formal de un indicador específico de presencia generativa, planteando esta labor como el paso lógico tras lo ya publicado, más que como una hipótesis comprobada. Justamente en esa dirección avanza el grupo durante la etapa consecuente.

«El propósito fundamental consiste en trascender la fase diagnóstica para materializar un instrumento práctico: elaborar y comprobar la validez de un indicador que permita a entidades de cualquier dimensión evaluar empíricamente, mediante criterios científicos, la visibilidad de su marca ante las respuestas automatizadas de la inteligencia artificial», sostiene Néstor Romero.

Limitaciones explicitadas por los creadores

El artículo explicita sus propios límites: la inestabilidad de la base de evidencia en un campo tan reciente y dominado por preprints, que hace provisionales sus conclusiones; la no reproducibilidad de la ruta de descubrimiento inicial —mitigada, aunque no eliminada, por OpenAlex, el rastreo de citas y la verificación indexada—; el alcance lingüístico restringido a español e inglés y la imposibilidad de verificar en Scopus por falta de acceso institucional; la codificación parcialmente realizada a nivel de resumen, con cifras de inclusión provisionales; una amenaza de circularidad, dado que numerosos estudios emplean modelos de lenguaje como jueces de su propia medición; y la validez temporal limitada de cualquier fotografía de un campo que opera sobre sistemas propietarios en evolución constante.

Ficha técnica del estudio

Campo Información
Título Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez
Título en inglés Measuring brand presence in Generative Engine Optimization (GEO): A scoping review of metrics and validity
Autoría Romero-Ramos, N.; Lobach, Y.; Abreu-Abreu, D.; Castillo-Hernández, I.; García-Cordero, J. C.; García-Cordero, D.
Revista Latitude: Multidisciplinary Research Journal (Quality Leadership University, Panamá)
Volumen y número Volumen 2, número 24 (2026), julio-diciembre
Páginas 23-39
DOI https://doi.org/10.55946/latitude.v2i24.295
Enlace al artículo https://revistas.qlu.ac.pa/index.php/latitude/article/view/295
Recepción / aceptación / publicación 15 de julio de 2026 / 8 de agosto de 2026 / 17 de agosto de 2026
Licencia Creative Commons Reconocimiento-NoComercial-CompartirIgual 4.0 (CC BY-NC-SA 4.0). Acceso abierto.
Diseño metodológico Revisión de alcance (scoping review) según metodología del Joanna Briggs Institute (JBI), reportada conforme a PRISMA-ScR
Autor corresponsal Néstor Romero-Ramos (nromero@qlu.pa)

Para profundizar en la metodología, los hallazgos y las implicaciones del análisis, puede solicitar el informe completo sobre la banca panameña ante la inteligencia artificial.

Fuentes y referencias del artículo

Las 27 fuentes citadas en el estudio publicado, en formato APA. Se ofrecen íntegras para que los medios puedan enlazar directamente a la evidencia primaria.

  • Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K., y Deshpande, A. (2024). GEO: Generative engine optimization. En Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. ACM. https://doi.org/10.1145/3637528.3671900
  • Alcaraz Martínez, R., y Sulé, A. (2026). Generative engine optimization (GEO): Revisión de enfoques, métricas y estrategias. Ibersid, 20(1), Artículo 5156. https://doi.org/10.54886/ibersid.v20i1.5156
  • Bagga, P., Farias, V. F., Korkotashvili, T., Peng, T., y Wu, Y. (2025). E-GEO: A testbed for generative engine optimization in e-commerce [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2511.20867
  • Chen, M., Wang, X., Chen, K., y Koudas, N. (2025). Generative engine optimization: How to dominate AI search [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2509.08919
  • Chen, M., Wang, X., Chen, K., y Koudas, N. (2026). Navigating the shift: A comparative analysis of web search and generative AI response generation [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2601.16858
  • Chen, X., y Liao, Y. (2025). Caption injection for optimization in generative search engine [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2511.04080
  • Khedekar, P., y Bansal, G. (2026). Strategic GEO: How generative engine optimization reshapes competitive advantage in consumer markets. International Journal of Data Science and Machine Learning, 6(1). https://doi.org/10.55640/ijdsml-06-01-02
  • Kim, S., Jeong, W., Kim, S., Lee, S., y Lee, D. (2026). SAGEO Arena: A realistic environment for evaluating search-augmented generative engine optimization [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2602.12187
  • Kumar, A., y Lakkaraju, H. (2024). Manipulating large language models to increase product visibility [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2404.07981
  • Kumar, P. (2026). Generative engine optimization at scale: Measuring brand visibility across AI search engines [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2606.20065
  • Liu, Z., y Xu, P. (2026). Think before writing: Feature-level multi-objective optimization for generative citation visibility [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2604.19113
  • Lüttgenau, F., Colic, I., y Ramirez, G. (2025). Beyond SEO: A transformer-based approach for reinventing web content optimisation [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2507.03169
  • Ma, L., Qin, J., Xu, X., y Tan, Y. (2025). When content is Goliath and algorithm is David: The style and semantic effects of generative search [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2509.14436
  • Munn, Z., Peters, M. D. J., Stern, C., Tufanaru, C., McArthur, A., y Aromataris, E. (2018). Systematic review or scoping review? Guidance for authors when choosing between a systematic or scoping review approach. BMC Medical Research Methodology, 18, Artículo 143. https://doi.org/10.1186/s12874-018-0611-x
  • Murár, P. (2025). Reframing SEO for the age of generative engines. Media & Marketing Identity. https://doi.org/10.34135/mmidentity-2025-80
  • Nimase, O., Chen, Z., Qi, G., Zhao, Y., y Hu, X. (2026). GEO-Bench: Benchmarking ranking manipulation in generative engine optimization [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2605.29107
  • Oruesagasti, J. (2026). Algorithmic trust and compliance: Benchmarking brand notability for UK iGaming entities in generative search [Preprint]. ResearchGate. https://doi.org/10.13140/rg.2.2.15316.46721
  • Pfrommer, S., Bai, Y., Gautam, T., y Sojoudi, S. (2024). Ranking manipulation for conversational search engines [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2406.03589
  • Puerto, H., Gubri, M., Green, T., Oh, S. J., y Yun, S. (2025). C-SEO Bench: Does conversational SEO work? [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2506.11097
  • Quintana-Gómez, Á. (2026). Generative engine optimization (GEO) y visibilidad de marcas en recomendaciones turísticas generadas por IA: Un análisis exploratorio. Revista Prisma Social, (52), 21-38. https://doi.org/10.65598/rps.5975
  • Rajpoot, P., y Raghuvanshi, D. R. (2026). An exploratory study on the impact of generative AI (Search Generative Experience – SGE) on organic visibility. International Scientific Journal of Engineering and Management. https://doi.org/10.55041/isjem06077
  • Reyes-Lillo, D., Morales-Vargas, A., y Rovira, C. (2025). Generative engine optimization en repositorios digitales: Optimización de la visibilidad para la IA generativa. INFONOMY, 3(5), Artículo e25034. https://doi.org/10.3145/infonomy.25.034
  • Schulte, J., Bleeker, M., y Kaufmann, P. (2026). Don’t measure once: Measuring visibility in AI search (GEO) [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2604.07585
  • Tang, Y., Fan, Y., Yu, C., Yang, T., Zhao, Y., y Hu, X. (2025). StealthRank: LLM ranking manipulation via stealthy prompt optimization [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2504.05804
  • Tian, Z., Chen, Y., Tang, Y., Liu, J., y Jia, R. (2026). Diagnosing and repairing citation failures in generative engine optimization [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2603.09296
  • Tricco, A. C., Lillie, E., Zarin, W., O’Brien, K. K., Colquhoun, H., Levac, D., Moher, D., Peters, M. D. J., Horsley, T., Weeks, L., Hempel, S., … Straus, S. E. (2018). PRISMA Extension for Scoping Reviews (PRISMA-ScR): Checklist and explanation. Annals of Internal Medicine, 169(7), 467-473. https://doi.org/10.7326/M18-0850
  • Zhang, K., He, X., y Yao, J. (2026). From citation selection to citation absorption: A measurement framework for generative engine optimization [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2604.25707
Por Mateo Durán

Descubre más