Metodología

Cómo se construye el Índice de Marcas: qué medimos, cómo lo medimos, por qué preguntamos varias veces, y qué NO afirma esta medición.

Edición vigente: agosto 2026

La pregunta

El Índice de Marcas mide una sola cosa: cuando alguien le pide una recomendación a la inteligencia artificial —sin nombrar ninguna marca—, ¿qué marcas nombra?

No es una encuesta a personas, ni una medición de cuota de mercado, ni un ranking de calidad. Es una medición de lo que respondieron los modelos, con su margen de error al lado.

El instrumento

  • Tres modelos de chat que se usan en Argentina: ChatGPT, Gemini y Claude. Registramos la versión fechada que resolvió cada motor —openai/gpt-5.5-20260423, google/gemini-3.6-flash-20260721 y anthropic/claude-sonnet-5-20260630— porque los modelos cambian entre ediciones.
  • 62 categorías de consumo y 175 preguntas escritas a mano, relevantes para una decisión de compra (no un vago "cuál es el mejor").
  • Ningún prompt nombra una marca. Es recuerdo espontáneo ("unaided recall"): dejamos que el modelo elija a quién nombrar.
  • Búsqueda web apagada. Así no medimos SEO: medimos lo que el modelo ya tiene grabado en su entrenamiento, no lo que se publicó en la web este mes.
  • Cada pregunta se repite 8 veces por modelo, a temperatura 1,0. Total: 4.200 respuestas por edición.

Qué reportamos

  • Incidencia (Omnipresencia): en qué porcentaje de las respuestas aparece la marca, sin importar el lugar.
  • Top of Mind: en qué porcentaje la marca es la primera que nombra el modelo.
  • La Brecha: la distancia entre aparecer y ser elegido primero. Aparecer seguido no es lo mismo que ser la primera opción.
  • Desglose por modelo: los mismos números, motor por motor, para ver cuánto se desacuerdan los modelos entre sí.

Cada número lleva su margen de error (intervalo de Wilson): dos marcas cuyas bandas se solapan se leen como empatadas, sin tener que interpretar el ±.

Por decisión de diseño, no publicamos un score compuesto (una sola cifra que "resuma" a la marca) ni etiquetamos el origen de cada marca: preferimos tres tablas honestas antes que un número que esconda el detalle.

Por qué preguntamos varias veces

Un modelo de lenguaje, con temperatura mayor a cero, no da siempre la misma respuesta: define una distribución de respuestas posibles. Preguntar una sola vez es sacar una muestra al azar de esa distribución.

Repetir la misma pregunta N veces y contar en qué proporción aparece cada marca es estimar esa distribución: es muestreo de Monte Carlo y la ley de los grandes números. La proporción resultante es una estimación binomial, y su incertidumbre es exactamente el intervalo de Wilson que mostramos en cada dato.

Más repeticiones dan bandas más angostas. Usamos 8 por modelo: un equilibrio entre costo y precisión. Por eso las bandas no son iguales en todas las categorías —y lo decimos.

Un campo emergente (y lo decimos)

Muestrear un modelo varias veces y agregar los resultados tiene respaldo académico sólido para usos vecinos: mejorar la precisión de una respuesta (self-consistency), evaluar modelos con múltiples muestras (pass@k), y recuperar una distribución de "opiniones" tratando al modelo como una población que se muestrea.

Usar esa misma lógica para publicar "qué marcas prefiere la IA" se apoya en esos trabajos, en estadística básica, y en una práctica de industria emergente (la optimización para motores generativos). Todavía no existe un único paper canónico que diga "medí la preferencia de marca exactamente así", y preferimos ser explícitos al respecto.

Nuestra respuesta a esa incertidumbre es la transparencia: mostramos las bandas de error, fijamos la temperatura, el N y la versión fechada de cada modelo, y presentamos el resultado como la distribución de salida del modelo, no como "la verdad" ni como una opinión nuestra.

Qué NO es esto (límites)

  • Mide la memoria del modelo, no la web viva: con la búsqueda apagada, una marca no mejora su lugar publicando contenido este mes.
  • Sin módulo geográfico: las preguntas son a nivel país; no medimos sesgo regional.
  • La n por categoría va de 48 a 144 observaciones: comparar categorías entre sí es comparar precisiones distintas.
  • Sin ancla de mercado: no comparamos contra cuota de mercado real, porque no tenemos una fuente citada por categoría. Es ausencia de dato, no de interés.
  • No es un ranking de calidad ni una recomendación de compra: es lo que respondió el modelo. Los modelos cambian; por eso cada edición lleva fecha.

Referencias

El fundamento del muestreo repetido de modelos, en la literatura:

  • Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., Narang, S., Chowdhery, A., & Zhou, D. (2022). Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. ICLR 2023. arxiv.org/abs/2203.11171
  • Chen, M., et al. (2021). Evaluating Large Language Models Trained on Code. Introduce pass@k: el muestreo repetido como estrategia estándar de evaluación. arxiv.org/abs/2107.03374
  • Argyle, L. P., Busby, E. C., Fulda, N., Gubler, J. R., Rytting, C., & Wingate, D. (2023). Out of One, Many: Using Language Models to Simulate Human Samples. Political Analysis, 31(3), 337–351. doi.org/10.1017/pan.2023.2
  • Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K., & Deshpande, A. (2024). GEO: Generative Engine Optimization. Proc. 30th ACM SIGKDD (KDD '24). doi.org/10.1145/3637528.3671900

El intervalo de Wilson (1927) es el método estándar para el margen de error de una proporción.