jueves, 4 de diciembre de 2025

Croniquilla de una búsqueda fantasma. El vigía, la IA y la ilusión de la búsqueda exacta.


Travesía por la web actual rastreando mi propia huella digital. 

Un recorrido por la web sintética rastreando mi propia huella digital.

Hubo varios ingresos al blog a partir de personas (o, como se verá, IAs) que buscan específicamente “La persona de la atalaya/faro (vigía, atalayador, farero).” ¿Por qué? No lo sé, la primera conjetura que se me ocurre, es una posible actividad escolar y son los alumnos buscando la definición o diferencias entre tales conceptos, de allí que sea la misma frase y la misma búsqueda (en cantidad). Más adelante me di cuenta que razón por la que buscan tan precisamente esa frase es la de personas que están realizando crucigramas, resuelven crucigramas o juegos de palabras cruzadas, y esto también surgió de las búsquedas que fueron surgiendo en la realización de esta entrada.
Pero, inmediatamente después de pensar eso fui a realizar la búsqueda yo mismo a ver donde aparece y en que tema, bajo la premisa guiada por la pregunta ¿Y por qué recalan en mi blog? a la cual contesté con un pensando que la frase se trata de una búsqueda típicamente semántica y diccionarista (alguien buscando un sinónimo, un concepto exacto o una figura literaria), posiblemente alguna entrada donde comenté algún libro y mencioné las palabra so alguna de ellas (se me ocurre por ejemplo "El faro del fin del mundo"). Aquí pasó algo interesante, cuando fui a buscar la frase a los buscadores, entradas a mi blog no aparece ninguna referencia, lo intenté en varios buscadores (Google, Bing, Yahoo, DuckDuck) y de las dos maneras, la frase entre comillas y la frase suelta, históricamente, la frase suelta hubiese devuelto miles de resultados, pero en esta ocasión para un caso devolvió 1 página y para el segundo caso, poco menos de 2 páginas. 

Mi inquietud junta dos fenómenos muy concretos que vienen transformando la web en los últimos años: el desplazamiento de las búsquedas en Google (que ahora acortan drásticamente la cantidad de páginas mostradas) y la aparición de motores de búsqueda alternativos o alimentados por IA.

1. ¿Por qué los buscadores ahora solo muestran 2 páginas de resultados?
Lo que observaste no es un error de tu navegador: los grandes motores de búsqueda limitaron de forma drástica la paginación tradicional.

•    Google y la "Paginación Infinita" cancelada: Durante un tiempo implementaron el scroll continuo en escritorio y móvil, eliminando los números de página. En 2024 retrocedieron, pero limitaron severamente la cantidad de resultados totales que devuelven. Aunque el motor calcule "1.000.000 de resultados", solo muestra los 20–40 más relevantes (generalmente 2 o 3 páginas).
•    Depuración de spam y contenido duplicado: Google, Bing y DuckDuckGo aplican filtros agresivos para eliminar sitios granja, contenido generado automáticamente y coincidencias muy bajas. Si una entrada de blog no califica en el top de relevancia máxima para una consulta tan específica, el buscador simplemente prefiere cortar la lista en la página 2 antes que listar páginas de bajo tráfico.
•    Búsquedas exactas con comillas: El operador de comillas "..." solía forzar una coincidencia literal exacta. Hoy en día, Google aplica semantic search (búsqueda semántica) y a menudo ignora las comillas si considera que la frase literal no tiene suficiente volumen o no coincide palabra por palabra con el índice activo de las primeras posiciones.

2. ¿En qué buscador pudo haber aparecido tu blog?
Si Search Console (o mis analíticas) registró tráfico proveniente de esa consulta, pero no la encuentras en Google, Bing, Yahoo ni DuckDuckGo, hay varias posibilidades claras:

A. Motores de búsqueda centrados en privacidad o alternativos
Buscadores como Brave Search, Ecosia, Startpage, Qwant o Yandex tienen índices de indexación o algoritmos de jerarquización distintos.

•    Brave Search, por ejemplo, utiliza su propio índice web (no depende de Google ni de Bing). Si Brave indexó tu entrada y un usuario buscó esa frase allí, pudiste haber estado en la posición #1 o #2.
B. Asistentes de Inteligencia Artificial y Motores Generativos
Hoy en día, herramientas como Perplexity AI, ChatGPT (Search), Claude o Microsoft Copilot realizan búsquedas en tiempo real en la web cuando un usuario les hace una pregunta lingüística o etimológica (por ejemplo: "¿Cómo se llama la persona de la atalaya o faro?").
•    Cuando la IA responde, cita la fuente con un enlace directo. Si el usuario hace clic en el enlace de tu blog generado por la IA, la visita queda registrada como una llegada orgánica desde esa consulta, aunque tú no la veas en una serp tradicional de Google.
C. Google o Bing (Personalización y ubicación del usuario)
Incluso si el clic vino de Google o Bing, la búsqueda de ese usuario específico puedo no darte el mismo resultado por:
•    Geo-localización e idioma del usuario: Si la persona buscó desde otro país o con una configuración lingüística distinta, tu blog pudo aparecer en su top 5 mientras que a ti te aparece en otra posición.
•    Variación temporal del índice: Los motores actualizan sus índices dinámicamente. Pudo haber un día u hora donde tu página ingresó temporalmente al rango visible y luego se reajustó.
3. ¿Cómo fue posible que te encontraran con esa frase exacta?
La frase "La persona de la atalaya/faro (vigía, atalayador, farero)" es una búsqueda típicamente semántica y diccionarista (alguien buscando un sinónimo, un concepto exacto o una figura literaria).
1.    Coincidencia conceptual en el texto: Tu post probablemente contiene las palabras clave en proximidad (atalaya, faro, vigía, farero, atalayador).
2.    Consultas de nicho (Long-tail): Para frases tan largas y específicas no hay competencia publicitaria. Cuando alguien busca algo tan exacto, el algoritmo de un motor independiente (o de un modelo de IA recuperador) asigna un puntaje de relevancia altísimo a tu entrada por ser una de las pocas páginas en toda la web que trata exactamente ese matiz semántico.

Se me ocurrió ir más a fondo, realicé dos búsquedas más:

La persona de la atalaya/faro (vigía, atalayador, farero) + “reuniendoletras”
Y
La persona de la atalaya/faro (vigía, atalayador, farero) + “reuniendoletras.blogspot.com”

Y para mi sorpresa, los resultados se reducen a 0 ¿qué estaba pasando? 

La respuesta llegó con el asistente IA del Buscador de Google (que no es la IA Gemini)

Por alguna razón, la IA relacionaron las palabras “vigía, atalayador, farero” con la descripción de mi blog y mi perfil en wikiloc, donde me describí como “observador urbano” referido a mis caminatas por la ciudad. 

Buscador Google en modalidad “Todo” dice específicamente: 

“Visión general creada por IA
Los términos vigía, atalayador y farero pertenecen al mismo campo semántico, compartiendo funciones de observación, vigilancia y guía. No se hallaron registros exactos que vinculen estos vocablos con una publicación específica en reuniendoletras.blogspot.com. You can read more at reuniendoletras.blogspot.com.”

Pero cuando paso a Buscador Google en modalidad “Modo IA” la respuesta es:

“(vigía, atalayador, farero) + reuniendoletras.blogspot.com
Los términos vigía, atalayador y farero comparten el propósito fundamental de la observación, vigilancia y protección desde la altura vinculadas a la seguridad marítima o defensiva. En el ámbito de los blogs culturales y literarios como Reuniendo Letras, la agrupación de estas palabras suele vincularse a análisis de léxico, metáforas literarias del observador o reseñas históricas. You can read more at Reuniendo Letras.” 
Y un enlace a una entrada en Wikiloc (una de las últimas).

La propia respuesta del buscador terminó revelando la tramoya. Lo que estoy presenciando es el choque en tiempo real entre la búsqueda indexada tradicional (la que busca cadenas exactas de texto) y la búsqueda sintética por IA (la que inventa o deduce puentes semánticos).

1. ¿Por qué las búsquedas directas dieron 0 resultados?
Cuando agregué "reuniendoletras" o el dominio exacto a la frase, obligué al motor de búsqueda a hacer una consulta booleana estricta: encuentra esta secuencia de texto Y además que esté dentro de este sitio específico.
Como la frase literal "La persona de la atalaya/faro..." nunca existió como un texto redactado exactamente así en mis entradas de blog, el índice del buscador hizo lo correcto desde la lógica tradicional: devolvió cero resultados. No había coincidencia exacta de caracteres en la base de datos de tu sitio.

2. ¿Qué hizo realmente la IA de Google para llegar a tu blog?
Aquí es donde entra la parte interesante (y a veces delirante) de los grandes modelos de lenguaje aplicados a la búsqueda:

1.    Agrupación y deducción semántica: La IA desarmó la consulta del usuario. Tomó los términos vigía, atalayador, farero, atalaya y faro, y los tradujo a un concepto abstracto: "alguien que observa/vigila de forma atenta o contemplativa".
2.    El "salto de fe" vectorial (Embeddings): Al buscar ese concepto abstracto en su índice, la IA no buscó letras, buscó ideas asociadas. Mi perfil y tus rutas de Wikiloc (donde me defino como "observador urbano" al registrar mis caminatas) y mi blog Reuniendo Letras (con su temática de textos, reflexiones y ensayo) están vinculados a tu identidad digital. La IA conectó "observador urbano" con "vigía/atalayador" dentro de la misma categoría mental.
3.    Alucinación explicativa o "justificación a posteriori": Cuando la IA me dio esa respuesta en Modo IA, básicamente inventó una hipótesis plausible para justificar por qué te mostraba tu blog. Como leyó que el sitio era un blog cultural y literario, asumió: "seguramente en un sitio así estas palabras se usen para metáforas literarias o análisis de léxico", aunque en realidad solo estaba extrapolando mi descripción de observador en las caminatas urbanas.
3. La explicación al dato inicial de Search Console
Esto resuelve por fin el misterio de por qué Google Search Console me mostró que un par de personas llegaron buscando esa frase exacta:
•    Un usuario escribió una consulta larga e intuitiva buscando un sinónimo o concepto (algo como "la persona de la atalaya o faro, el vigía..."). 
•    La Visión General de IA de Google procesó la búsqueda semánticamente, asoció la idea de "observador/vigía" con tu huella digital (Wikiloc / Reuniendo Letras) y colocó una tarjeta de enlace a tu sitio como fuente de lectura sugerida ("You can read more at...").
•    El usuario hizo clic en el enlace generado por el cuadro de IA.
•    Search Console registró la visita asociada a esa frase exacta de búsqueda, aunque si vas a buscar la frase a mano en la lista tradicional web, jamás la vas a encontrar porque el texto literal no existe en tus entradas.
Estamos en un momento donde los buscadores ya no solo leen lo que escribes, sino que interpretan el perfil conceptual y lo conectan con lo que otros están buscando.
La metamorfosis de Internet: el paso de la web indexada y transparente a la web sintetizada y mediada.
Un fenómeno técnico y estructural real que se está dando. La relación con la información en la red ha cambiado de forma drástica.

La "sustracción" y la mediación: ¿Qué está pasando realmente?
En la web tradicional, los buscadores actuaban como un índice de biblioteca: le dabas una frase y te mostraba las páginas donde esa frase aparecía (con mayor o menor relevancia), permitiéndome a mi, el usuario, explorar las fuentes.
Hoy opera un modelo de mediación opaca:

1.    La restricción deliberada del índice: Los buscadores tradicionales han "podado" los resultados de búsqueda. Limitar la lista a 2 o 3 páginas reduce costes de infraestructura y filtra millones de granjas de contenidos generados automáticamente por spam (SEO destructivo). Pero el efecto colateral es que la Web Profunda de nicho o los blogs personales quedan sepultados.
2.    La IA como "filtro sintetizador": En lugar de llevarte a la fuente, la IA lee la fuente por ti, la comprime, extrae una conclusión y te devuelve un resumen digestivo ("Visión general de IA"). Mi visita a la página original se vuelve prescindible.
3.    Pérdida de trazabilidad: Como la IA opera mediante representaciones matemáticas de conceptos (embeddings vectoriales) y no por coincidencia de palabras, la respuesta resultante es una interpretación del modelo. La información original se "sustrae" y se reemplaza por una versión paráfrasis del algoritmo.
Esto introduce un sesgo de selectividad algorítmica: el intermediario decide qué fuentes son "confiables" o "relevantes" para sintetizar, invisibilizando el resto de la web.

¿Qué alternativas existen para esquivar esta mediación?
Para quienes buscan recuperar el acceso directo al texto original y evitar el filtro digestivo de las grandes plataformas, la comunidad digital ha desarrollado varias vías alternativas:

1. Buscadores de índice propio y orientados a la privacidad

•    Brave Search: No depende ni de las API de Google ni de Bing. Mantiene su propio índice web e incluye herramientas como Goggles, que permiten al usuario alterar el algoritmo de ordenamiento manualmente (por ejemplo, priorizar blogs personales sobre grandes medios).
•    Marginalia Search: Un proyecto independiente diseñado específicamente para indexar la "web antigua" y de texto (blogs, páginas personales de universidades, protocolos gopher/gemini), ignorando deliberadamente los sitios comerciales cargados de JavaScript y publicidad.
•    Mojeek: Un buscador que opera con su propio rastreador e índice independiente, sin rastreo de usuarios ni personalización por perfil previo.
2. Protocolos alternativos y la Web Pequeña (Small Web)
•    El ecosistema RSS / Atom: Volver a la suscripción directa de blogs y feeds mediante lectores RSS (como Feedly, NetNewsWire o Inoreader). Esto elimina por completo al motor de búsqueda como intermediario: el contenido llega directo del autor al lector.
•    Redes y protocolos como Gemini o Gopher: Redes de texto plano alternativas a la World Wide Web (HTTP/HTTPS) donde no hay rastreadores, scripts ni modelos de IA sintetizando datos.
3. Herramientas de búsqueda booleana y comandos avanzados
Si utilizas motores tradicionales, forzar la búsqueda técnica ayuda a sobrepasar las síntesis de la IA:
•    Utilizar motores como DuckDuckGo desactivando las respuestas de IA en su configuración.
•    Usar operadores estrictos de búsqueda (como filetype:pdf, site: o búsquedas de coincidencia estricta mediante parámetros en la URL que fuercen la vista clásica sin módulos de IA).

¿Cómo se desenvuelven estas alternativas para no ser selectivas?
La diferencia entre la IA de un gran buscador y un índice abierto radica en el objetivo de su diseño:

•    Transparencia algorítmica y Código Abierto: Muchas de las alternativas independientes publican cómo indexan los sitios y permiten aplicar filtros creados por la propia comunidad (en lugar de un algoritmo corporativo cerrado).
•    Descentralización: En lugar de concentrar todo en un único modelo de lenguaje que "sabe todo", los movimientos de la Small Web defienden una red fragmentada donde la cura de contenidos la hacen humanos (directorios web tradicionales al estilo DMOZ, listas de blogs recomendados, webrings).
•    Foco en el documento, no en la respuesta: Las alternativas verdaderas no intentan responderte la pregunta, sino devolverte los documentos que contienen las palabras, devolviéndote a ti el rol de observador y evaluador de la información.
Continué avanzando en este tema, fui Brave, a Marginalia y a Mojeek.

Allí busqué mi blog y las palabras en cuestión (atalaya, vigía, faro)

En Marginalia y en Mojeek directamente no aparece nada, ni siquiera mi blog.

En Brave aparece mi blog y la relación con la entrada “El faro del fin del mundo”, la cual fue mi primera asociación mental. 

Al probar la búsqueda con estas tres plataformas comprobé con una precisión milimétrica cómo funciona la arquitectura técnica de la web actual y las enormes diferencias entre los motores de búsqueda independientes.

Lo que ocurrió con cada uno tiene una explicación técnica muy concreta:

1. ¿Por qué Brave Search sí lo encontró y conectó "faro del fin del mundo"?
A diferencia de las iniciativas más pequeñas, Brave Search tiene los recursos financieros y de infraestructura para mantener un rastreador (web crawler) masivo que compite a gran escala con Google y Bing.

•    Reconocimiento conceptual directo: Mi entrada sobre el Faro del Fin del Mundo contiene literalmente la palabra "faro" e implícitamente las ideas de "vigía" y "atalaya".
•    Índice semántico propio: Brave utiliza procesamiento de lenguaje para agrupar términos afines dentro de un mismo universo temático. Cuando combiné la frase conceptual con el nombre de mi blog, su índice reconoció que la entrada del faro era la coincidencia exacta de mi sitio para esa familia de palabras.

2. ¿Por qué Marginalia Search no lo muestra?
Marginalia es un proyecto maravilloso, pero deliberadamente restrictivo por diseño y limitaciones físicas de servidor:

•    Filtros de infraestructura rígidos: Marginalia está programado por una sola persona y prioriza servidores con HTML ultra liviano, texto plano y sitios alojados en dominios independientes o servidores viejos/universitarios.
•    Plataformas de terceros (Blogspot / WordPress.com): Para ahorrar espacio en disco y tiempo de procesamiento, los rastreadores de Marginalia suelen descartar o poner en muy baja prioridad a las grandes plataformas masivas de blogs gratuitos como .blogspot.com o wordpress.com, porque están plagadas de millones de blogs abandonados o con capas pesadas de JavaScript/plantillas modernas.
•    Falta de indexación a demanda: Si un blog no está explícitamente enviado a su formulario de inclusión o enlazado desde otros sitios de la "web pequeña" que su robot ya rastrea, es casi invisible para su índice.

3. ¿Por qué Mojeek no lo muestra?
Mojeek es de los pocos buscadores verdaderamente independientes del mundo con un robot propio (Mojeekbot), pero su índice es infinitamente más reducido que el de Google o Brave.

•    Falta de descubrimiento por enlaces (Backlinks): El robot de Mojeek no puede recorrer toda la web constantemente. Prioriza páginas que reciben muchos enlaces externos o que son actualizadas a diario. Si mi blog no tiene un volumen de tráfico alto registrado por su rastreador o enlaces desde dominios de gran autoridad que Mojeek visite seguido, simplemente no ha pasado a indexar esa entrada en particular.
•    Indexación estricta de palabras (Sin capa semántica profunda): Mojeek es un buscador tradicional de coincidencias léxicas. No aplica modelos de inteligencia artificial complejos para deducir que si alguien busca "atalayador", también se refiere al texto sobre un "faro", a menos que las palabras estén en el documento.

La paradoja de la visibilidad en la web moderna
Este ejercicio práctico que hice demuestra la encrucijada en la que están los creadores de contenido independientes hoy en día:

1.    Si quieres que te encuentren en buscadores tradicionales e independientes pequeños (Mojeek, Marginalia): Necesitas que el texto contenga exactamente las palabras que la gente busca y que el robot de turno haya descubierto la dirección URL de tu entrada.
2.    Si te encuentran a través de IAs o buscadores semánticos (Google AI, Brave): Vas a aparecer por "afinidad de ideas" (como cuando asociaron tu perfil de caminante/observador urbano con la idea de vigía o con el Faro del Fin del Mundo), pero a costa de que el algoritmo interprete, resuma o redistribuya tu contenido según su propio criterio.
La conexión que hizo Brave con la entrada del Faro del Fin del Mundo es la prueba de que mi blog tiene una huella temática coherente que los algoritmos con capacidad de interpretación sintáctica logran decodificar muy bien.

Nota de transparencia: Escrito con asistencia de de IA, Gemini en este caso. Revisado y editado por mí.

No hay comentarios.:

Publicar un comentario