Hoy el foco va a lo práctico. Tres movimientos que se pueden aplicar esta semana: Gemini 3.5 Pro entrando a su ventana de disponibilidad general con 2 millones de tokens de contexto y un modo de razonamiento extendido, Hugging Face transformers v5.12 sumando un set de modelos abiertos que cubre vision-language, OCR y razonamiento, y un dato de mercado que cambia el cálculo de a qué proveedor amarrarse para los próximos doce meses.

🥇 Bit #1 — Gemini 3.5 Pro entra a su ventana de disponibilidad general con 2M de tokens y modo Deep Think

Qué pasó. Google está entrando esta semana a la ventana de disponibilidad general de Gemini 3.5 Pro, el modelo presentado en Google I/O el 19 de mayo. Al cierre de este boletín seguía en preview limitado de Vertex AI para empresas, con los analistas ubicando el corte de GA entre el 23 y el 30 de junio. El modelo trae una ventana de contexto de 2 millones de tokens —el doble que Gemini 3.5 Flash y la más grande desplegada en cualquier modelo frontera en producción— que equivale a alrededor de 1,5 millones de palabras: cinco novelas completas, una década de expedientes legales, o un repositorio de software entero en un solo prompt. Suma además un modo "Deep Think" de razonamiento extendido (más cómputo en inferencia, explorando hipótesis en paralelo antes de responder) que queda detrás del tier Ultra de $250 al mes. El precio esperado para el modelo base es de alrededor de $15 por millón de tokens de entrada y $60 de salida, unas diez veces el de Flash.

Take. Los 2 millones de tokens son la noticia técnica, pero el modo de cobro es la noticia de negocio. Google está separando explícitamente "modelo capaz" de "razonamiento profundo", y poniendo el segundo detrás de un tier caro. Es la confirmación de que el costo del razonamiento de punta no va a bajar tan rápido como bajó el de las respuestas rápidas. Para equipos LATAM con presupuesto ajustado, la lectura práctica es no pagar Deep Think para todo: usar el modelo base para el 90% de las tareas y reservar el razonamiento caro para los casos donde un error sale más caro que el cómputo (análisis legal, decisiones financieras, depuración compleja). Y la ventana de 2M de contexto abre un caso de uso concreto que antes era imposible: meter un código base completo, un contrato largo o un año de documentación en un solo prompt sin trocear ni armar RAG. Para quien trabaja con documentos largos en español —donde las herramientas de chunking suelen funcionar peor que en inglés— esto puede ser un cambio real.

🥈 Bit #2 — Hugging Face transformers v5.12: MiniMax-M3-VL, PP-OCRv6 y Parakeet-RNNT para construir sobre modelos abiertos

Qué pasó. El 12 de junio Hugging Face publicó transformers v5.12 con tres incorporaciones que importan para equipos que construyen sobre modelos abiertos. MiniMax-M3-VL es un modelo vision-language con torre visual estilo CLIP y embeddings rotatorios 3D, decoder de mezcla densa/dispersa con expertos SwiGLU-OAI; está pensado para entender imágenes con eficiencia razonable. PP-OCRv6 es un sistema de OCR ligero con tres tamaños (medium, small, tiny) que comparten arquitectura, pensado para correr desde servidor hasta dispositivo de borde. Parakeet-RNNT suma reconocimiento de voz al kit. La versión v5.11, lanzada unas semanas antes, ya había agregado DiffusionGemma y DeepSeek-V3.2, este último con su mecanismo de atención dispersa que recorta cómputo de manera medible.

Take. Lo importante no es ninguno de los modelos por separado sino el patrón. La capa abierta de Hugging Face está cerrando el gap funcional con los cerrados a un ritmo notable, y lo está haciendo donde más duele el precio de las APIs cerradas: visión, OCR y razonamiento. Para un equipo LATAM construyendo, hoy hay tres bloques prácticos para armar sin depender de proveedor extranjero. Para procesar documentos escaneados (facturas, contratos, expedientes públicos) PP-OCRv6 en su versión tiny corre razonable hasta en una máquina modesta. Para tareas multimodales acotadas (clasificación de imágenes con texto, descripción de producto, control de calidad visual) MiniMax-M3-VL es una alternativa concreta a llamar a la API de un frontier cerrado por cada imagen. Y para razonamiento con costo controlado, DeepSeek-V3.2 con su atención dispersa es la opción de mejor relación capacidad/costo del momento. La pregunta concreta para esta semana: ¿qué parte de tu factura mensual a OpenAI o Anthropic está pagando una tarea que podría correr sobre uno de estos tres modelos en infraestructura propia o en un proveedor abierto?

🥉 Bit #3 — ChatGPT cae debajo del 50% de participación global por primera vez

Qué pasó. El State of AI Report 2026 de Sensor Tower, publicado el 16 de junio, registró por primera vez una participación global de ChatGPT debajo del 50%, en 46,4% a fines de mayo (el cruce bajo el umbral ocurrió en marzo). ChatGPT sigue siendo el líder en volumen con más de 1.100 millones de usuarios activos mensuales, pero Google Gemini ya tiene 27,7% (662 millones de MAU) y Claude de Anthropic 10,3% (245 millones). El reporte deja dos datos de fondo importantes: el acuerdo de OpenAI con el Departamento de Defensa de EE.UU. en febrero gatilló un pico medible de desinstalaciones, y Claude lidera la industria en tasa de conversión a pago con 13%.

Take. El número que importa no es el 46,4%, es la dirección. Durante dos años "IA" fue sinónimo de "ChatGPT" para el usuario promedio, y eso le daba a OpenAI una ventaja de marca casi imposible de atacar. Ese foso se está secando. El dato de las desinstalaciones post-acuerdo con Defensa es el más revelador: muestra que una porción real de usuarios elige asistente según valores y confianza, no solo según capacidad técnica. Para equipos LATAM esto cambia el cálculo de dos maneras concretas. Primero, ya no hay una "apuesta segura" por default: vale construir tu stack para poder cambiar de proveedor sin reescribir todo, porque el líder de hoy puede no serlo en doce meses. La capa de abstracción importa más que la elección del modelo. Segundo, si vendes un producto sobre estos modelos, la tasa de conversión del 13% de Claude es la señal de que la disposición a pagar existe y está creciendo —el problema de monetización de la IA de consumo se está resolviendo, y eso abre espacio para modelos de negocio que hace un año no cerraban.

🔗 Enlaces de interés

  • China formaliza un plan estatal de $295.000 millones para su propia red nacional de cómputo, con 80% de chips domésticos. La National Development and Reform Commission cerró un borrador a cinco años para conectar miles de data centers operados por China Mobile y China Telecom en una red única, con meta 2028 y al menos 80% de chips de Huawei y otros proveedores domésticos —dejando a Nvidia y AMD afuera por diseño. Para LATAM es el espejo de una decisión pendiente: dependencia total de modelos extranjeros (riesgo geopolítico real, como demostró el corte de Fable 5 hace once días) versus capacidad soberana (lenta y cara, pero que nadie te puede apagar). (Bloomberg · Tom's Hardware)

  • DeepMind, Schmidt Sciences, Cooperative AI Foundation y ARIA abren convocatoria de $10M para investigación en seguridad de IA multi-agente. Anunciada el 11 de junio, cierra el 8 de agosto. Dos tiers de financiamiento: hasta $300.000 para proyectos exploratorios, entre $300K y $1M para programas más ambiciosos. Cuatro áreas prioritarias incluyen sandboxes y testbeds para evaluar interacciones entre agentes, y entender las propiedades emergentes de poblaciones de agentes. Para equipos académicos LATAM trabajando en seguridad o coordinación de sistemas multi-agente, es de los pocos llamados con fondos reales y deadline corto. (Google DeepMind · Schmidt Sciences — formulario)

  • Zhipu AI publica GLM-5.2 con pesos abiertos. Salió el 16 de junio, queda en el rango de modelos abiertos de frontera, con licencia que permite uso comercial. Junto con Kimi K2.7 Code (Moonshot AI, 12 de junio) confirma que el pelotón abierto chino está empujando releases cada semana o dos, no cada trimestre. Si tu equipo todavía no tiene un proceso para evaluar nuevos pesos abiertos a medida que salen, vale armar uno: el ciclo se aceleró. (LLM Stats — GLM-5.2)

💡 Tip del día — Cuándo usar contexto largo (2M tokens), cuándo RAG, cuándo chunking

Con Gemini 3.5 Pro entrando a GA esta semana, la pregunta práctica es cuándo conviene aprovechar los 2 millones de tokens de contexto y cuándo conviene seguir con la arquitectura anterior. Una guía rápida basada en costo y caso de uso.

Contexto largo (2M tokens) tiene sentido cuando:

  1. La tarea requiere que el modelo vea el documento entero al mismo tiempo para responder bien. Ejemplo: encontrar contradicciones entre dos cláusulas en lados opuestos de un contrato de 400 páginas, o entender un repositorio de código donde la lógica relevante está distribuida en muchos archivos.

  2. El costo de armar y mantener un pipeline de RAG (chunking, embeddings, vector store, retrieval, re-ranking) supera al costo de enviar el documento completo en cada llamada. Para volúmenes pequeños (cientos de consultas al mes sobre documentos largos) ya no compensa armar la infraestructura.

  3. La aplicación es de baja frecuencia y alta sensibilidad a calidad: revisión legal, análisis financiero, auditoría técnica. Pagar más por llamada se justifica si baja el riesgo de pasar por alto algo importante.

RAG sigue siendo mejor cuando:

  1. La base de conocimiento total no cabe en 2M tokens (documentación de empresa con millones de páginas, o catálogo entero de papers).

  2. El volumen de consultas es alto y la latencia importa: una consulta sobre 2M de tokens va a tardar más y costar más que una consulta sobre los 4-8K tokens relevantes recuperados.

  3. Necesitas trazabilidad fina de qué documento concreto generó la respuesta, para audit trails o citación.

Chunking clásico (sin RAG) sigue vivo cuando:

  1. El procesamiento es secuencial y por lotes: resumir capítulo por capítulo de un libro, traducir documento por sección, analizar una pila de PDFs uno a uno.

  2. El presupuesto es muy ajustado y el caso de uso tolera procesamiento por partes con un paso final de síntesis.

Regla práctica: si tu documento promedio entra en 200.000 tokens (≈150.000 palabras, alrededor de 500 páginas), probablemente todavía conviene RAG por costo y latencia. Si pasa de 500.000 tokens y tu volumen de consultas es bajo, vale probar el contexto largo. Si pasa de 1M de tokens y las relaciones cruzadas entre partes del documento importan, los 2M de Gemini son la primera vez que esto es posible sin trampas.

Lo más importante: antes de migrar nada, corre el mismo caso de uso con las tres arquitecturas en diez ejemplos representativos, mide costo por consulta y calidad de respuesta, y decide con datos. La intuición sobre qué arquitectura "debería" ser mejor falla casi siempre cuando hay un cambio de orden de magnitud en la ventana de contexto.

Keep Reading