El Ciclo | Tecnología, Negocios, Finanzas y Salud

Inferencia ultrarrápida: qué cambia con Cerebras y Gimlet

Escrito por Tomás | 9/29/26, 10:08 AM

Una respuesta de inteligencia artificial puede aparecer muy rápido en pantalla y, aun así, llegar tarde para la tarea que debía resolver. Antes de generar texto, el sistema recibe instrucciones, procesa información y puede esperar recursos disponibles. Después, quizá deba consultar una herramienta o guardar un resultado.

Esa diferencia ayuda a leer el anuncio de Cerebras y Gimlet Labs sobre inferencia ultrarrápida. La velocidad de generación importa, especialmente cuando una aplicación encadena varias llamadas al modelo. Para evaluar su utilidad, hace falta mirar también cuánto tarda el servicio completo y qué calidad entrega.

El anuncio y lo que todavía está por desplegarse

En su comunicado del 28 de septiembre de 2026, las compañías anunciaron una colaboración para integrar el cómputo de Cerebras con Gimlet Cloud. Planean alcanzar hasta 3.000 tokens por segundo y abrir el primer centro de datos de Gimlet con Cerebras más adelante en 2026.

La propuesta combina el motor de cómputo a escala de oblea de Cerebras con unidades de procesamiento gráfico (GPU), asignando fases de ejecución al hardware adecuado. El anuncio identifica a Gimlet como socio de lanzamiento de CS-4 y señala que ya existen despliegues privados de una solución integrada.

La cifra es una meta comunicada por los proveedores. No constituye una prueba independiente de rendimiento para todos los modelos, tamaños de entrada o volúmenes de usuarios. Tampoco permite tratar la futura disponibilidad general como un servicio ya desplegado.

Leer la entrada y generar la salida son trabajos diferentes

La inferencia es el uso de un modelo entrenado para obtener una respuesta o predicción. En los modelos de lenguaje, el texto se procesa en unidades llamadas tokens, que pueden representar palabras o fragmentos. Por eso, tokens por segundo no equivale directamente a palabras por segundo.

Primero se procesa la entrada: las instrucciones, el historial y los documentos incorporados a la solicitud. Esa fase se conoce como prefill. Después se genera la salida de manera progresiva, en la fase de decodificación o decode.

La explicación técnica de NVIDIA sobre estas fases muestra que utilizan los recursos de forma distinta. Procesar una entrada extensa puede competir con la generación de respuestas que ya están en curso. Dividir y coordinar el trabajo es una de las maneras de administrar esa tensión.

Una analogía ayuda: en un taller, preparar los materiales y ensamblar cada pieza requieren operaciones diferentes. Usar estaciones especializadas puede mejorar el flujo, siempre que el traslado entre ellas no introduzca una demora excesiva. En la infraestructura de IA, esa coordinación ocurre mediante software, memoria y conexiones entre sistemas.

Cuatro medidas para entender la velocidad

La documentación de métricas de NVIDIA distingue la espera inicial, la cadencia de generación y el tiempo de la respuesta completa. También separa la producción total del sistema de la experiencia de una solicitud individual.

MedidaQué permite observarPregunta práctica
Tiempo hasta el primer tokenEspera antes de recibir el primer contenido.¿Cuánto tarda la aplicación en empezar a responder?
Tiempo entre tokensCadencia de la salida una vez iniciada.¿La respuesta avanza de forma fluida?
Tiempo total de respuestaDuración desde la solicitud hasta completar la salida.¿Cuándo queda disponible el resultado completo?
Producción agregadaVolumen generado para solicitudes simultáneas.¿Cuánta demanda puede atender el sistema?

La tabla traduce métricas técnicas a preguntas de evaluación; no representa resultados medidos del servicio anunciado. Una plataforma puede procesar muchas solicitudes en conjunto mientras cada persona espera más. La comparación necesita precisar qué mide la cifra publicada.

En una prueba conviene registrar además los casos lentos. La guía de evaluación con AIPerf muestra resultados por percentiles y variaciones de carga. El percentil 95, por ejemplo, indica el tiempo dentro del cual termina el 95 % de las observaciones; el resto tarda más. Ayuda a ver demoras que un promedio puede disimular.

Un agente acumula esperas en cada paso

Consideremos un ejemplo hipotético: un asistente revisa una solicitud de compra, consulta inventario, compara alternativas y prepara una respuesta. Puede necesitar varias llamadas al modelo intercaladas con herramientas. Si cada generación se acelera, parte del proceso mejora; la consulta al inventario conserva su propia duración.

Supongamos, solo para ilustrar el cálculo, que las llamadas al modelo suman seis segundos y las demás operaciones suman cuatro. Reducir a la mitad el primer componente deja un total de siete segundos: una mejora del 30 %, no del 50 %. El cálculo supone pasos consecutivos y ninguna otra variación; no es una medición de Cerebras ni de Gimlet.

Ese ejemplo permite decidir dónde investigar. Si el principal retraso está en una base de datos, cambiar el servicio de generación tendrá un efecto limitado. Si el agente genera grandes cantidades de texto en numerosos pasos, la velocidad del modelo puede pesar más. Medir cada etapa evita comprar una mejora que el usuario apenas percibirá.

El contexto general de estas capas está desarrollado en el artículo de El Ciclo sobre modelos, chips y centros de datos en la infraestructura de IA. Aquí el criterio es más específico: identificar qué parte del recorrido consume el tiempo.

Cómo evaluar una oferta de inferencia ultrarrápida

Para una empresa que desarrolla aplicaciones, la prueba debería empezar con una tarea representativa. Una demostración con una instrucción breve dice poco sobre un servicio que deberá leer expedientes largos o atender muchas consultas simultáneas.

Una evaluación práctica puede seguir esta secuencia:

  1. Definir qué resultado se considera correcto y cuánto puede esperar el usuario.
  2. Reunir entradas representativas, incluyendo casos extensos y solicitudes difíciles.
  3. Comparar el servicio actual y la alternativa con condiciones equivalentes y distintos niveles de demanda.
  4. Registrar tiempos, respuestas fallidas, reintentos y costo total de las tareas completadas.
  5. Revisar qué parte de la mejora llega al usuario antes de ampliar el despliegue.

Si cambia el modelo, también debe comprobarse la calidad: una respuesta más rápida que omite información importante no cumple la misma tarea. Si cambia el proveedor, conviene verificar modelos disponibles, condiciones de acceso, ubicación del procesamiento y comportamiento ante interrupciones.

El criterio económico útil es el costo por tarea completada correctamente. Un precio atractivo por unidad de texto puede perder valor si aumentan los reintentos o si una integración exige más trabajo. Esa revisión conecta el rendimiento con una decisión de producto concreta, como ofrecer una conversación fluida o completar un análisis dentro de un plazo.

Preguntas frecuentes

¿Qué es la inferencia en inteligencia artificial?

Es la ejecución de un modelo ya entrenado para producir una respuesta o predicción. En una aplicación de lenguaje incluye procesar la entrada y generar la salida.

¿Qué anunciaron Cerebras y Gimlet Labs?

Una colaboración para combinar cómputo de Cerebras y GPU en Gimlet Cloud, con una meta de hasta 3.000 tokens por segundo. El primer centro de datos de Gimlet con Cerebras está previsto para más adelante en 2026.

¿Más tokens por segundo significan menos espera?

Pueden reducir el tiempo de generación, pero la espera también depende de las colas, la red, el procesamiento inicial y las herramientas externas. Conviene medir la tarea completa.

¿Cómo comparar dos servicios de inferencia?

Con el mismo modelo o un nivel de calidad comparable, entradas representativas y una carga similar. Hay que contrastar el tiempo de respuesta, los errores, la capacidad y el costo por tarea completada correctamente.

La Tesis de El Ciclo

Nuestra interpretación es que la infraestructura de IA tenderá a evaluarse por su capacidad de coordinar trabajos distintos. Mezclar arquitecturas puede abrir oportunidades, pero exige demostrar que la especialización compensa la complejidad añadida.

Para quien construye una aplicación, la señal decisiva será cuánto mejora una tarea real bajo demanda real. La velocidad anunciada sirve para formular una hipótesis de producto; la experiencia medida permite decidir si merece convertirse en una inversión.