Por: Karin Eibschitz Segal
El debate sobre las CPUs para la IA Agente se ha vuelto demasiado estrecho. Gran parte de la conversación del sector se centra en el rendimiento de un solo hilo, la densidad de núcleos y el rendimiento del rack. Las tres son importantes. Pero ninguno responde por sí solo a la pregunta que finalmente tienen los clientes: ¿Cuánto trabajo útil de agente puede completar mi infraestructura de forma fiable dentro de los límites de latencia, coste y consumo que requiere mi empresa?
El recuento de núcleos indica a los clientes cuánta capacidad de cómputo se destina a un sistema. La IA agente requiere medir cuán eficazmente el sistema convierte esa capacidad en trabajo terminado.
La concurrencia cambia la respuesta
Un único bucle de agente hace que el rendimiento parezca sencillo: termina cada paso más rápido y el flujo de trabajo avanza más rápido. Los sistemas de producción ejecutan muchos agentes a la vez, compitiendo por CPU, memoria, E/S y recursos de aceleradores. Bajo esa carga, el cuello de botella cambia.
En un análisis público reciente que utilizó 739 conversaciones anonimizadas en Claude Code—flujos de trabajo de agentes codificadores que implican razonamiento de varios turnos, generación de código y uso de herramientas—el procesamiento y el tiempo de espera en el lado de la CPU aumentaron de menos del 1% de la latencia total para una sola petición a hasta un 15% en 32 solicitudes concurrentes. La mayor parte de ese aumento vino de la programación y la colocación en cola, no de la computación.
Un núcleo más rápido puede ejecutar el trabajo más rápido. No puede hacer desaparecer una cola.
La espera también llega a la parte más cara del sistema. Para los agentes de ejecución de código, la misma investigación estima que las GPUs realizan un trabajo útil solo durante el 50% al 60% del tiempo de reloj de pared. Cuando un agente espera una base de datos, un sistema de recuperación o un sandbox, la GPU también espera. La Ley de Amdahl sigue vigente:
«El acelerador más caro es el que espera al resto del sistema.»
Agentes entregados por medida, no capacidad teórica
Intel propone una medida más útil: agentes entregados por rack: los flujos de trabajo de agentes que un rack puede completar de forma fiable con el rendimiento, calidad y latencia requeridos, dentro de un límite definido de consumo y costes.
Una forma de entender la capacidad entregada es:
Agentes entregados por rack = Agentes teóricos por rack × Eficiencia de enrutamiento × Balance de recursos × eficiencia de descarga
La capacidad teórica refleja el cálculo, memoria y ancho de banda disponibles del rack. La eficiencia del enrutamiento refleja la calidad de la colocación del trabajo. El equilibrio de recursos captura las pérdidas por cuellos de botella y colas. La eficiencia de descarga refleja la capacidad recuperada al trasladar las tareas de infraestructura lejos de los núcleos de uso general. El documento técnico adjunto define estos factores y la metodología con mayor detalle.
El verdadero límite es cuando añadir agentes lleva la latencia más allá del objetivo del cliente, no la cima de un gráfico teórico de rendimiento.
Intel está diseñado para todo el flujo de trabajo
Intel no está eligiendo entre núcleos rápidos y más núcleos. Estamos construyendo el sistema que convierte ambos en trabajos terminados.
Mantén el estado disponible. El ancho de banda mantiene a un agente en movimiento; La capacidad evita que vuelva a empezar. El Modo de Memoria Plana Intel Xeon 6 combina memoria conectada a CXL y DDR5 nativa en un solo espacio de direcciones. En una evaluación conjunta de Intel y SAP, ofreció el 96% del rendimiento totalmente DDR5 con aproximadamente un 25% menos de coste total de propiedad de memoria, una vía práctica para mantener más sesiones calientes a menor coste.
Devuelve la capacidad al sistema. La tecnología Intel QuickAssist, el Data Streaming Accelerator y el In-Memory Analytics Accelerator (Intel® IAA) descargan trabajos de infraestructura que de otro modo consumirían núcleos de propósito general. El trabajo publicado usando Intel IAA para compresión de instantáneas ofrecía completaciones de instantáneas aproximadamente 1,2 veces más rápidas. La descarga no es una lista de comprobación de características; es la capacidad devuelta al cliente.
Adapta el recurso al trabajo. La orquestación, la ejecución de herramientas, los servicios de datos y el movimiento de estados tienen necesidades diferentes. El portafolio Xeon abarca un alto rendimiento por hilo P-core y un rendimiento denso de núcleo E en una arquitectura común, permitiendo al sistema situar cada fase en el perfil de ejecución adecuado.
No dejes el acelerador en marcha. Por supuesto, las empresas necesitarán GPUs optimizadas para agentes tanto como CPUs, e Intel está preparando su GPU Crescent Island para cumplir exactamente ese papel. Pero si la GPU siguiera esperando, sigue siendo solo una pieza cara de potencia de bastidor que quema silicio. Por eso esta discusión sobre la CPU sigue siendo importante. Xeon es el controlador de tráfico del sistema agente, manteniendo las sesiones en movimiento, las herramientas en ejecución, el flujo de datos y los aceleradores alimentados.»
Un marcador más útil
Cada afirmación de rendimiento de IA agente—incluida la de Intel—debería indicar la concurrencia, el objetivo de latencia y las pérdidas entre la capacidad teórica y la entregada. Sin esos, un resultado describe potencial, no capacidad de producción.
Intel pretende informar agentes por rack a un objetivo de latencia p99 declarado sobre trazas agenticas reales, junto con la eficiencia del enrutamiento, las ganancias de la descarga de función fija, la eficiencia del host en sistemas conectados a GPU y los agentes por vatio bajo una restricción de potencia definida en el rack.
El rendimiento en un solo hilo importa. La densidad del núcleo importa. Pero el sistema que gane será el que mantenga cada hilo alimentado, cada sesión caliente y cada acelerador productivo.
La industria ya ha dedicado suficiente tiempo a contar lo que va en la estantería. Es hora de medir lo que sale.
Para más información, el whitepaper de Intel, Cuántos agentes ejecutará realmente tu rack, explora esta idea con mayor profundidad, exponiendo el marco técnico, los datos de apoyo y consideraciones prácticas detrás de los «agentes entregados por rack» — y cómo las organizaciones pueden aplicarlo para evaluar el rendimiento real del sistema.

