Multiverse Computing ha anunciado un hito tecnológico: todos sus modelos comprimidos con CompactifAI ya son compatibles con los procesadores Intel Xeon 6. Este avance permite que modelos de gran tamaño, como Llama 3.3 70B, se ejecuten de manera optimizada en CPUs, utilizando tecnologías como Intel AMX para maximizar la eficiencia energética y operativa.
Resultados clave de la optimización:
- Velocidad duplicada: En pruebas con Intel Xeon 6737P, el rendimiento (throughput) aumentó un 94.1% en comparación con el modelo original.
- Reducción de latencia: La respuesta del modelo fue un 48.6% más rápida para usuarios individuales, manteniendo mejoras constantes incluso con cargas de trabajo masivas de hasta 256 usuarios concurrentes.
- Menor huella digital: El tamaño del modelo en disco se redujo a la mitad, pasando de 130 GiB a solo 65 GiB, lo que facilita enormemente su almacenamiento y despliegue.
- Precisión preservada: A pesar de la drástica reducción de tamaño, los modelos retienen más del 97% de su precisión original, e incluso mostraron mejoras en benchmarks específicos como WinoGrande.
Esta integración está diseñada para el mundo real, siendo compatible con marcos de trabajo estándar como PyTorch y Hugging Face. Con esta solución, Multiverse Computing busca facilitar la adopción de IA avanzada en sectores exigentes como las finanzas y la salud, ofreciendo un camino escalable y sostenible hacia la producción.

