Acelerando la inferencia en Meta Llama 3 con NVIDIA

El último modelo de lenguaje de código abierto de Meta, creado con tecnología NVIDIA, está optimizado para ejecutarse en las GPU NVIDIA desde la nube y el centro de datos hasta el perímetro y el PC.

Acelerando la inferencia en Meta Llama 3 con NVIDIA

Optimizaciones en todas las plataformas de NVIDIA

NVIDIA ha anunciado optimizaciones en todas sus plataformas para acelerar Meta Llama 3, la última generación del gran modelo de lenguaje (LLM). El modelo abierto combinado con la computación acelerada por NVIDIA equipa a desarrolladores, investigadores y empresas para innovar de forma responsable en una amplia variedad de aplicaciones.

Entrenado en NVIDIA AI

Los ingenieros de Meta entrenaron Llama 3 en clusters de computación con 24.576 GPUs NVIDIA H100 Tensor Core, conectadas con redes RoCE y NVIDIA Quantum-2 InfiniBand. Con el apoyo de NVIDIA, Meta ha perfeccionado sus arquitecturas de red, software y modelos para su vanguardista LLM.

Puesta en funcionamiento de Llama 3

Las versiones de Llama 3, aceleradas en las GPU NVIDIA, están disponibles para su uso en la nube, el centro de datos, el perímetro y el PC. Desde un navegador, los desarrolladores pueden probar Llama 3 en ai.nvidia. Está empaquetado como un microservicio NVIDIA NIM con una interfaz de programación de aplicaciones estándar que puede implantarse en cualquier lugar.

Llevando Llama 3 a dispositivos y PCs

Llama 3 también se ejecuta en NVIDIA Jetson Orin para dispositivos de robótica y edge computing, lo que permite crear agentes interactivos como los del Jetson AI Lab. Además, las GPU NVIDIA RTX y GeForce RTX para estaciones de trabajo y PC aceleran la inferencia en Llama 3. Estos sistemas ofrecen a los desarrolladores un objetivo de más de 100 millones de sistemas acelerados por NVIDIA en todo el mundo.

Obtenga un rendimiento óptimo con Llama 3

Las mejores prácticas a la hora de desplegar un LLM para un chatbot implican equilibrar una baja latencia, una buena velocidad de lectura y una utilización óptima de la GPU para reducir costes. Aplicando estas métricas, una sola GPU NVIDIA H200 Tensor Core generó alrededor de 3.000 tokens/segundo – suficiente para atender a unos 300 usuarios simultáneos – en una prueba inicial utilizando la versión de Llama 3 con 70.000 millones de parámetros.

Avanzando en los modelos de comunidad

NVIDIA, que contribuye activamente al código abierto, está comprometida con la optimización del software comunitario que ayuda a los usuarios a afrontar sus retos más difíciles. Los modelos de código abierto también promueven la transparencia en la IA y permiten a los usuarios compartir ampliamente el trabajo sobre seguridad y resiliencia de la IA.

Related Post