Inference Brew

Los aceleradores de inferencia NVIDIA Groq 3 LPX entran en producción a gran escala

00:00 / --:--

← Volver al inicio

Los aceleradores de inferencia NVIDIA Groq 3 LPX entran en producción a gran escala

1. Los aceleradores de inferencia NVIDIA Groq 3 LPX entran en producción a gran escala

Basándose en los recientes resultados de pruebas que demostraron 3.400 tokens por segundo en Gemma 4 31B, NVIDIA ha entrado oficialmente en producción a gran escala para sus racks de aceleradores de inferencia Groq 3 LPX. Estos sistemas, que amplían la plataforma Vera Rubin, están diseñados para cargas de trabajo de IA agente de alta velocidad y su entrada en funcionamiento está programada para finales de este año.

  • • Los chips aceleradores de inferencia Groq 3 LPX de NVIDIA han entrado en producción a gran escala.
  • • Está previsto que los sistemas entren en funcionamiento a finales de este año.
  • • Las unidades de producción están diseñadas para mantener el rendimiento de 3.400 tokens/s observado en pruebas recientes para cargas de trabajo de IA agente.

La transición a la producción completa marca el paso de la fase de demostración a la disponibilidad comercial para los desarrolladores que buscan una inferencia de latencia ultrabaja.

SOURCES

2. IBM lanza la familia de modelos Granite 4.2 con razonamiento nativo

Construido sobre una arquitectura transformer densa solo de decodificador, el modelo Granite-4.2-30B utiliza Grouped Query Attention, Rotary Position Embedding y activación SwiGLU. Los modos de pensamiento flexibles permiten a los desarrolladores personalizar la profundidad de razonamiento del modelo por consulta, optimizando tanto el costo como la latencia.

  • • La familia Granite 4.2 incluye un modelo insignia de 30B, uno de tamaño medio de 8B y uno compacto de 3B, todos lanzados bajo la licencia Apache 2.0.
  • • Todos los modelos cuentan con razonamiento nativo de cadena de pensamiento para mejorar el rendimiento en problemas matemáticos, de codificación y de varios pasos.
  • • Los modelos admiten tres modos de pensamiento flexibles (pensamiento completo, sin pensamiento y bajo esfuerzo) para equilibrar la profundidad y la latencia.
  • • Toda la familia admite una ventana de contexto de 512K para documentos largos y flujos de trabajo de agentes.
  • • Los modelos utilizan llamadas a herramientas aumentadas por razonamiento para mejorar la precisión de las llamadas a funciones.

Los desarrolladores pueden alojar por sí mismos o integrar modelos de razonamiento altamente capaces y comercialmente amigables con modos de pensamiento flexibles para equilibrar la latencia y la profundidad.

SOURCES

3. Microsoft lanza MAI-Image-2.6-Preview con clasificaciones líderes en el mercado

El modelo admite tanto la generación de texto a imagen como capacidades de edición de imágenes. En categorías como Iluminación y Diseño UI/UX, MAI-Image-2.6-Preview y GPT Image 2 tienen un rendimiento muy similar, ofreciendo alternativas altamente competitivas para los desarrolladores.

  • • Microsoft anunció MAI-Image-2.6-Preview, que presenta mejoras en la representación de texto, imágenes 3D, calidad de retratos y resultados fotorrealistas.
  • • El modelo debutó en el puesto número 1 en la tabla de clasificación de edición de imágenes de Artificial Analysis, superando a MAI-Image-2.5-Pro, Reve 2.1 y GPT Image 2.
  • • En la categoría de texto a imagen, el modelo ocupa la segunda posición, detrás de GPT Image 2 de OpenAI.
  • • El modelo está disponible actualmente en MAI Playground y en vista previa privada en Microsoft Foundry.
  • • MAI-Image-2.6-Preview lidera 5 de las 19 tablas de clasificación por categorías, incluyendo Material, Conocimiento, Frontera, Venta minorista y comercio electrónico, y Marketing y publicidad.

Los desarrolladores que crean funciones de edición o generación de imágenes tienen una nueva opción de modelo de alto rendimiento para evaluar frente a GPT Image 2.

SOURCES

4. Breeze TTS 2 supera a Fish Audio S2 Pro en la tabla de clasificación de TTS de pesos abiertos

Tras el informe de pruebas de mayo de 2026, la Speech Arena de Artificial Analysis ha actualizado sus clasificaciones para incluir a Breeze TTS 2. El nuevo modelo lidera ahora la categoría de pesos abiertos con un Elo de 1.215, superando al líder anterior, Fish Audio S2 Pro, por 90 puntos. Aunque Breeze TTS 2 ofrece una generación de voz de alta calidad y soporte para 50 idiomas, sigue siendo más lento y costoso de alojar que el S2 Pro.

  • • Breeze TTS 2 es ahora el modelo de texto a voz de pesos abiertos líder en la arena de voz de proveedores de Artificial Analysis.
  • • Tiene un Elo de 1.215, clasificándose 90 puntos por encima del líder anterior, Fish Audio S2 Pro.
  • • El modelo admite 50 idiomas y está disponible en Hugging Face.
  • • Breeze TTS 2 procesa 45 caracteres por segundo a 34 dólares por cada millón de caracteres, en comparación con los 102 caracteres por segundo a 15 dólares por cada millón de caracteres de Fish Audio S2 Pro.

Los desarrolladores ahora tienen una nueva opción de pesos abiertos de alto rendimiento para funciones de voz, aunque deben sopesar su calidad superior frente a las compensaciones de rendimiento y costo en comparación con el líder anterior.

SOURCES

5. Qwen3.8-Flash-Next programado para su lanzamiento con altos requisitos de memoria

Las discusiones iniciales de la comunidad destacan que la arquitectura del modelo podría ser muy amigable para el uso local una vez que se publiquen los pesos, siempre que los desarrolladores tengan suficiente hardware. Unsloth ha aconsejado a los usuarios que preparen su espacio en disco antes del lanzamiento.

  • • Qwen3.8-Flash-Next está programado para ser lanzado mañana, con soporte desde el día 0 anunciado por Unsloth.
  • • El modelo tiene un requisito de memoria estimado de 80 a 90 GB para una cuantización real de 4 bits.
  • • La huella de memoria comprende aproximadamente 58 GB para los pesos principales y 24 GB para las tablas de n-gramas.
  • • La gran tabla de n-gramas del modelo se accede de forma dispersa, lo que lo convierte en un candidato para la descarga a la memoria RAM del sistema.

Los desarrolladores que planeen alojar este próximo modelo por sí mismos deberán preparar un espacio en disco sustancial y configuraciones de hardware con alta VRAM.

6. El modelo anónimo Ox Alpha rompe récords de lanzamiento en OpenRouter

A pesar de la falta de metadatos oficiales sobre su origen o entrenamiento, el modelo Ox Alpha ha visto una adopción masiva por parte de los desarrolladores debido a su punto final de API gratuito y compatible.

  • • Los usuarios de OpenCode procesaron 26 billones de tokens a través del modelo Ox Alpha durante sus primeros cuatro días de disponibilidad.
  • • El modelo registró más de 327.000 usuarios únicos y más de 8,3 millones de sesiones completadas.
  • • Ox Alpha está disponible actualmente de forma gratuita a través de un punto final compatible con OpenAI.
  • • La página del modelo en OpenCode no enumera los metadatos del creador, la fecha de lanzamiento, el límite de conocimiento o el límite de salida.

Los desarrolladores pueden integrar un punto final gratuito y compatible con OpenAI altamente popular en sus flujos de trabajo, aunque los metadatos sobre el modelo siguen siendo escasos.

SOURCES

7. Perplexity lanza una computadora portátil para la ejecución de agentes locales

Portable Computer integra un arnés de agentes, orquestador, planificador, enrutador de herramientas y modelos post-entrenados en una única aplicación empaquetada. Actualmente está disponible para usuarios de Linux con suscripciones Pro, Max o Enterprise, con soporte para Windows programado para septiembre. En el banco de trabajo de conocimiento local de 53 tareas de Perplexity, la plataforma obtuvo un 85,4% utilizando el modelo PPLX 27B, superando a los arneses de código abierto existentes como Pi y Hermes en comprensión de documentos e investigación web.

  • • Perplexity lanzó Portable Computer, una plataforma de agentes local primero que agrupa modelos locales, un arnés de agentes y un entorno de pruebas de seguridad.
  • • La plataforma se ejecuta en máquinas Linux con GPU Nvidia RTX o hardware DGX Spark que requiere al menos 24 GB de VRAM.
  • • Los modelos compatibles en el lanzamiento incluyen Qwen 3.8 27B y PPLX 27B, con el Nemotron 3.5 Lightning de Nvidia planeado para un futuro lanzamiento.
  • • La ejecución de código y herramientas ocurre dentro de un entorno de pruebas aplicado por el sistema operativo que restringe el acceso al sistema de archivos y a la red.
  • • Una función híbrida permite a los usuarios escalar tareas complejas a modelos de frontera basados en la nube como Claude Opus 5 después de una verificación de PII.

Los desarrolladores pueden ejecutar flujos de trabajo de agentes complejos localmente en su propio hardware sin incurrir en costos de nube por token, manteniendo los datos confidenciales seguros.

SOURCES

8. Headlong lanza un microarnés basado en Bash para agentes persistentes

El equipo del Instituto Laude ha estado probando un agente compartido llamado Audel utilizando este marco, demostrando capacidades como auditar ramas de git, revisar código y corregir errores automáticamente sin intervención humana. Headlong se lanza como software de investigación alfa en GitHub con un script de instalación de una línea, y se recomienda a los usuarios que lo ejecuten en un entorno de pruebas con claves de API con límite de gasto.

  • • Headlong es un microarnés de agentes de código abierto escrito en menos de 10.000 líneas de código Bash.
  • • A diferencia de los agentes reactivos, los agentes de Headlong generan pensamientos y proyectos de forma independiente sin entrada externa.
  • • El marco utiliza un algoritmo de compactación que resume progresivamente las entradas de trayectoria más antiguas para gestionar la memoria.
  • • La trayectoria del agente se almacena como un DAG de archivos JSONL, proporcionando un historial estructurado de pensamientos y acciones.
  • • Ejecutar un agente de Headlong continuamente cuesta entre 1 y 2 dólares por hora, dependiendo del modelo y la frecuencia.

Los desarrolladores pueden implementar agentes autónomos y autocorrectores que se ejecutan continuamente sin necesidad de activadores externos.

SOURCES

9. Anthropic fusiona los sistemas de memoria para Claude Chat y Claude Cowork

La función de memoria compartida ayuda a los usuarios a evitar repetir detalles del proyecto, preferencias y contexto. Claude no almacena temas confidenciales como salud, religión o política de forma predeterminada, y ciertas categorías como antecedentes penales y números de identificación nunca se almacenan.

  • • Anthropic fusionó los sistemas de memoria para Claude chat y Claude Cowork, permitiendo el intercambio de contexto bidireccional.
  • • Claude ahora agrega temas a la memoria dinámicamente durante las conversaciones en lugar de resumirlos después de las sesiones.
  • • Las funciones de memoria están habilitadas de forma predeterminada para los planes Free, Pro y Max en plataformas web, de escritorio y móviles.
  • • Para los usuarios de los niveles Enterprise y Teams, las funciones de memoria están deshabilitadas de forma predeterminada y sujetas a la elegibilidad organizacional.
  • • Los usuarios pueden administrar, ver, editar o eliminar temas almacenados a través de la sección Memoria en el menú Configuración.

Los desarrolladores que utilizan Claude y Cowork pueden mantener un contexto unificado en sus flujos de trabajo sin tener que informar repetidamente a la IA sobre los detalles del proyecto.

SOURCES

10. Keenable lanza un índice de búsqueda web optimizado para agentes de IA

Fundada por el ex ejecutivo de Yandex Andrey Styskin y el científico de IA Matthias Petri, Keenable tiene como objetivo optimizar la infraestructura de búsqueda específicamente para agentes de IA. La empresa emplea actualmente a 15 ingenieros en EE. UU. y Europa y planea duplicar su plantilla para finales de año.

  • • Keenable salió del modo sigiloso con 26 millones de dólares en financiación inicial liderada por Accel para construir infraestructura de búsqueda web para IA.
  • • La startup ha desarrollado un índice de búsqueda web que contiene más de 100 mil millones de documentos.
  • • La API de Keenable se utiliza actualmente en producción por varios laboratorios de IA y proveedores de inferencia, incluida la empresa de IA de voz Gradium.
  • • La empresa está desarrollando un lenguaje de consulta web patentado para ayudar a los sistemas de IA a sintetizar información de múltiples fuentes web.
  • • Keenable afirma ofrecer una solución más rentable para consultas de agentes mediante el ajuste fino de las estructuras de índice para tareas específicas.

Los desarrolladores que crean flujos de trabajo de búsqueda RAG o de agentes pueden acceder a una API de búsqueda altamente rentable y optimizada para tareas en lugar de los motores de búsqueda tradicionales.

SOURCES

11. Workflow lanza un lienzo de arrastrar y soltar para tuberías de IA

La herramienta simplifica el proceso de construcción y depuración de tuberías de IA al mantener visibles las salidas intermedias en cada nodo. Su integración perfecta con Spaces y la generación automática de API REST la convierten en una herramienta altamente productiva para la creación rápida de prototipos.

  • • Workflow cuenta con un lienzo de arrastrar y soltar para construir tuberías de IA.
  • • La plataforma permite que cada nodo en una tubería se ejecute de forma independiente mientras mantiene visibles las salidas intermedias.
  • • Workflow admite la implementación con un solo comando en Spaces.
  • • Todo el gráfico creado en el lienzo de Workflow funciona como una API REST.

Los desarrolladores pueden crear prototipos rápidamente e implementar gráficos de IA complejos en Spaces con un solo comando, exponiendo cada nodo como una API independiente.

SOURCES

12. Maiao permite solicitudes de extracción apiladas al estilo Gerrit para GitHub y GitLab

Maiao se integra con las funciones de apilamiento nativas en GitHub y GitLab cuando están disponibles, tratándolas como una mejora progresiva. También admite la configuración manual para instancias autohospedadas, lo que la hace altamente adaptable a varios flujos de trabajo de equipo.

  • • Maiao es una bifurcación mantenida por la comunidad de adevinta/maiao, ahora alojada en runetes/maiao.
  • • La herramienta permite solicitudes de extracción o fusión apiladas creando una PR/MR por confirmación en una rama con dependencias padre-hijo.
  • • Las características clave incluyen apilamiento automático, seguimiento de Change-ID a través de ganchos de git, rebase automático tras fusiones y soporte para git commit --fixup.
  • • Maiao detecta automáticamente los proveedores de git desde URL remotas y admite GitHub, GitLab, Gitea, Forgejo, Bitbucket Cloud y Cursor Origin.
  • • El proyecto es de código abierto y se distribuye bajo la licencia MIT.

Los desarrolladores pueden gestionar cambios de código complejos y dependientes de manera más eficiente apilando automáticamente confirmaciones individuales como solicitudes de extracción padre-hijo.

SOURCES

13. Liquid AI lanza la suite de evaluación comparativa en el dispositivo Pipette

Las métricas de calidad se evalúan en sistemas de referencia NVIDIA H100 y se comparan con los datos de rendimiento en el dispositivo. La metodología de prueba incluye formas de token fijas, decodificación codiciosa y verificación de condiciones térmicas/de carga, con resultados verificados iniciales publicados para dispositivos como el MacBook Pro con M5 Max y el iPhone 17 Pro.

  • • Liquid AI lanzó Pipette, una plataforma de código abierto para evaluar modelos fundamentales en dispositivos de borde.
  • • La plataforma se desarrolló en asociación con Artificial Analysis para proporcionar una validación de metodología independiente.
  • • Pipette mide el rendimiento en función de las configuraciones de implementación completas, incluido el modelo, la cuantización, el tiempo de ejecución y el dispositivo.
  • • El conjunto de datos de lanzamiento cubre más de 1.000 configuraciones en más de 30 modelos que abarcan macOS, iOS, Windows y Android.
  • • Pipette se lanza bajo la licencia Apache 2.0 e incluye un conjunto de datos de resultados públicos, un panel de control y aplicaciones de evaluación comparativa nativas.

Los desarrolladores que implementan modelos en dispositivos de borde pueden usar Pipette para obtener datos de rendimiento verificados e independientes en varias configuraciones de hardware y cuantización.

SOURCES

14. La llamada a herramientas programática especulativa optimiza la latencia recursiva de LLM

Al superponer la computación con el tiempo de ejecución, sPTC aborda los cuellos de botella de latencia en los flujos de trabajo de agentes. Es particularmente eficaz para sistemas que dependen de herramientas externas de alta latencia o generación de contexto recursivo.

  • • La llamada a herramientas programática especulativa (sPTC) optimiza los modelos de lenguaje recursivos mediante el lanzamiento previo de llamadas a herramientas durante la generación de tokens.
  • • El método funciona de manera similar a un compilador JIT, proporcionando una aceleración de tiempo de ejecución de 1 a 1,2 veces.
  • • sPTC reduce la latencia asociada con herramientas de alta latencia al permitir la ejecución paralela de llamadas a herramientas no bloqueantes.
  • • La técnica está diseñada para mejorar el rendimiento en LLM locales limitados por memoria y sistemas de servicio de alto volumen.

Los desarrolladores pueden reducir significativamente la latencia en los flujos de trabajo de modelos de lenguaje recursivos que dependen de herramientas externas de alta latencia.

SOURCES

15. La investigación de seguridad expone vulnerabilidades en las aplicaciones de cámara C2PA de Android

La aplicación Pixel Camera tiene el Nivel de Garantía 2, la calificación de seguridad más alta en el Programa de Conformidad C2PA. La investigación de Buchanan muestra que cualquier aplicación de Android conforme a C2PA que dependa de la atestación de claves o la integridad de Play es igualmente vulnerable, lo que significa que los desarrolladores no pueden confiar plenamente en las firmas C2PA de los dispositivos Android.

  • • El investigador David Buchanan demostró que las aplicaciones de cámara C2PA en Android no son seguras contra la manipulación debido a exploits de escalada de privilegios de root (LPE).
  • • Una vez que un dispositivo está rooteado, un atacante puede usar el StrongBox respaldado por hardware para firmar datos arbitrarios con claves C2PA usando una herramienta llamada 'keystork'.
  • • Los ataques de inyección de fallas de hardware pueden rootear dispositivos Android a nivel de hardware, haciendo que estas vulnerabilidades sean imposibles de parchear de manera realista.
  • • Los exploits LPE basados en software, como CVE-2026-43499, permiten el rooteo con un solo clic de dispositivos Google Pixel totalmente parcheados.
  • • Google cerró el informe de vulnerabilidad con un estado de 'No se solucionará (inviable)', pero otorgó una recompensa de 7.500 dólares.

Los desarrolladores que dependen de los metadatos C2PA para la autenticidad de la imagen deben tener en cuenta que los exploits de root a nivel de hardware y software pueden permitir a los atacantes falsificar firmas.

SOURCES

16. El análisis revela una discrepancia entre las clasificaciones de riesgo de LLM de expertos y los incidentes reales

El OWASP GenAI LLM Top 10 2026, publicado el 4 de agosto, pondera los votos de los profesionales en un 75% y los datos de incidentes en un 25%. El estudio sugiere que, si bien algunas categorías como el envenenamiento de memoria persistente y la explotación de la interfaz de herramientas MCP tienen registros de incidentes delgados, aún tienen calificaciones CVE altas y críticas, lo que convierte a las puertas de autorización externas en una defensa crucial.

  • • Un análisis en arXiv comparó las clasificaciones de riesgo de LLM de expertos con datos de incidentes del mundo real, sin encontrar un acuerdo estadísticamente detectable (kappa de Cohen de 0,20).
  • • La inyección de avisos está clasificada en el puesto número 1 por los expertos, pero solo en el número 12 en el registro de incidentes, probablemente debido a su invisibilidad para los escáneres estándar.
  • • La desinformación representa el mayor desacuerdo, clasificada en el puesto número 13 por los expertos, pero en el número 2 en incidentes reales.
  • • Steve Wilson recomienda implementar una puerta de autorización fuera del LLM para evitar que los agentes ejecuten cambios de infraestructura no autorizados.
  • • El Informe de Amenazas Globales 2026 de CrowdStrike documentó inyecciones de avisos maliciosas en más de 90 organizaciones en 2025.

Los desarrolladores pueden priorizar mejor sus esfuerzos de seguridad al comprender que los ataques invisibles como la inyección de avisos pueden estar subreportados en los registros de incidentes públicos.

SOURCES

17. SWE Refactor Bench evalúa agentes de codificación en migraciones de repositorio

El punto de referencia destaca las limitaciones actuales de los agentes de codificación cuando se enfrentan a migraciones de repositorio complejas y de varias etapas. La baja tasa de supervivencia indica que, si bien los agentes sobresalen en las ediciones locales, las migraciones de toda la pila siguen siendo un desafío importante.

  • • Einsia lanzó el SWE Refactor Bench para evaluar agentes de codificación en migraciones de pila de software de largo horizonte y todo el repositorio.
  • • El punto de referencia incluye 20 tareas de migración del mundo real en proyectos como SQLite, zlib, libsodium y GraphHopper.
  • • Las tareas prueban migraciones complejas, incluidas C a Rust, Maven a Gradle y POSIX a WebAssembly.
  • • De 520 ejecuciones totales, solo 28 pasaron las tres etapas, lo que representa una baja tasa de supervivencia del 5,4%.
  • • 13 de las 20 tareas incluidas en el punto de referencia no fueron resueltas por ninguno de los agentes probados.

Los desarrolladores pueden usar este punto de referencia para evaluar de manera realista qué tan bien manejan los agentes de codificación las tareas de migración de largo horizonte y varias etapas.

SOURCES

18. El punto de referencia evalúa las variantes de Qwen3.6-35B-A3B en la llamada a herramientas

El punto de referencia destaca que las variantes ajustadas como Ornith 1.5 y Tiel-Coder ofrecen mejoras significativas en la llamada a herramientas sobre el modelo base Qwen3.6-35B-A3B. Sin embargo, el modelo Qwen3.8-27B sigue siendo la opción superior para flujos de trabajo de agentes con uso intensivo de herramientas.

  • • Ornith 1.5 y Tiel-Coder fueron las variantes de Qwen3.6-35B-A3B con mejor rendimiento en un punto de referencia de llamada a herramientas utilizando tool-eval-bench 2.6.0.
  • • Ambas variantes principales obtuvieron una puntuación superior a Qwen3.6-27B pero inferior a Qwen3.8-27B, que logró la puntuación media más alta de 152,6 puntos.
  • • El Qwen3.6-35B-A3B original obtuvo la puntuación más baja entre los modelos probados con 131,5 puntos.
  • • El proceso de prueba involucró 65 ejecuciones en 13 archivos GGUF, utilizando más de 300 horas de tiempo de GPU en hardware V100 de 32 GB.
  • • Los modelos se ejecutaron utilizando llama.cpp versión 0.1.0-dev con una longitud de contexto de 262.144 y un 50% de presión de contexto.

Los desarrolladores que seleccionan modelos para tareas de llamada a herramientas pueden usar estos resultados de referencia para elegir las variantes ajustadas con mejor rendimiento.

SOURCES

19. Papers with Code detalla su arquitectura de motor de búsqueda híbrido

La infraestructura de búsqueda impulsa la función de artículos relacionados en el sitio web de Papers with Code. Al combinar pgvector con incrustaciones Qwen y herramientas de Hugging Face, la arquitectura demuestra una pila altamente práctica y amigable con el código abierto para la búsqueda en producción.

  • • El motor de búsqueda de Papers with Code está construido utilizando PostgreSQL con la extensión pgvector para la gestión de datos.
  • • El sistema utiliza el modelo Alibaba Qwen 3-Embedding-0.6B para generar incrustaciones.
  • • Las incrustaciones se calculan en una GPU NVIDIA L4 impulsada por Hugging Face Jobs.
  • • El motor de búsqueda implementa una búsqueda híbrida para lograr resultados de recuperación óptimos.
  • • Un punto final de incrustación en vivo se sirve a través de Hugging Face Inference Endpoints, con artefactos del sistema almacenados en Buckets.

Los desarrolladores pueden replicar esta pila de búsqueda híbrida probada y de grado de producción para sus propias aplicaciones de RAG y recuperación de documentos.

SOURCES

20. Apple anuncia Mac Studio con chips M5 Max y M5 Ultra

El Mac Studio funciona con macOS 27, que incluye Siri AI y Apple Intelligence. Introduce conectividad Wi-Fi 7, Bluetooth 6 y Thunderbolt 5. Los precios comienzan en 2.499 dólares para el modelo M5 Max y 5.499 dólares para el modelo M5 Ultra.

  • • Apple anunció el nuevo Mac Studio con chips M5 Max y M5 Ultra, con pedidos anticipados a partir del 25 de agosto de 2026 y disponibilidad general el 22 de septiembre de 2026.
  • • El modelo M5 Ultra admite hasta 512 GB de memoria unificada, una CPU de 36 núcleos y hasta una GPU de 80 núcleos.
  • • El modelo M5 Max comienza en 2.499 dólares e incluye una CPU de 18 núcleos, hasta una GPU de 40 núcleos y hasta 128 GB de memoria unificada.
  • • Se pueden agrupar varios sistemas Mac Studio utilizando Thunderbolt 5 para lograr un rendimiento de inferencia de IA hasta 3 veces más rápido.
  • • El nuevo Mac Studio proporciona un rendimiento de IA hasta 4,3 veces más rápido y un almacenamiento 2 veces más rápido en comparación con las generaciones anteriores.

Los desarrolladores pueden ejecutar LLM locales masivos y modelos MoE en una sola estación de trabajo utilizando hasta 512 GB de memoria unificada.

SOURCES

21. Apple presenta Mac mini con chips M6 y M5 Pro

El nuevo Mac mini funciona con macOS 27, introduciendo Siri AI y funciones ampliadas de Apple Intelligence. El modelo M5 Pro cuenta con puertos Thunderbolt 5, mientras que ambos modelos incluyen Wi-Fi 7, Bluetooth 6 y Ethernet de 2,5 Gb. El dispositivo está construido con un 50 por ciento de material reciclado, incluido un 100 por ciento de aluminio reciclado en la carcasa.

  • • Apple anunció el nuevo Mac mini con chips M6 y M5 Pro, con pedidos anticipados a partir del 25 de agosto de 2026 y disponibilidad general el 22 de septiembre de 2026.
  • • El Mac mini con M6 comienza en 899 dólares e incluye una CPU de 12 núcleos y una GPU de 12 núcleos con aceleradores neuronales en cada núcleo.
  • • El modelo M5 Pro comienza en 1.699 dólares y admite hasta 64 GB de memoria unificada con un ancho de banda de 307 GB/s.
  • • El Mac mini actualizado cuenta con un motor neuronal dual de 16 núcleos que ofrece un rendimiento hasta 2 veces más rápido que la generación anterior.
  • • El modelo base viene con 16 GB de memoria unificada estándar, configurable hasta 32 GB, con un ancho de banda de memoria de hasta 170 GB/s.

Los desarrolladores que ejecutan modelos locales obtienen una opción de escritorio altamente compacta y rentable con motores neuronales y ancho de banda de memoria significativamente mejorados.

SOURCES

22. NVIDIA presenta Jetson Orin Nano 2 para IA de borde y robótica

Empresas como Wing y Matic Robots ya están evaluando el Jetson Orin Nano 2 para drones y robótica doméstica. El hardware se integra con la pila de robótica de NVIDIA, que actualmente es utilizada por más de 3 millones de desarrolladores y 10.000 empresas en todo el mundo.

  • • NVIDIA presentó el Jetson Orin Nano 2, con 78 TOPS de cómputo de IA, 8 GB de memoria y una CPU Arm de ocho núcleos.
  • • El dispositivo duplica el rendimiento de inferencia del Jetson Orin Nano Super dentro del mismo factor de forma compacto.
  • • En modo de 15 vatios, el sistema consume un 40% menos de energía que su predecesor mientras ofrece un rendimiento máximo equivalente.
  • • El hardware admite de forma nativa modelos abiertos, incluidos NVIDIA Cosmos, Nemotron, Gemma 4 y Qwen 3.
  • • NVIDIA planea hacer que el módulo y el kit de desarrollador estén disponibles en la primera mitad de 2027.

Los desarrolladores que crean aplicaciones de IA de borde, drones o robótica pueden implementar modelos abiertos más grandes localmente en un módulo de hardware altamente eficiente y compacto.

SOURCES

23. La bifurcación de Llama.cpp introduce especulación adaptativa para una inferencia más rápida

Al ajustar dinámicamente las sugerencias de tokens, la función de especulación adaptativa optimiza el rendimiento del motor de inferencia sobre la marcha. Esto proporciona una aceleración sustancial para los desarrolladores que ejecutan LLM locales en hardware de consumo.

  • • Una nueva bifurcación de Llama.cpp introduce la especulación adaptativa para optimizar el rendimiento de modelos como Qwen3.8.
  • • La especulación adaptativa ajusta automáticamente los valores mínimos y máximos de sugerencia de tokens según el tipo de contenido.
  • • La función mejora las velocidades de generación de tokens hasta en un 50% en comparación con el Llama.cpp principal.
  • • En un sistema Strix Halo, la implementación aumentó la velocidad de generación de 44 t/s a 65 t/s para contenido estructurado.

Los desarrolladores que ejecutan modelos locales pueden lograr velocidades de inferencia significativamente más rápidas, especialmente para contenido estructurado, sin actualizar su hardware.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.