Inference Brew

Moonshot AI lanza el modelo de pesos abiertos Kimi K3

00:00 / --:--

Las noticias de hoy que los desarrolladores de IA no deben perderse.

5 minutos al día, solo lo esencial de forma concisa. Escucha los resúmenes de audio en tu trayecto.

Resumen de hoy

Ver todo →

1. Moonshot AI lanza el modelo de pesos abiertos Kimi K3

Moonshot AI ha cumplido su promesa del 16 de julio al hacer públicos los pesos del modelo Kimi K3 en Hugging Face. El modelo de mezcla de expertos (MoE) de 2.8 billones de parámetros, que cuenta con una ventana de contexto de 1 millón de tokens y capacidades de visión nativas, ya está disponible para su implementación. Debido a su entrenamiento consciente de la cuantización en MXFP4, la descarga de los pesos del modelo es de aproximadamente 1.4 TB, lo que requiere recursos de hardware significativos, como configuraciones de múltiples nodos H200 o B300 para su ejecución.

  • Moonshot AI ha lanzado oficialmente los pesos de Kimi K3 en Hugging Face, tras el anuncio del 16 de julio.
  • El modelo es una arquitectura MoE de 2.8 billones de parámetros con 896 expertos y 16 expertos activos por token.
  • Admite una ventana de contexto de 1 millón de tokens y capacidades de visión nativas.
  • El tamaño de descarga de 1.4 TB (cuantización MXFP4) requiere una infraestructura significativa, como configuraciones de 8x H200 o 8x B300 en múltiples nodos.

Los desarrolladores ahora pueden acceder e implementar el modelo de frontera Kimi K3, aunque su enorme tamaño de 1.4 TB requiere hardware de gama alta y múltiples nodos para su operación local.

2. El modelo de lenguaje Celeris-1 afirma tiempos de respuesta 15 veces más rápidos

Celeris-1 introduce un enfoque novedoso para la inferencia de LLM de baja latencia mediante el uso de una arquitectura basada en difusión. Este diseño permite que el modelo de propósito general ofrezca una inteligencia cercana al nivel de GPT-5 mientras opera a velocidades hasta 15 veces más rápidas que los modelos autorregresivos tradicionales. Con una latencia de respuesta p50 de 157 ms y un rendimiento de 1,280 tokens por segundo, Celeris-1 es altamente adecuado para interfaces conversacionales en tiempo real y bucles de agentes rápidos.

  • Celeris-1 es un modelo de lenguaje de propósito general que afirma tener una inteligencia cercana al nivel de GPT-5.
  • El modelo presenta tiempos de respuesta 15 veces más rápidos en comparación con los modelos estándar, utilizando una nueva arquitectura de inferencia basada en difusión.
  • Logra una latencia de respuesta p50 de 157 ms.
  • Celeris-1 admite un rendimiento ultra alto de 1,280 tokens por segundo.

Los desarrolladores pueden crear aplicaciones altamente interactivas en tiempo real utilizando un modelo que admite un rendimiento de 1,280 tokens por segundo.

SOURCES

3. NVIDIA expande la línea de video SANA con el lanzamiento de la versión 2.0

Basándose en el modelo mundial SANA-WM lanzado en mayo de 2026, NVIDIA ha introducido SANA-Video 2.0. Mientras que el anterior SANA-WM se centraba en la generación de largo horizonte utilizando Gated DeltaNet, el nuevo lanzamiento 2.0 cambia a una arquitectura de atención lineal y softmax periódica. Estos modelos de 5B y 14B parámetros están diseñados para mantener una salida de alta resolución de 720p en hardware de una sola GPU, proporcionando a los desarrolladores un nuevo conjunto de herramientas para la generación de video de larga duración.

  • NVIDIA lanzó SANA-Video 2.0, con modelos de 5B y 14B parámetros.
  • La nueva arquitectura utiliza atención lineal y capas softmax periódicas, distintas del Gated DeltaNet utilizado en el SANA-WM anterior.
  • Los modelos admiten la generación de video en 720p en una sola GPU.
  • Este lanzamiento expande el ecosistema SANA tras el lanzamiento en mayo de 2026 del modelo mundial SANA-WM.

Este lanzamiento proporciona a los desarrolladores modelos más grandes y capaces en la familia SANA, ofreciendo una arquitectura alternativa para la generación de video de alta resolución en comparación con el SANA-WM lanzado anteriormente.

SOURCES

4. Baseten lanza la API optimizada 'Fast' para GLM-5.2

Basándose en la disponibilidad existente de GLM-5.2, Baseten ha desplegado una nueva variante de API 'Fast' específicamente optimizada para tareas de codificación y agentes sensibles a la latencia. Esta actualización duplica el rendimiento del modelo en comparación con sus velocidades iniciales del día de lanzamiento, alcanzando ahora picos de rendimiento de 280 tokens por segundo y un promedio de 100 tokens por segundo. La compañía también anunció planes para mejorar aún más el rendimiento a través de futuras actualizaciones de decodificación especulativa.

  • La nueva API 'Fast' de Baseten para GLM-5.2 ofrece velocidades máximas de 280 tokens por segundo.
  • La actualización duplica el rendimiento del modelo en comparación con su lanzamiento inicial de API.
  • La variante está ajustada específicamente para reducir la latencia para asistentes de codificación y flujos de trabajo basados en agentes.
  • Baseten planea integrar más ganancias de rendimiento a través de futuras actualizaciones del algoritmo de decodificación especulativa.

Esta optimización proporciona a los desarrolladores una ruta de inferencia más rápida para GLM-5.2, abordando los requisitos de latencia para asistentes de codificación interactivos y agentes.

SOURCES

5. Feyn publica el código abierto del modelo FeyNoBg y la biblioteca de entrenamiento NoBg

Feyn ha introducido una potente solución de código abierto para el preprocesamiento de imágenes con el lanzamiento de FeyNoBg y su biblioteca de Python NoBg adjunta. FeyNoBg es un modelo automático de eliminación de fondo que ofrece un rendimiento de vanguardia, superando a los modelos existentes en varios puntos de referencia. Para facilitar el entrenamiento personalizado, la biblioteca de código abierto NoBg proporciona una interfaz unificada de Python que maneja todo el proceso, desde el preprocesamiento hasta la evaluación, centrándose actualmente en la arquitectura BiRefNet. Esto permite a los desarrolladores integrar fácilmente el matting de imágenes de alta calidad directamente en sus flujos de trabajo locales.

  • Feyn lanzó FeyNoBg, un modelo automático de eliminación de fondo entrenado en 26.1K ejemplos diversos en 10 conjuntos de datos.
  • El modelo logra las mejores puntuaciones en cuatro de los ocho puntos de referencia y se desempeña dentro del 2% del líder en los cuatro restantes.
  • Feyn publicó el código abierto de NoBg, una biblioteca de Python diseñada para preprocesar, entrenar y evaluar modelos de matting de imágenes.
  • El proceso de entrenamiento para FeyNoBg implicó expandir la tercera etapa del extractor de características BiRefNet de 18 a 24 bloques mientras se conservaban los pesos preentrenados.
  • NoBg actualmente admite la arquitectura BiRefNet, con planes de agregar más arquitecturas en el futuro.

Los desarrolladores pueden alojar por sí mismos un modelo de eliminación de fondo de vanguardia y entrenar fácilmente tuberías personalizadas de matting de imágenes.

SOURCES

6. Campaña de ransomware ENCFORGE ataca instancias de Langflow

Basándose en revelaciones anteriores de vulnerabilidades críticas en Langflow, ha surgido una nueva amenaza. El grupo de actores de amenazas JADEPUFFER está explotando activamente CVE-2025-3248, una falla de falta de autenticación, para desplegar el ransomware ENCFORGE. Esta campaña, observada en julio de 2026, apunta y destruye específicamente archivos de modelos PyTorch, TensorFlow y GGUF. Con CISA añadiendo ahora múltiples vulnerabilidades de Langflow a su catálogo de Vulnerabilidades Explotadas Conocidas (KEV), el riesgo para las instancias expuestas ha escalado de acceso no autorizado a ataques de ransomware destructivos.

  • El grupo de amenazas JADEPUFFER lanzó campañas el 1 y 20 de julio dirigidas a servidores Langflow expuestos a Internet.
  • Los ataques explotan CVE-2025-3248, una vulnerabilidad de falta de autenticación que permite la ejecución remota de Python.
  • El ransomware ENCFORGE se está utilizando para cifrar y destruir archivos de modelos PyTorch, TensorFlow y GGUF.
  • CISA ha añadido múltiples vulnerabilidades de Langflow, incluida CVE-2025-3248, a su catálogo de Vulnerabilidades Explotadas Conocidas (KEV).
  • Los equipos de seguridad deben actualizar Langflow, restringir el acceso al socket de Docker y mantener copias de seguridad inmutables de los pesos de los modelos.

La amenaza a las implementaciones de Langflow ha escalado de la exposición general a vulnerabilidades a ataques de ransomware activos y destructivos, lo que requiere parches inmediatos y una mayor seguridad para los artefactos de los modelos.

SOURCES

7. Chats y artefactos compartidos de Claude expuestos en índices de motores de búsqueda

Se identificó una exposición de seguridad en la función 'compartir chat' de Anthropic Claude, que permite a los usuarios generar enlaces públicos a conversaciones y artefactos interactivos. Debido a que Anthropic confiaba en robots.txt en lugar de implementar etiquetas 'noindex' en las páginas compartidas, los principales motores de búsqueda como Google y Bing indexaron estas URL, haciendo que las conversaciones privadas de los usuarios y los documentos comerciales fueran públicamente buscables. Aunque no hay evidencia de acceso no autorizado a cuentas, el incidente destaca las limitaciones de robots.txt para la privacidad y subraya la necesidad de que las organizaciones traten los enlaces de IA compartidos con la misma gobernanza que otro software de colaboración.

  • Se descubrió que las conversaciones y artefactos interactivos compartidos de Claude estaban indexados y eran buscables en Google y Bing.
  • La exposición ocurrió porque Anthropic confiaba en un archivo robots.txt, que los motores de búsqueda no respetan como una directiva para evitar la indexación si una página está vinculada en otro lugar.
  • Una revisión confirmó que las páginas de chat compartidas de Claude carecían de la etiqueta meta 'noindex' recomendada por los motores de búsqueda para evitar la indexación.
  • El contenido expuesto incluía datos confidenciales de los usuarios, como consejos políticos, ética legal y documentos comerciales.
  • Anthropic ha comenzado a eliminar o hacer que los resultados de búsqueda indexados sean más difíciles de encontrar, pero recomienda que las empresas auditen el contenido compartido.

Los desarrolladores y equipos deben auditar sus enlaces compartidos de Claude y tratar las plataformas de colaboración de IA con una estricta gobernanza de datos para evitar la exposición de datos confidenciales.

8. Moonshot AI publica el código abierto de AgentENV para el aprendizaje por refuerzo de agentes escalables

AgentENV es una plataforma distribuida diseñada para ejecutar entornos de aprendizaje por refuerzo de agentes a escala, que se utilizó para entrenar el modelo Kimi K3 de 2.8 billones de parámetros de Moonshot. Al aprovechar las microVMs Firecracker, AgentENV logra un aislamiento a nivel de kernel sin sacrificar la velocidad de los sandboxes basados en contenedores. La plataforma admite una gestión de estado avanzada, incluida la pausa en menos de 100 ms y el arranque o reanudación desde instantáneas en menos de 50 ms. También permite que un sandbox en ejecución se bifurque en hasta 16 sandboxes secundarios independientes en un solo nodo, lo que permite despliegues paralelos eficientes desde un solo estado de tarea.

  • Moonshot AI y kvcache-ai publicaron el código abierto de AgentENV bajo la licencia MIT.
  • La plataforma utiliza microVMs Firecracker para proporcionar aislamiento a nivel de kernel para los sandboxes de agentes.
  • Admite instantáneas, pausa, reanudación y bifurcación, con tiempos de arranque y reanudación inferiores a 50 ms.
  • Un solo sandbox en ejecución puede bifurcarse en hasta 16 sandboxes secundarios independientes en el mismo nodo para despliegues paralelos.
  • AgentENV proporciona una API HTTP compatible con E2B, lo que permite que los SDK de Python y TypeScript de E2B existentes funcionen sin cambios en el código.

Los desarrolladores pueden ejecutar entornos de agentes seguros y aislados con tiempos de arranque inferiores a 50 ms y compatibilidad nativa con el SDK de E2B.

SOURCES

9. Perplexity lanza la CLI oficial para su API de búsqueda

Basándose en la API de Agentes y el SDK de Búsqueda como Código lanzados anteriormente, Perplexity ha introducido pplx, una herramienta de línea de comandos de binario único. Esta CLI proporciona una interfaz directa para que los desarrolladores realicen búsquedas web en vivo y obtengan texto de página limpio, lo que permite una integración más fácil de la pila de búsqueda de Perplexity en agentes de codificación basados en terminal y tuberías automatizadas.

  • Perplexity lanzó pplx, un cliente de línea de comandos oficial de binario único para su API de Búsqueda.
  • La herramienta está diseñada para humanos y agentes de codificación, ofreciendo comandos de búsqueda y obtención.
  • Genera datos estructurados en formato JSON, utilizando códigos de salida estándar.
  • La instalación se realiza a través de un script de shell que instala un binario único en ~/.local/bin en macOS y Linux.
  • La herramienta incluye funciones de presupuestación de tokens para truncar cadenas largas y admite entornos que no son TTY.

Los desarrolladores ahora pueden equipar más fácilmente a sus agentes de codificación y flujos de trabajo de terminal con búsqueda web en tiempo real y extracción de texto similar a markdown utilizando una CLI oficial.

SOURCES

10. OpenRouter introduce clasificadores en versión beta para el etiquetado de inferencia

La nueva función de clasificadores de OpenRouter proporciona a los desarrolladores una observabilidad granular sobre el uso de su API de LLM. Actualmente en versión beta, los clasificadores permiten a los equipos adjuntar etiquetas de metadatos a sus solicitudes de inferencia. Esto permite a los desarrolladores categorizar las llamadas a la API por dimensiones específicas, como el tipo de tarea, el departamento o la complejidad del agente, lo que facilita el seguimiento de costos, el análisis del rendimiento y la depuración de sistemas multi-agente.

  • OpenRouter lanzó clasificadores, una nueva función actualmente en versión beta.
  • La función permite a los desarrolladores etiquetar y categorizar la actividad de inferencia dentro de sus espacios de trabajo.
  • Los desarrolladores pueden organizar las llamadas a la API por tipo de tarea, departamento, complejidad del agente o criterios personalizados.

Los desarrolladores pueden monitorear, analizar y asignar mejor los costos de LLM etiquetando las llamadas a la API por tarea, departamento o complejidad del agente.

SOURCES

11. El rendimiento del motor de inferencia Ninfer aumenta a 720 t/s en la RTX 5090

Basándose en su lanzamiento inicial, el motor de inferencia de código abierto Ninfer ha logrado un aumento significativo en el rendimiento, entregando ahora hasta 720 tokens por segundo en la NVIDIA RTX 5090. Esta actualización mejora el punto de referencia de 542 t/s reportado el 20 de julio, optimizando aún más el motor para los modelos Qwen3.6 27B y 35B con ventanas de contexto completas de 250k. El motor sigue estando disponible en GitHub con soporte tanto para Linux como para Windows.

  • El rendimiento de Ninfer en la RTX 5090 ha aumentado a 550–720 tokens por segundo.
  • Esta actualización mejora el punto de referencia de 542 t/s reportado anteriormente el 20 de julio.
  • El motor continúa admitiendo modelos Qwen3.6 27B y 35B con ventanas de contexto de 250k.
  • El software sigue siendo de código abierto y está disponible en GitHub con soporte para Linux y Windows.

La ganancia de rendimiento demuestra una rápida optimización de los motores de inferencia locales en hardware de consumo insignia, lo que permite tiempos de respuesta aún más rápidos para modelos de alto contexto.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.