1. Lanzamiento de Mercury 2.5: Mayor velocidad y ventana de contexto ampliada
Basándose en la base del modelo Mercury 2 lanzado en junio, la nueva versión 2.5 ofrece un mayor rendimiento, una ventana de contexto significativamente más grande y nuevas funciones como razonamiento ajustable y salida JSON nativa alineada con esquemas. Esta actualización proporciona a los desarrolladores un rendimiento mejorado para agentes de voz en tiempo real y flujos de trabajo agenticos complejos.
- • Mercury 2.5 mejora las velocidades de generación a 1.107 tokens por segundo y añade una ventana de contexto de 260K tokens.
- • Las nuevas funciones incluyen razonamiento ajustable, llamadas a herramientas en paralelo y salida JSON nativa alineada con esquemas.
- • El precio estándar es de 0,20 $ por millón de tokens de entrada y 0,75 $ por millón de tokens de salida, con descuentos temporales de lanzamiento.
- • Los primeros usuarios reportan latencias medias de 170 ms y reducciones del 90% en los costes de compactación de contexto.
- • El modelo está disponible inmediatamente a través de la API de Inception, Baseten y OpenRouter.
Los desarrolladores ahora pueden aprovechar un mayor rendimiento y capacidades de contexto ampliadas para agentes de voz en tiempo real y flujos de trabajo agenticos complejos, beneficiándose al mismo tiempo de precios competitivos.
2. OpenAI lanza ChatGPT Images 2.5 con nuevos modelos de API
ChatGPT Images 2.5 está disponible en plataformas de escritorio, móviles y web para usuarios de ChatGPT, ChatGPT Work y Codex. El lanzamiento representa un paso adelante significativo en velocidad y control multimodal, brindando a los desarrolladores herramientas más granulares para guiar la generación de imágenes mediante bocetos y ediciones localizadas.
- • OpenAI lanzó dos nuevos modelos de API: GPT-Image-2.5 Flare para uso general y GPT-Image-2.5 Sunburst para flujos de trabajo creativos de alta precisión.
- • El nuevo motor de imágenes reduce la latencia de generación de imágenes hasta en un 50% en comparación con la versión anterior Images 2.0.
- • El modelo presenta capacidades mejoradas para preservar el parecido de personas y mascotas, alejándose de una estética de IA singular.
- • Las nuevas funciones de edición incluyen Sketch para dibujar guías de referencia directamente y herramientas para modificar áreas específicas de la imagen mientras se conservan las ediciones anteriores.
- • Los modelos incorporan salvaguardas de seguridad, incluyendo marcas de agua invisibles automáticas y metadatos C2PA para identificar contenido generado por IA.
Los desarrolladores pueden integrar una generación de imágenes más rápida y de mayor fidelidad, así como flujos de trabajo de edición precisos guiados por bocetos, directamente en sus aplicaciones.
3. inclusionAI expande la familia Ling-3.0-flash con un modelo multimodal VL
Basándose en la arquitectura Ling-3.0-flash lanzada a principios de agosto, inclusionAI ha introducido Ling-3.0-flash-VL. Esta nueva variante multimodal añade comprensión nativa de imágenes y vídeo a la familia de modelos existente, utilizando un diseño MoE disperso y un componente especializado VideoRoPE para el razonamiento espacio-temporal.
- • Ling-3.0-flash-VL es un modelo MoE disperso de 124B de parámetros, que activa 5,5B de parámetros por token.
- • El modelo admite una ventana de contexto de 1 millón de tokens.
- • Integra un codificador visual ViT y un proyector MLP de dos capas para el procesamiento multimodal nativo.
- • Un componente especializado VideoRoPE permite la localización precisa de eventos y la edición de vídeo.
- • El modelo ya está disponible en Hugging Face.
Este lanzamiento amplía el ecosistema Ling-3.0-flash, proporcionando a los desarrolladores un modelo multimodal de alta capacidad capaz de procesar entradas masivas de vídeo e imagen para tareas de razonamiento complejas.
4. DeepSeek actualiza la API Flash a V4.1 con soporte multimodal nativo
Basándose en la serie V4-Flash, DeepSeek ha introducido el modelo V4.1 Flash en versión beta. Esta actualización avanza la API V4-Flash anterior integrando soporte multimodal nativo mientras mantiene la estructura de precios existente. Los desarrolladores ahora pueden acceder a esta arquitectura actualizada actualizando la cadena de modelo de su API, continuando la evolución del ecosistema Flash.
- • DeepSeek V4.1 Flash introduce una nueva arquitectura con soporte multimodal nativo.
- • La versión beta es accesible configurando el nombre del modelo de la API como deepseek-v4.1-flash-expires-on-0910.
- • El precio sigue siendo idéntico al del modelo V4-Flash anterior.
- • La versión beta incluye un límite de tasa de 20 solicitudes concurrentes por cuenta.
Los desarrolladores ahora pueden acceder a un modelo flash actualizado y nativamente multimodal actualizando la cadena de modelo de su API, basándose en las capacidades establecidas en el ecosistema V4-Flash.
5. Reducto lanza el analizador de documentos de una sola pasada r-1
Al consolidar el texto, la estructura de tablas, el diseño, el orden de lectura y el formato en una sola pasada, r-1 evita la latencia y los errores acumulativos de las tuberías de varias etapas. Reducto planea expandir la línea en el futuro con un modelo r-1 mini y enrutamiento automático por página.
- • El modelo r-1 procesa documentos en una sola pasada de página completa, reemplazando las complejas tuberías de OCR agentico de varias etapas.
- • Reducto reporta una reducción del 20% en las tasas de error en comparación con sus tuberías de análisis de documentos agentico heredadas.
- • El precio se establece en una tarifa plana de 1 centavo por página, frente a los 3 a 6 centavos por página cobrados por los modelos heredados.
- • El modelo está disponible en vista previa a través de la API V3 Parse de Reducto y requiere un indicador de configuración específico para habilitarse.
- • Reducto ofrece hasta 5.000 $ en créditos para que las organizaciones realicen comparaciones lado a lado frente a otros analizadores.
- • Actualmente no hay opciones de pesos abiertos o autoalojamiento local disponibles para el modelo r-1.
Los desarrolladores pueden reducir significativamente sus costes de ingesta de documentos mientras mejoran la precisión de la extracción de texto, tablas y diseño para tuberías RAG.
6. Anthropic amplía la advertencia de seguridad para incluir el robo de tokens de API y suscripción
Basándose en las medidas de seguridad anteriores tomadas contra el malware infostealer, Anthropic ha alertado ahora a los suscriptores sobre intentos continuos de robar tokens de API y suscripción de Claude. Este desarrollo indica que los intentos de acceso no autorizado han evolucionado más allá del secuestro de sesiones, lo que requiere que los desarrolladores auditen sus claves de API y supervisen los paneles de facturación en busca de un uso anómalo.
- • Anthropic emitió una nueva advertencia sobre el robo de tokens de API y suscripción de Claude.
- • Esto sigue a los esfuerzos anteriores para mitigar el secuestro de sesiones causado por malware infostealer.
- • Se aconseja a los desarrolladores que roten las claves de API y supervisen los paneles de facturación en busca de picos de uso no autorizados.
Los desarrolladores ahora deben extender sus auditorías de seguridad más allá de la gestión de sesiones para incluir claves de API activas y credenciales de suscripción para evitar cargos de facturación no autorizados.
7. NVIDIA expande la iniciativa Rust-for-GPU con un nuevo compilador SIMT
NVIDIA ha formalizado sus esfuerzos de Rust-for-GPU bajo la iniciativa 'CUDA Rust'. Esto expande el cutile-rs lanzado anteriormente (un sistema basado en mosaicos) mediante la introducción de cuda-oxide, una nueva pista diseñada para el modelo de ejecución SIMT. Mientras que cutile-rs sigue estando disponible para kernels basados en mosaicos compilados JIT, cuda-oxide proporciona un camino para compilar Rust MIR a PTX, requiriendo una cadena de herramientas nocturna fijada y hardware con capacidad de cómputo 8.0+.
- • La iniciativa 'CUDA Rust' ahora abarca tanto el cutile-rs existente como el nuevo proyecto cuda-oxide.
- • cuda-oxide apunta al modelo de ejecución SIMT compilando Rust MIR a PTX.
- • cuda-oxide requiere una cadena de herramientas nocturna fijada, Linux y GPUs NVIDIA con capacidad de cómputo 8.0 o superior.
- • cutile-rs continúa soportando Rust estable 1.89+ y CUDA 13.3 para el desarrollo de kernels basados en mosaicos.
- • Ambas pistas están en alfa y aún no se recomiendan para producción.
Esta iniciativa consolida el soporte de Rust de NVIDIA, ofreciendo a los desarrolladores dos caminos distintos (SIMT y Tile) para lograr un desarrollo de kernels de GPU seguro para la memoria.
8. Infercat comparte modelos de IA locales a través de túneles P2P cifrados
Infercat convierte efectivamente el hardware local en una mini-nube privada. Al evitar la necesidad de puertos orientados al público o configuraciones de red complejas, ofrece una forma altamente segura y sin fricciones para que los desarrolladores colaboren o prueben modelos locales en diferentes dispositivos.
- • Infercat utiliza tailcat para establecer túneles punto a punto seguros y cifrados de extremo a extremo entre máquinas anfitrionas y clientes.
- • La herramienta admite motores de inferencia locales populares, incluidos llama.cpp, vLLM, Ollama y LM Studio.
- • Proporciona una API compatible con OpenAI, lo que permite una integración perfecta con Cursor, Claude Code y Open WebUI.
- • Los usuarios pueden generar códigos de invitación simples para otorgar acceso sin necesidad de cuentas externas o configuraciones de VPN a nivel de sistema.
- • Las máquinas anfitrionas registran estadísticas de uso básicas pero no almacenan transcripciones de conversaciones privadas.
Permite a los desarrolladores exponer sus configuraciones de GPU locales a clientes externos, colaboradores o herramientas de codificación sin configurar VPNs complejas o alojamiento en la nube.
9. El plugin I-Have-ADHD elimina el relleno conversacional de Claude Code
Al eliminar la pelusa conversacional educada pero que consume tiempo, típica de los LLM modernos, el plugin i-have-adhd optimiza los asistentes de codificación basados en terminal para obtener pura velocidad y utilidad. Proporciona una forma altamente práctica de personalizar los entornos de desarrollo locales para obtener la máxima concentración.
- • El plugin aplica 10 reglas específicas para las respuestas de LLM, incluyendo liderar con la siguiente acción y limitar las listas a cinco elementos.
- • Prohíbe estrictamente elementos conversacionales como preámbulos, resúmenes y comentarios de cierre.
- • La herramienta es de código abierto, alojada en GitHub bajo la licencia MIT, y se basa libremente en estrategias de afrontamiento del TDAH.
- • La instalación para Claude Code requiere clonar el repositorio y usar comandos CLI para agregar el plugin al mercado local.
Los desarrolladores pueden acelerar sus interacciones con Claude Code eliminando el relleno conversacional repetitivo y obligando al modelo a liderar directamente con código procesable.
10. Hip-Agent: Un arnés de agente de Python ligero de 200 líneas
Diseñado para encajar directamente dentro de un prompt, hip-agent evita la complejidad de los marcos de agentes más grandes. Al tratar las acciones como comandos de shell y los subagentes como procesos secundarios, ofrece un enfoque limpio y similar a Unix para construir y orquestar la automatización impulsada por LLM.
- • El bucle central de hip-agent se implementa en aproximadamente 200 líneas de código Python.
- • El arnés utiliza variables de entorno estándar para la configuración y ejecuta acciones a través de comandos de shell.
- • Los subagentes dentro del arnés se implementan como procesos secundarios estándar.
- • La herramienta incluye un módulo dedicado para la integración con la API de Codex.
- • Se basa en protocolos y formatos existentes para el resto de su funcionalidad de agente.
Ofrece a los desarrolladores una alternativa simple y altamente transparente a los marcos de agentes inflados, lo que facilita la inspección, personalización y depuración de los bucles de ejecución de agentes.
11. Deltafin ejecuta el modelo Kimi K3 de 2.8T localmente mediante streaming SSD
Deltafin opera como un proyecto independiente de código abierto sin afiliación con Moonshot AI. Al evitar la poda y, en su lugar, transmitir el modelo completo de 2,8 billones de parámetros desde SSDs de alta velocidad, proporciona un camino novedoso para la ejecución local de modelos masivos de mezcla de expertos en hardware accesible.
- • Deltafin logró una velocidad de decodificación constante de 1,0 token por segundo para una respuesta de 512 tokens en un MacBook Pro M1 Max con 128 GB de RAM.
- • La herramienta transmite expertos del modelo desde SSDs, con un rendimiento que escala del 52% en una sola unidad hasta el 90% en una configuración de cuatro unidades.
- • Una limitación actual de prellenado hace que un prompt de 512 tokens tarde 6,3 minutos en generar el primer token debido a la lectura repetitiva de expertos.
- • Los desarrolladores pueden integrar modelos Qwen para acelerar la finalización de texto sin procesar mediante decodificación especulativa, donde el modelo más pequeño propone tokens para que Kimi K3 los verifique.
- • Deltafin incluye un servidor compatible con OpenAI que admite puntos finales de chat y finalización estándar bajo una licencia MIT.
Permite a los desarrolladores ejecutar modelos masivos de clase frontera localmente en estaciones de trabajo estándar sin necesidad de clústeres de GPU de grado empresarial.
12. Edge Browser Agent ejecuta modelos sub-1B en hardware móvil heredado
El experimento destaca las enormes ganancias de rendimiento de optimizar la representación de entrada para agentes de borde. Si bien los modelos diminutos todavía luchan con tareas basadas en el juicio, como identificar señuelos tópicos, la capa de percepción estructurada hace que el raspado web básico y la extracción de datos sean altamente viables en hardware de hace una década.
- • Los investigadores ejecutaron con éxito modelos como Qwen3-0.6B en un Samsung Galaxy Note 8 de 2017 usando llama.cpp dentro de Termux.
- • El sistema alimenta a los modelos con una representación de página web estructurada de unos 200 tokens, en lugar de HTML sin procesar o capturas de pantalla pesadas.
- • Los modelos sub-1B y 2B, incluidos Qwen3-0.6B y Llama-3.2-3B, lograron una tasa de éxito de 10/10 en una tarea de raspado de libros en entorno aislado.
- • El uso de HTML sin procesar en lugar de percepción estructurada aumentó el tiempo de ejecución de la tarea de 80 segundos a 22 minutos y provocó fallos en la tarea.
- • El proyecto es de código abierto y está disponible en GitHub en github.com/e2llm/edge-browser-agent.
Demuestra que los desarrolladores pueden construir agentes de navegador altamente eficientes y de baja latencia que se ejecutan completamente en el dispositivo sin necesidad de costosas APIs en la nube o GPUs móviles de gama alta.
13. Benchmarks del motor de inferencia para Qwen3.8-Flash-Next a 262K de contexto
Los benchmarks se realizaron en una estación de trabajo equipada con una GPU NVIDIA RTX PRO 6000 Blackwell y una CPU AMD Ryzen 9 9950X. Si bien la precisión en benchmarks estándar como GSM8K y MATH-500 se mantuvo estadísticamente idéntica en todos los motores, las diferencias dramáticas en los tiempos de prellenado y el consumo de energía destacan la importancia de la selección del motor para implementaciones locales a nivel de producción.
- • Con una ventana de contexto de 262K, SGLang logró un tiempo hasta el primer token de 35,4 segundos, en comparación con los 80,4 segundos de FreeToken y los 258,4 segundos de llama.cpp base.
- • FreeToken mantuvo velocidades de decodificación planas de 100,1 a 94,8 tokens por segundo en barridos de contexto, mientras que llama.cpp base se degradó de 101,9 a 20,2 tokens por segundo.
- • La bifurcación de Predicción Multi-Token de llama.cpp mejoró las velocidades de decodificación hasta 1,69 veces en pruebas de codificación, pero solo cuando todos los expertos del modelo permanecían en la GPU.
- • SGLang consumió aproximadamente 13 kJ de energía de GPU para una solicitud de ventana completa, en comparación con los 116 kJ de llama.cpp base, debido a duraciones de solicitud más cortas.
- • Los tiempos de inicio para llegar a la primera respuesta favorecieron a llama.cpp con 16 segundos, en comparación con los 108 segundos de SGLang y los 126 segundos de FreeToken.
Los desarrolladores pueden reducir drásticamente la latencia y los costes energéticos para modelos locales de contexto largo seleccionando el motor de inferencia óptimo para su hardware.
14. Qwen3.8 27B supera los problemas previos de degradación de cuantización
Basándose en informes anteriores que identificaron una degradación significativa en matemáticas y razonamiento en modelos 27B utilizando la cuantización Q4_K_M, nuevas evaluaciones del modelo Qwen3.8 27B confirman que esta versión conserva el rendimiento de precisión completa en benchmarks clave como GPQA Diamond y Terminal-Bench 2.1. Esto indica que la última arquitectura de modelo es más resistente a la compresión estándar de 4 bits que sus predecesores.
- • La cuantización Q4_K_M de Qwen3.8 27B iguala el rendimiento BF16 de precisión completa en GPQA Diamond y Terminal-Bench 2.1.
- • Esto contrasta con las evaluaciones anteriores del modelo 27B que mostraron una caída del 9% en la precisión matemática bajo la misma cuantización Q4_K_M.
- • El modelo cabe en una sola GPU de 24GB mientras mantiene aproximadamente 64k tokens de contexto.
- • La cuantización extrema de 1 bit sigue siendo inutilizable, consistente con los hallazgos de generaciones de modelos anteriores.
Los desarrolladores ahora pueden implementar el modelo Qwen3.8 27B utilizando cuantización de 4 bits en hardware de consumo sin las compensaciones de precisión observadas anteriormente en iteraciones 27B anteriores.
15. Benchmarking de concurrencia de agentes locales en GPUs duales RTX 4090
Los benchmarks demuestran que el rendimiento de prellenado agregado permanece constante en aproximadamente 1.500 tokens por segundo, independientemente de las ranuras de agente concurrentes. Para los desarrolladores que buscan integrar estos modelos locales en sus flujos de trabajo activos, la configuración puede exponerse como un servidor MCP para servir como subagentes dentro de Claude Code.
- • Un sistema dual RTX 4090 con 128GB de RAM alcanzó un límite suave en 5 agentes concurrentes con 64k de contexto, más allá del cual la latencia aumentó sin ganancias de rendimiento.
- • El límite estricto para el sistema fue de 9 agentes concurrentes a 64k de contexto, limitado estrictamente por la disponibilidad de VRAM.
- • El modelo Qwen 27B logró 3,40 segundos por llamada a herramienta, superando significativamente a un modelo MoE de 122B que tomó 11,91 segundos.
- • No se encontraron diferencias de precisión medibles entre las cuantizaciones Q4_K_M, Q6_K_XL y Q8_K_XL para la recuperación de largo alcance hasta 251.557 tokens.
- • El uso de q8_0 para la caché KV ahorró 1,4 GiB de VRAM por ranura sin pérdida de calidad o velocidad en comparación con f16.
Los desarrolladores pueden optimizar sus arquitecturas de agentes locales haciendo coincidir los tamaños de los modelos y los niveles de cuantización con límites específicos de VRAM y concurrencia.