1. Tencent lanza la vista previa de Hy4 con una ventana de contexto de 1 millón
La vista previa de Hy4 está diseñada para tareas de productividad, incluyendo ingeniería de software, desarrollo de juegos e investigación científica. En evaluaciones internas sobre tareas de ingeniería, el modelo obtuvo una puntuación de 2.99 sobre 4.00, superando a GLM-5.3 y Kimi K3. Además, el modelo participó en su propio desarrollo optimizando de forma autónoma su sistema de inferencia, lo que resultó en un aumento del 31.8% en el rendimiento de extremo a extremo.
- • La vista previa de Hy4 cuenta con 770 mil millones de parámetros totales, 49 mil millones de parámetros activos y una ventana de contexto superior a 1 millón de tokens.
- • El precio de la API se establece en 0.834 dólares por millón de tokens de entrada, 2.501 dólares por millón de tokens de salida y 0.042 dólares por millón de tokens para aciertos de caché.
- • El modelo está disponible globalmente a través de Tencent Cloud TokenHub, OpenRouter, WorkBuddy y CodeBuddy.
- • Tencent comprimió el modelo de 1.5TB a aproximadamente 200GB en formato GGUF, manteniendo alrededor del 98% de su rendimiento original.
Los desarrolladores pueden acceder a un modelo de mezcla de expertos (MoE) de contexto largo y alta capacidad a nivel mundial a través de OpenRouter y Tencent Cloud con precios de API altamente competitivos.
2. vLLM v0.28.0 añade soporte para DeepSeek V4 y duplica los tokens por lote
Esta versión importante incorpora 584 confirmaciones (commits) de 270 colaboradores. Además de las expansiones de soporte para modelos y hardware, la dependencia de la biblioteca Transformers se ha actualizado a la versión 5.15.0, y el soporte para bitsandbytes se ha migrado a un complemento externo. Hay binarios precompilados disponibles para CUDA 12.9 y 13.0, así como para entornos exclusivos de CPU, incluido macOS.
- • vLLM v0.28.0 introduce soporte para DeepSeek V4, incluyendo MLA disperso, soporte para AMD Quark NVFP4 y habilitación de ROCm.
- • El valor predeterminado de max_num_batched_tokens se ha duplicado de 8,192 a 16,384 para mejorar el rendimiento.
- • Las optimizaciones de rendimiento para Kimi-K3 incluyen soporte para Decode Context Parallel, núcleos FlashKDA fusionados y un presupuesto adaptativo de tokens especulativos.
- • La versión añade soporte para nuevos modelos, incluyendo Muse Glimmer, Ling 3.0 Flash, Dots3 NOTE e Interns2mobius.
Los desarrolladores que alojan modelos de pesos abiertos pueden aprovechar el servicio optimizado de DeepSeek V4 y duplicar su capacidad predeterminada de tokens por lote para obtener un mayor rendimiento.
3. Lanzamiento de TerminalBench 4.0 para reducir los costos de evaluación de agentes
Basándose en versiones anteriores de la suite Terminal-Bench, TerminalBench 4.0 introduce un marco ligero diseñado para abordar los altos costos y los requisitos de tokens de las iteraciones anteriores. Permite a los desarrolladores iterar rápidamente en los arneses de agentes e integraciones de herramientas sin necesidad de las enormes cantidades de tokens requeridas por los puntos de referencia anteriores.
- • TerminalBench 4.0 sucede a las versiones anteriores de la serie Terminal-Bench.
- • La nueva versión reduce los requisitos de tokens para la evaluación comparativa, alejándose de la escala de 5 a 10 mil millones de tokens.
- • Está optimizado para la iteración rápida de arneses de agentes de codificación personalizados.
- • La versión proporciona una forma más accesible de evaluar las modificaciones de herramientas y la ingeniería de prompts.
Esta actualización permite a los desarrolladores medir el impacto de las modificaciones de los agentes en el rendimiento y la eficiencia de los tokens de manera más asequible, facilitando ciclos de desarrollo más rápidos.
4. StemDeck lanza un separador de pistas de audio local de código abierto
StemDeck proporciona un entorno local completo para la manipulación de audio, con un mezclador multipista estilo DAW, un editor de formas de onda y herramientas de análisis integradas para BPM, tono, escala y sonoridad (LUFS). Al operar completamente en el dispositivo, elimina la necesidad de suscripciones, cuentas o cargas en la nube, lo que lo convierte en una opción segura y rentable para el preprocesamiento de audio local.
- • StemDeck separa archivos de audio o URLs de YouTube en seis pistas: voz, batería, bajo, guitarra, piano y otros.
- • La herramienta está construida sobre Python 3.12 con un backend de FastAPI y un shell de escritorio Tauri v2, ejecutándose completamente de forma local.
- • Utiliza la red neuronal htdemucs_6s de Demucs para una separación de audio de alta calidad.
- • La aplicación admite aceleración por GPU a través de CUDA en hardware NVIDIA y MPS en Apple Silicon en macOS, Windows y Linux.
Los desarrolladores que crean aplicaciones de procesamiento de audio o multimodales pueden aprovechar una canalización totalmente local y acelerada por GPU para aislar voces e instrumentos sin dependencias de la nube.
5. Claude Code establece límites de uso semanales permanentes tras un aumento temporal
Basándose en las expansiones de límites anteriores para Claude Code, ClaudeDevs ha anunciado una nueva política permanente. A partir del 14 de septiembre, los usuarios de los planes Pro, Max, Team y Enterprise verán un aumento permanente del 25% en los límites semanales estándar. Esto reemplaza el aumento temporal del 50% actualmente vigente, lo que representa una reducción del 17% respecto a los niveles temporales, pero estableciendo una base a largo plazo más alta para los flujos de trabajo de los desarrolladores.
- • El aumento permanente del 25% en los límites semanales entra en vigor el 14 de septiembre para los planes Pro, Max, Team y Enterprise.
- • El cambio hace que los usuarios pasen del aumento temporal actual del 50%.
- • El nuevo límite permanente representa una reducción del 17% respecto a los niveles temporales del 50%.
- • Esto sigue a los aumentos de límites anteriores para Claude Code reportados en mayo y junio de 2026.
Esta actualización formaliza la capacidad a largo plazo para los usuarios de Claude Code, proporcionando un aumento permanente sobre la base original establecida en expansiones de límites anteriores.