1. H Company lanza los codificadores multimodales de torre única NeoMME
H Company ha lanzado NeoMME, una familia de codificadores bidireccionales de 260M y 800M de parámetros que funcionan como modelos multimodales de torre única. Al procesar texto multilingüe y parches de imagen RGB de 32x32 sin procesar a través de un único Transformer, NeoMME elimina la necesidad de una torre de visión o un decodificador causal por separado. A pesar de su pequeño tamaño, el modelo NeoMME-Retriever-260M iguala el rendimiento del modelo ColQwen2.5 de 3.75B en el benchmark ViDoRe v3. Los modelos se lanzan bajo una licencia Apache 2.0, admiten un contexto de 16,384 tokens y pueden comprimir el almacenamiento de índices de 1.5 MB a solo 6 kB por página.
- • Los modelos NeoMME están disponibles en tamaños de 260M y 800M de parámetros bajo una licencia Apache 2.0 con soporte desde el primer día en Hugging Face.
- • La arquitectura de torre única procesa texto multilingüe y parches de imagen RGB de 32x32 a través de un único Transformer, eliminando la torre de visión separada.
- • NeoMME-Retriever-260M iguala el rendimiento del modelo ColQwen2.5 de 3.75B de parámetros, obteniendo 0.523 nDCG@10 en el benchmark ViDoRe v3.
- • En una NVIDIA L40S, el modelo de 260M indexa 51.3 páginas por segundo, mientras que la codificación de consultas toma 78.3 ms en un host solo con CPU.
- • Los requisitos de almacenamiento de índices pueden reducirse de 1.5 MB a 6 kB por página utilizando agrupación jerárquica de tokens y cuantización asimétrica.
Los desarrolladores pueden crear pipelines de búsqueda multimodal y RAG altamente eficientes utilizando modelos compactos que se ejecutan rápidamente en CPUs y requieren un almacenamiento de índice mínimo.
2. XHToken lanza los modelos Spark-X2.5 con ventana de contexto de 1M
XHToken ha lanzado Spark-X2.5-4B y Spark-X2.5-1.7B, dos modelos de lenguaje compactos diseñados para tareas de contexto largo. A pesar de sus tamaños de parámetros reducidos, ambos modelos admiten más de 200 idiomas y cuentan con una ventana de contexto nativa de hasta 1 millón de tokens, habilitada por una arquitectura de atención híbrida que combina una capa de atención completa con tres capas de atención de ventana deslizante. Los modelos están diseñados para flujos de trabajo de agentes y ofrecen integración desde el primer día con marcos como Claude Code y Codex, así como motores de inferencia que incluyen vLLM, SGLang, llama.cpp y Ollama.
- • Los modelos Spark-X2.5-4B y Spark-X2.5-1.7B admiten más de 200 idiomas y cuentan con una ventana de contexto nativa de hasta 1 millón de tokens.
- • La arquitectura utiliza un diseño de atención híbrido que consiste en una capa de atención completa y tres capas de atención de ventana deslizante.
- • Los modelos están integrados con marcos de agentes que incluyen Codex, Claude Code, OpenClaw y Hermes.
- • Los marcos de inferencia compatibles incluyen vLLM, SGLang, llama.cpp, MLX, Ollama y LM Studio.
- • Los modelos son compatibles con plataformas de hardware de NVIDIA, Huawei, Hygon y HOUMO.AI.
Los desarrolladores pueden ejecutar modelos compactos de contexto largo localmente con soporte nativo para marcos de agentes y motores de inferencia populares.
3. UC Berkeley lanza CUA-Lite para agentes de uso informático
Investigadores de UC Berkeley han lanzado CUA-Lite, una plataforma abierta diseñada para simplificar el desarrollo y la evaluación de agentes de uso informático (CUA). La plataforma unifica agentes, entornos, trazas y marcos de evaluación bajo un único espacio de acción y esquema de datos. Un componente clave es Lite.OSWorld, que reemplaza las pesadas máquinas virtuales con contenedores Docker, reduciendo la huella del entorno de 4.1 GB a 0.9 GB mientras mantiene puntuaciones de rendimiento idénticas en 13 modelos probados. CUA-Lite admite Python 3.12 y puede implementarse en cualquier host Docker sin virtualización anidada.
- • CUA-Lite proporciona un único espacio de acción y esquema de datos en entornos de escritorio, navegador y móviles.
- • La plataforma incluye Lite.OSWorld, que ejecuta tareas de OSWorld en contenedores Docker en lugar de máquinas virtuales, reduciendo la huella de 4.1 GB a 0.9 GB.
- • Las puntuaciones de rendimiento en el contenedor Lite.OSWorld igualan a la máquina virtual original de OSWorld en 13 modelos probados.
- • La plataforma cuenta con más de 30,000 tareas verificables, más de 15 benchmarks, más de 10 agentes y más de 20 conjuntos de datos en Hugging Face.
- • CUA-Lite es compatible con Python 3.12 y se despliega en cualquier host Docker sin requerir virtualización anidada.
Los desarrolladores pueden construir y probar agentes de uso informático en entornos ligeros basados en Docker que reducen la huella de disco en más de un 75% sin sacrificar la precisión de la evaluación.
4. La herramienta de código abierto 'lm-eval-ledger' compara visualmente las respuestas de los modelos
Un desarrollador ha lanzado `lm-eval-ledger`, un marco de evaluación de código abierto diseñado para ayudar a los desarrolladores a inspeccionar y comparar cómo diferentes modelos responden a preguntas específicas de benchmark. La herramienta está basada en YAML, lo que permite a los usuarios configurar múltiples modelos y tareas para ejecutarse con un solo comando. Almacena datos detallados por pregunta (incluyendo prompts del sistema, generaciones sin procesar, respuestas extraídas y razones de detención) en una base de datos SQLite, que luego puede explorarse y compararse lado a lado utilizando una interfaz web Flask incluida. La herramienta admite backends de vLLM, SGLang, Hugging Face y llama.cpp.
- • La herramienta está basada en YAML, lo que permite a los usuarios definir múltiples modelos y tareas en un archivo de configuración para ejecutar benchmarks con un solo comando.
- • Almacena datos de benchmark en una base de datos SQLite y utiliza una aplicación Flask para visualizar y comparar las respuestas de los modelos.
- • El marco registra datos por pregunta, incluyendo prompts del sistema, generaciones del modelo, respuestas extraídas, verdad fundamental y razones de detención.
- • Admite backends que incluyen vLLM, SGLang, Hugging Face y llama.cpp tanto en Linux como en Windows.
- • Los benchmarks iniciales ejecutados en una sola GPU 5090 compararon Qwen3.5-9B, NVIDIA-Nemotron-3.5-Lightning y Gemma-4-12B-it.
Los desarrolladores pueden inspeccionar y comparar visualmente las salidas exactas de los modelos en diferentes benchmarks para comprender por qué los modelos tienen éxito o fallan más allá de las puntuaciones brutas.
5. La herramienta de código abierto 'cache-pressure' valida la expulsión de caché KV en LLMs locales
Se ha lanzado una nueva herramienta de código abierto llamada `cache-pressure` para ayudar a los desarrolladores a validar y medir el rendimiento de la gestión de caché KV en implementaciones locales de LLM. La herramienta funciona calibrando las expectativas de caché, llenando la caché con contextos estables y validando los aciertos de caché en orden inverso para ver exactamente cómo se expulsan los contextos antiguos. Utilizando la herramienta, su creador logró identificar y resolver errores de gestión de caché en vLLM, aumentando los tokens retenidos bajo presión de aproximadamente 1 millón a más de 3 millones. La herramienta es compatible con vLLM, ninfer, llama.cpp y SGLang.
- • La herramienta funciona calibrando las expectativas de caché, llenando la caché con contextos estables y validando los aciertos de caché en orden inverso.
- • Utilizando la herramienta, el autor identificó y corrigió problemas de gestión de caché en vLLM, aumentando los tokens retenidos bajo presión de 1,052,025 a 3,000,048.
- • La herramienta es compatible con múltiples motores de inferencia, incluyendo vLLM, ninfer, llama.cpp y SGLang.
- • Ejecutar la herramienta expulsará todo el contexto almacenado en caché existente en la implementación de destino.
Los desarrolladores pueden identificar y resolver errores silenciosos de expulsión de contexto en motores de inferencia locales para garantizar un rendimiento confiable de contexto largo bajo carga pesada.
6. Una evaluación compara ocho variantes abliteradas de Qwen 3.8 27B
Un estudio detallado que evalúa ocho variantes abliteradas (sin censura) del modelo Qwen 3.8 27B destaca las compensaciones de diferentes técnicas de eliminación de censura. Realizado durante 11 días utilizando 167 horas de GPU, el estudio encontró que las ediciones quirúrgicas generalmente superan a las ediciones pesadas, que a menudo causan que los modelos no terminen sus bucles de pensamiento (como se ve en la variante 'obliteratus', donde el 44.8% de las respuestas no pudieron completarse). La variante 'orcarouter' logró la tasa de éxito de ataque de HarmBench más alta con un 82.2%, mientras que la variante 'apostate' ofreció un fuerte equilibrio entre baja divergencia KL y capacidades casi idénticas al original.
- • La evaluación comparó ocho variantes abliteradas de Qwen 3.8 27B durante 11 días, utilizando aproximadamente 167 horas de GPU.
- • La metodología incluyó comparaciones de pesos, mediciones de divergencia KL, 13 benchmarks y el HarmBench 400 classic.
- • La variante 'orcarouter' logró la tasa de éxito de ataque (ASR) de HarmBench más alta con un 82.2% y fue el único modelo con pesos totalmente verificados.
- • La variante 'apostate' logró una ASR del 78.7% y destaca por su baja divergencia KL y capacidades casi idénticas al original.
- • La variante 'obliteratus' debe evitarse, ya que la edición agresiva causó que el 44.8% de las respuestas no completaran su proceso de pensamiento.
- • Se descubrió que la variante 'blackfrost' contenía un prompt de sistema de jailbreak no revelado de 1457 caracteres dentro de su plantilla de chat.
Los desarrolladores que implementan modelos locales sin censura pueden seleccionar variantes que mantengan capacidades de razonamiento y eviten bucles de pensamiento rotos causados por una edición excesiva.