1. Lanzamiento de Qwen 3.6 27B Abliterated para reducir las tasas de rechazo
El proyecto Apostate ha lanzado su primer modelo de gran tamaño: una versión "abliterated" de Qwen 3.6 27B. Al modificar la alineación de seguridad del modelo, los desarrolladores lograron reducir su tasa de rechazo del 92% al 7,6%. La modificación preserva las capacidades principales del modelo, mostrando un impacto mínimo de solo 0,120 en la divergencia KL, y está disponible tanto en formato estándar como GGUF en Hugging Face.
- • El proyecto Apostate lanzó Qwen 3.6 27B Abliterated en Hugging Face en formatos estándar y GGUF.
- • La alineación de seguridad del modelo fue modificada para reducir la tasa de rechazo del 92% al 7,6%.
- • La modificación tuvo un impacto mínimo en las capacidades del modelo, medido en una divergencia KL de 0,120.
- • Este es el primer lanzamiento de un modelo de gran tamaño por parte del proyecto Apostate.
Permite a los desarrolladores implementar un modelo local altamente capaz que evita las estrictas restricciones de seguridad manteniendo sus capacidades originales.
2. El plugin Recall añade memoria de sesión local a Claude Code
Un nuevo plugin para Claude Code llamado Recall proporciona memoria de sesión persistente sin enviar datos a APIs externas. Al operar completamente en la máquina local del usuario, Recall utiliza un script de Python que implementa TF-IDF y TextRank para resumir las sesiones del proyecto. Escribe registros y resúmenes en un directorio local .recall/, resolviendo el problema de arranque en frío para nuevas sesiones de codificación y reduciendo el uso de tokens. También cuenta con una función de redacción integrada para evitar que claves de API y secretos se escriban en los registros.
- • Recall es un plugin local para Claude Code que crea registros de sesión y resúmenes condensados de las sesiones de proyecto.
- • La herramienta se ejecuta completamente de forma local, utilizando un script de Python con algoritmos TF-IDF y TextRank para la sumarización.
- • Ahorra créditos de API al reducir el consumo de tokens durante la reanudación de sesiones y evitar llamadas a modelos externos para realizar resúmenes.
- • Recall incluye una función de redacción para eliminar secretos como claves de API y tokens antes de escribir los archivos.
- • El plugin admite memoria tanto personal como de equipo compartido, almacenando los datos en un directorio .recall/.
Ayuda a los desarrolladores que utilizan Claude Code a reducir los costos de API y a evitar tener que volver a explicar el contexto del proyecto al mantener resúmenes de sesión locales y persistentes.
3. Benchmark de modelos de visión locales recomienda Qwen3.6 27B
Un benchmark actualizado de modelos de lenguaje visual (VLM) locales evaluó 23 modelos utilizando llama.cpp en Apple Silicon. Los resultados muestran que Qwen3.6 27B (Q4, sin modo de pensamiento) lidera la lista. Cabe destacar que el benchmark reveló que habilitar el modo de pensamiento en modelos híbridos perjudica el rendimiento visual y provoca tiempos de espera agotados, y que los modelos MoE generalmente tienen un rendimiento inferior en comparación con sus equivalentes densos en tareas de visión.
- • El benchmark evaluó 23 modelos en 30 imágenes en un Apple M2 Max con 96GB de RAM utilizando llama.cpp.
- • Qwen3.6 27B (Q4, nothink) resultó ser el modelo con mejor rendimiento, con una puntuación de 79,6.
- • Se descubrió que habilitar el modo de pensamiento en modelos híbridos degrada el rendimiento visual, causando inestabilidad y tiempos de espera.
- • Los modelos recomendados por nivel de VRAM incluyen Qwen3.5 4B para 4-8GB, Qwen3-VL 8B (Q8) para 12-16GB y Qwen3.6 27B para 24GB o más.
- • Los modelos de Mezcla de Expertos (MoE) tuvieron un rendimiento inferior al de los modelos densos equivalentes en las tareas de visión.
Ofrece a los desarrolladores recomendaciones claras y específicas de hardware para implementar modelos de visión locales y advierte sobre problemas de rendimiento como la inestabilidad del modo de pensamiento.