1. Anthropic lanza Claude Tag, un compañero de equipo agente en Slack
Anthropic ha presentado Claude Tag en versión beta para clientes de Claude Enterprise y Team, reemplazando la aplicación existente de Claude en Slack. Impulsado por el modelo Claude Opus 4.8, el agente está diseñado para funcionar como un compañero de equipo autónomo que lee el contexto del canal, participa en hilos y ejecuta tareas de forma asíncrona. Los administradores pueden configurar Claude Tag limitando su acceso a canales específicos, estableciendo límites de gasto de tokens y revisando registros detallados de todas las acciones realizadas. Anthropic informa que su propio equipo de producto ya genera el 65% de su código utilizando una versión interna de la herramienta. Se están ofreciendo créditos de lanzamiento introductorios a las organizaciones elegibles para probar el servicio.
- • Anthropic lanzó Claude Tag en versión beta para clientes de Claude Enterprise y Team, reemplazando la aplicación existente de Claude en Slack.
- • El agente funciona con el modelo Claude Opus 4.8 y opera como un compañero de equipo persistente y siempre activo dentro de los canales de Slack.
- • Las capacidades clave incluyen interacción multijugador, memoria a largo plazo, monitoreo ambiental proactivo y ejecución de tareas asíncronas.
- • Los administradores pueden limitar el acceso de Claude a canales específicos, establecer límites de gasto de tokens y revisar registros de actividad detallados.
- • Anthropic informa que el 65% del código de su propio equipo de producto es generado actualmente por su versión interna de Claude Tag.
Los desarrolladores pueden implementar un compañero de equipo de IA autónomo y persistente directamente en los canales de Slack para ejecutar tareas, aprender el contexto y escribir código.
2. VibeThinker-3B, modelo de razonamiento que iguala a modelos de frontera destacados
VibeThinker-3B es un modelo denso de 3 mil millones de parámetros desarrollado para investigar el razonamiento verificable en modelos de lenguaje pequeños. Entrenado utilizando el paradigma de post-entrenamiento Spectrum-to-Signal (que comprende SFT basado en currículo, RL multidominio y auto-destilación fuera de línea), el modelo alcanzó una puntuación de 94.3 en AIME26, que mejora a 97.1 con escalado en tiempo de prueba a nivel de afirmación. También registró una puntuación Pass@1 de 80.2 en LiveCodeBench v6 y una tasa de aceptación del 96.1% en concursos recientes de LeetCode no vistos. VibeThinker-3B iguala o supera el rendimiento de modelos insignia más grandes como DeepSeek V3.2, GLM-5 y Gemini 3 Pro en tareas de razonamiento, manteniendo una alta controlabilidad de instrucciones.
- • VibeThinker-3B es un modelo denso de 3B de parámetros entrenado utilizando un novedoso paradigma de post-entrenamiento Spectrum-to-Signal (SFT + GRPO).
- • El modelo alcanzó una puntuación de 94.3 en AIME26 (mejorando a 97.1 con escalado en tiempo de prueba) y un Pass@1 de 80.2 en LiveCodeBench v6.
- • Iguala o supera el rendimiento de modelos insignia más grandes como DeepSeek V3.2, GLM-5 y Gemini 3 Pro en tareas de razonamiento.
- • El modelo mantiene una alta controlabilidad de instrucciones, obteniendo 93.4 en el benchmark IFEval.
Los desarrolladores pueden aprovechar un modelo compacto de 3 mil millones de parámetros que logra un alto rendimiento de razonamiento en benchmarks de codificación y matemáticas.
3. Mistral AI lanza Mistral OCR 4, modelo multilingüe para documentos
Mistral AI ha lanzado Mistral OCR 4, un modelo de comprensión de documentos que extrae texto, cuadros delimitadores, clasificaciones de bloques y puntuaciones de confianza en línea. Con soporte para 170 idiomas en 10 grupos lingüísticos, el modelo está optimizado para búsqueda empresarial, RAG y pipelines de recuperación específicos de dominio. Puede implementarse en un solo contenedor para entornos autohospedados para cumplir con estrictos requisitos de cumplimiento de datos. Mistral OCR 4 está integrado en el Mistral Search Toolkit y está disponible a través de Mistral Studio, Amazon SageMaker y Microsoft Foundry, con soporte para Snowflake próximamente.
- • Mistral AI lanzó Mistral OCR 4, un modelo de comprensión de documentos que admite 170 idiomas en 10 grupos lingüísticos.
- • El modelo proporciona texto extraído, cuadros delimitadores, clasificación de bloques y puntuaciones de confianza en línea.
- • El precio de la API se establece en $4 por cada 1,000 páginas, con una tarifa con descuento de $2 por cada 1,000 páginas para el uso de Batch-API.
- • El modelo puede implementarse en un solo contenedor para entornos autohospedados para cumplir con los requisitos de cumplimiento de datos.
- • Está disponible a través de Mistral Studio, Amazon SageMaker y Microsoft Foundry, con soporte para Snowflake Parse Document próximamente.
Los desarrolladores pueden integrar un modelo de comprensión de documentos altamente multilingüe en sus pipelines de RAG y recuperación a través de API o contenedores autohospedados.
4. Krea lanza los modelos de imagen de pesos abiertos Krea 2 Raw y Turbo
Krea ha lanzado su familia de modelos de imagen de IA Krea 2 en Hugging Face, ofreciendo dos versiones: Krea 2 Raw y Krea 2 Turbo. Construido sobre una arquitectura de transformador de difusión de 12 mil millones de parámetros, Krea 2 Raw es un modelo base no destilado diseñado para entrenamiento estructural y ajuste fino, mientras que Krea 2 Turbo es una variante destilada optimizada para una generación rápida, logrando velocidades de 2 segundos. La Licencia Comunitaria Krea 2 permite el uso comercial gratuito para individuos y pequeñas empresas con hasta 50 empleados. Todos los usuarios están contractualmente obligados a implementar salvaguardas técnicas para evitar la generación de materiales ilegales o dañinos.
- • Krea lanzó Krea 2 Raw y Krea 2 Turbo como modelos de pesos abiertos disponibles para descargar en Hugging Face.
- • Krea 2 Turbo cuenta con una velocidad de generación de 2 segundos, lo que lo convierte en uno de los modelos de generación de imágenes más rápidos disponibles.
- • Los modelos están construidos sobre una arquitectura de transformador de difusión de 12 mil millones de parámetros.
- • La Licencia Comunitaria Krea 2 permite el uso comercial gratuito para individuos y empresas con hasta 50 empleados.
- • Los usuarios están contractualmente obligados a implementar salvaguardas técnicas para evitar la generación de materiales ilegales o dañinos.
Los desarrolladores pueden autohospedar un modelo de generación de imágenes rápido de 12 mil millones de parámetros con una licencia que permite el uso comercial gratuito para equipos pequeños.
5. Lanzamiento de la familia de modelos de visión artificial multitarea YOLO26
Se ha lanzado la familia de modelos de visión artificial multitarea de extremo a extremo YOLO26. Con soporte para detección de objetos, segmentación de instancias, estimación de pose, detección de objetos orientados y clasificación de imágenes, la arquitectura abarca cinco variantes de tamaño, desde Nano hasta Extra Large. YOLO26 elimina la supresión no máxima (NMS) para reducir la latencia y elimina el módulo de pérdida focal de distribución (DFL) para mejorar la compatibilidad con hardware de borde y de bajo consumo. La variante YOLO26-N ofrece una inferencia de CPU hasta un 43% más rápida en comparación con YOLO11-N, y la arquitectura admite múltiples formatos de exportación, incluidos TFLite, CoreML, OpenVINO, TensorRT y ONNX.
- • YOLO26 es una familia de modelos de visión artificial multitarea de extremo a extremo que admite detección de objetos, segmentación, estimación de pose y clasificación.
- • La arquitectura elimina la supresión no máxima (NMS) y la pérdida focal de distribución (DFL) para reducir la latencia y mejorar la compatibilidad con hardware de borde.
- • La variante YOLO26-N ofrece una inferencia de CPU hasta un 43% más rápida en comparación con el modelo YOLO11-N.
- • Admite múltiples formatos de exportación, incluidos TFLite, CoreML, OpenVINO, TensorRT y ONNX.
- • Los benchmarks de rendimiento reportan 40.9–57.5 mAP en el dataset COCO con una latencia T4 de 1.7–11.8 ms.
Los desarrolladores pueden implementar un modelo de visión artificial multitarea altamente optimizado en hardware de borde o de bajo consumo con una latencia significativamente reducida.
6. Alibaba lanza el modelo de generación de video HappyHorse 1.1
Alibaba ha lanzado el modelo de generación de video por IA HappyHorse 1.1, diseñado específicamente para la integración de software empresarial. Disponible en Alibaba Cloud Model Studio, el modelo admite generación de texto a video, imagen a video, sujeto a video y edición de video. Está destinado a respaldar los flujos de trabajo de producción de video comercial desde la ideación hasta la postproducción. Para marcar el lanzamiento, Alibaba ofrece un descuento de lanzamiento del 40% en todo el sitio durante las dos primeras semanas de disponibilidad.
- • Alibaba lanzó el modelo de generación de video por IA HappyHorse 1.1, diseñado para la integración de software empresarial a través de API.
- • El modelo está disponible en Alibaba Cloud Model Studio y admite generación de texto a video, imagen a video, sujeto a video y edición de video.
- • Alibaba ofrece un descuento de lanzamiento del 40% en todo el sitio durante las dos primeras semanas de disponibilidad.
- • El modelo está optimizado para respaldar los flujos de trabajo de producción de video comercial desde la ideación hasta la postproducción.
Los desarrolladores pueden integrar un nuevo modelo de generación de video de grado empresarial en sus aplicaciones a través de API con un descuento temporal del 40%.
7. Lanzamiento del modelo DataClaw0 9B para adaptación de flujos multimodales
Se ha lanzado DataClaw0, un modelo de 9B diseñado para la adaptación agente de flujos de datos multimodales sin procesar. El modelo está construido para operar en cinco dominios distintos, filtrando el ruido de fuentes de datos de video, GUI y datos encarnados. Reorganiza las señales sin procesar en una supervisión densa mediante el uso de anclas factuales y síntesis semántica. El proceso de entrenamiento para DataClaw0 utilizó ajuste fino supervisado (SFT) y optimización de política relativa de grupo (GRPO). El lanzamiento también incluye un benchmark adjunto para evaluar el rendimiento.
- • DataClaw0 es un nuevo modelo de 9B diseñado para la adaptación agente de flujos de datos multimodales sin procesar en cinco dominios.
- • El modelo filtra el ruido de fuentes de datos de video, GUI y datos encarnados, reorganizando las señales mediante anclas factuales y síntesis semántica.
- • El proceso de entrenamiento utilizó ajuste fino supervisado (SFT) y optimización de política relativa de grupo (GRPO).
- • El lanzamiento incluye un benchmark adjunto para evaluar el rendimiento.
Los desarrolladores que procesan flujos de datos de video, GUI o datos encarnados sin procesar pueden usar un modelo especializado de 9B para filtrar el ruido y reorganizar las señales en datos estructurados.
8. Lanzamiento de Unlimited-OCR para análisis de documentos de largo alcance
Unlimited-OCR ha sido lanzado como un avance de código abierto de Deepseek-OCR, con su artículo de investigación adjunto publicado en arXiv. El modelo está disponible en ModelScope y Hugging Face, admitiendo inferencia local utilizando transformadores de Hugging Face en GPU NVIDIA, así como a través del servidor SGLang. Unlimited-OCR ofrece dos configuraciones de imagen: 'gundam' con un tamaño de imagen de 640 y 'base' con un tamaño de imagen de 1024. Los desarrolladores reconocen la influencia arquitectónica de Deepseek-OCR, Deepseek-OCR-2 y PaddleOCR.
- • Unlimited-OCR fue lanzado como un avance de código abierto de Deepseek-OCR, con el artículo de investigación publicado en arXiv.
- • El modelo está disponible en ModelScope y Hugging Face, admitiendo inferencia a través de transformadores y el servidor SGLang.
- • Ofrece dos configuraciones de imagen: 'gundam' (tamaño de imagen 640) y 'base' (tamaño de imagen 1024).
- • El proyecto se basa y reconoce la influencia de Deepseek-OCR, Deepseek-OCR-2 y PaddleOCR.
Los desarrolladores pueden ejecutar un nuevo modelo de análisis de documentos de código abierto y largo alcance localmente en GPU NVIDIA o a través de SGLang.
9. Ai2 lanza LLMs de agente de terminal Tmax con decodificación especulativa
Ai2 ha lanzado Tmax, una familia de LLMs de agente de terminal entrenados con aprendizaje por refuerzo DPPO sobre Qwen3.6. El modelo Tmax-27B logra aproximadamente un 43% en Terminal Bench 2.0 y un 69% en TB Lite. Las cuantizaciones GGUF calibradas por matriz de importancia que van de 2 a 5 bits por peso están disponibles para el modelo 27B. Crucialmente, cada cuantización incluye un cabezal de borrador MTP injertado en Q8_0 para admitir la decodificación especulativa incorporada. Las pruebas de agente en 10 instancias de SWE-rebench retenidas mostraron tasas de aprobación de entre el 50% y el 70% en diferentes niveles de cuantización, y los modelos se pueden acceder a través de Ollama o llama.cpp.
- • Ai2 lanzó Tmax, una familia de LLMs de agente de terminal entrenados con aprendizaje por refuerzo DPPO sobre Qwen3.6.
- • El modelo Tmax-27B logra un 43% en Terminal Bench 2.0 y un 69% en TB Lite.
- • Las cuantizaciones GGUF (2 a 5 bits por peso) están disponibles, cada una con un cabezal de borrador MTP injertado en Q8_0 para la decodificación especulativa.
- • Las pruebas de agente en instancias de SWE-rebench mostraron tasas de aprobación de entre el 50% y el 70% en diferentes niveles de cuantización.
- • Los modelos se pueden acceder localmente a través de Ollama o llama.cpp.
Los desarrolladores pueden ejecutar un modelo de agente de terminal especializado localmente en GPU pequeñas, utilizando la decodificación especulativa incorporada para una ejecución más rápida.
10. Pioneer lanza un enrutador de modelos para tareas de codificación
Pioneer ha lanzado un enrutador de modelos diseñado específicamente para tareas de codificación. La herramienta monitorea las solicitudes de inferencia y analiza la complejidad de la tarea en tiempo real para optimizar los flujos de trabajo de los desarrolladores. Al sugerir automáticamente opciones de modelos más ligeros cuando es apropiado, el enrutador ayuda a los desarrolladores a mejorar la velocidad de ejecución, reducir los costos de API y mantener la precisión de la tarea.
- • Pioneer lanzó un enrutador de modelos diseñado específicamente para optimizar los flujos de trabajo de codificación.
- • La herramienta monitorea las solicitudes de inferencia y analiza la complejidad de la tarea en tiempo real.
- • Sugiere automáticamente opciones de modelos más ligeros para mejorar la velocidad de ejecución, reducir costos y mantener la precisión.
Los desarrolladores pueden enrutar automáticamente las tareas de codificación al modelo más rentable y rápido según la complejidad de la tarea.
11. Claude Code cifra la salida de razonamiento de 'Extended Thinking'
Anthropic ha implementado el cifrado para el proceso de razonamiento de 'Extended Thinking' en Claude Code. La clave de cifrado es retenida por Anthropic, lo que significa que los datos de razonamiento sin procesar nunca se envían a la máquina local del usuario. En cambio, la API estándar de Claude Code proporciona un resumen del razonamiento. El acceso a la salida de pensamiento completa y sin cifrar está restringido a los usuarios que tienen un acuerdo empresarial activo.
- • El proceso de razonamiento de "Extended Thinking" en Claude Code está cifrado y las claves son retenidas por Anthropic.
- • Los datos de razonamiento nunca se envían a la máquina local del usuario; en cambio, la API de Claude Code proporciona un resumen del razonamiento.
- • El acceso a la salida de pensamiento completa y sin cifrar está restringido a los usuarios con un acuerdo empresarial activo.
Los desarrolladores que usan Claude Code deben saber que los pasos de razonamiento de "Extended Thinking" están cifrados y restringidos a acuerdos empresariales, con solo resúmenes disponibles a través de API estándar.
12. Almacenamiento de Hugging Face utilizado para datos masivos de robótica y video IA
Hugging Face se utiliza cada vez más como backend de almacenamiento para conjuntos de datos masivos de solo adición en aplicaciones de robótica y video IA. El número de conjuntos de datos de robótica públicos alojados en Hugging Face ha crecido de 1,000 a principios de 2025 a 60,000 actualmente, con el doble de conjuntos de datos privados alojados en la plataforma. Para admitir requisitos de gran ancho de banda, como un solo robot grabando a 140 MB/s, la transmisión directamente desde el Hugging Face Hub utilizando una caché precalentada permite a las GPU alcanzar velocidades de transferencia de datos de aproximadamente 1,326 MB/s. LeRobot se ha integrado con los buckets de almacenamiento de Hugging Face para facilitar estos flujos de trabajo de transmisión.
- • Hugging Face se utiliza cada vez más para alojar conjuntos de datos masivos de solo adición para robótica y video IA, con conjuntos de datos privados superando a los públicos en una proporción de dos a uno.
- • El número de conjuntos de datos de robótica públicos en la plataforma creció de 1,000 a principios de 2025 a 60,000 actualmente.
- • La transmisión directamente desde el Hugging Face Hub utilizando una caché precalentada permite a las GPU alcanzar velocidades de transferencia de aproximadamente 1,326 MB/s.
- • LeRobot se integra directamente con los buckets de almacenamiento de Hugging Face para facilitar estos flujos de trabajo de transmisión de alta velocidad.
Los desarrolladores que manejan conjuntos de datos masivos de solo adición para video o robótica pueden aprovechar los buckets de almacenamiento de Hugging Face para la transmisión de datos de GPU de alta velocidad.
13. Artificial Analysis lanza el índice de voz a voz
Artificial Analysis ha introducido el índice de voz a voz, una nueva métrica de síntesis diseñada para evaluar modelos nativos de voz a voz. El índice califica a los modelos en función de tres conjuntos de datos ponderados por igual: Big Bench Audio para razonamiento de voz, Full Duplex Bench para dinámicas conversacionales y 𝜏-Voice para rendimiento agente. GPT-Realtime-2 (High) de OpenAI lidera actualmente el índice con una puntuación de rendimiento del 77.2%, mientras que Deepslate Opal registró la velocidad más rápida con un tiempo hasta el primer audio (TTFA) de 0.44 segundos. Gemini 3.1 Flash Live Preview (Minimal) de Google fue identificado como el modelo de menor costo en el índice a $1.50 por hora de audio de entrada.
- • Artificial Analysis lanzó el índice de voz a voz para medir la calidad del modelo nativo de voz a voz en tres conjuntos de datos.
- • OpenAI GPT-Realtime-2 (High) lidera el índice con una puntuación de rendimiento del 77.2%, seguido por xAI Grok Voice Think Fast 1.0 con 75.7%.
- • Deepslate Opal registró la velocidad más rápida en el índice con un tiempo hasta el primer audio (TTFA) de 0.44 segundos.
- • Google Gemini 3.1 Flash Live Preview (Minimal) es el modelo de menor costo en el índice a $1.50 por hora de audio de entrada.
- • El índice evalúa los modelos en razonamiento de voz (Big Bench Audio), dinámicas conversacionales (Full Duplex Bench) y rendimiento agente (𝜏-Voice).
Los desarrolladores que crean aplicaciones de voz en tiempo real pueden usar un índice estandarizado para comparar la calidad, la latencia y el costo de los modelos nativos de voz a voz.
14. Nueva suite de benchmarks 'Will It Mythos?' evalúa la detección de errores de seguridad
Un desarrollador ha creado 'Will It Mythos?', una suite de benchmarks que contiene nueve errores de seguridad confirmados diseñados para probar si los modelos de IA pueden identificar vulnerabilidades de manera efectiva. El entorno de benchmark utiliza una configuración en contenedores con una verificación de fuente desinfectada y el directorio .git eliminado para evitar que los modelos accedan a datos de confirmación históricos. En las pruebas, Qwen 3.6 27B demostró un alto rendimiento, identificando más errores con menos falsos positivos que varios modelos comerciales más grandes. MiMo y DeepSeek también fueron competitivos con modelos de frontera como Opus 4.8 y GPT 5.5 a un precio significativamente más bajo, mientras que Gemma 4 MoE experimentó fallas de bucle con frecuencia.
- • Se creó una nueva suite de benchmarks que contiene nueve errores de seguridad confirmados para probar la identificación de vulnerabilidades en modelos de IA.
- • El entorno de benchmark utiliza una configuración en contenedores con una verificación de fuente desinfectada y el directorio .git eliminado para evitar fugas de confirmación históricas.
- • Qwen 3.6 27B demostró un alto rendimiento, identificando más errores con menos falsos positivos que varios modelos comerciales más grandes.
- • MiMo y DeepSeek demostraron ser competitivos con modelos de frontera como Opus 4.8 y GPT 5.5 a un precio significativamente más bajo.
- • El modelo Gemma 4 MoE logró una tasa de detección de 4/9 pero sufrió frecuentemente de fallas de bucle durante las pruebas.
Los desarrolladores pueden usar una nueva suite de benchmarks en contenedores para evaluar qué tan efectivamente los diferentes LLMs identifican vulnerabilidades de seguridad en su código.
15. Los agentes de conocimiento igualan el rendimiento de los modelos de frontera utilizando LLMs más pequeños
Tras la eliminación del modelo Mythos por parte de Anthropic, se ha desarrollado una nueva metodología para construir 'agentes de conocimiento' que igualan el rendimiento de modelos de IA de frontera más grandes. Al inyectar conocimiento específico y relevante en modelos más pequeños como Qwen 3.6 27B, los desarrolladores pueden lograr resultados de alta calidad. La metodología implica estructurar datos, incrustar y ejecutar múltiples pasadas de búsqueda para aumentar los LLMs para consultas especializadas y datos propietarios.
- • Una nueva metodología demuestra que los "agentes de conocimiento" pueden igualar el rendimiento de modelos de IA de frontera más grandes.
- • El enfoque combina modelos más pequeños, como Qwen 3.6 27B, con datos estructurados, incrustaciones y múltiples pasadas de búsqueda.
- • Esta técnica optimiza los LLMs para consultas especializadas y datos propietarios sin requerir modelos más grandes y costosos.
- • El lanzamiento se produce mientras Anthropic ha eliminado su modelo Mythos.
Los desarrolladores pueden usar datos estructurados, incrustaciones y búsqueda de múltiples pasadas para construir "agentes de conocimiento" que permitan a los modelos más pequeños igualar el rendimiento de los modelos de frontera.
16. Benchmark de TTS solo para CPU evalúa modelos de pesos abiertos
Un benchmark de extremo a extremo ejecutado por el agente de codificación de IA Neo evaluó tres modelos de texto a voz (TTS) de pesos abiertos en una CPU Intel Xeon con 4 núcleos y 15.6GB de RAM. La prueba comprendió 150 ejecuciones cronometradas en cinco configuraciones y seis longitudes de texto, calificando la calidad del audio utilizando la métrica UTMOS. Inflect-Nano-v1 logró la velocidad más rápida a 7.3x en tiempo real (RTF de 0.1376) pero produjo audio metálico y estuvo limitado por un tope de truncamiento de 15 segundos. Supertonic-3 de 5 pasos registró un RTF de 0.3164 y un MOS alto de 4.37. Kokoro-82M fue el modelo más lento probado, pero proporcionó la calidad de audio más humana, con su versión ONNX funcionando más rápido que PyTorch.
- • Un benchmark evaluó tres modelos TTS de pesos abiertos (Kokoro 82M, Supertonic 3 e Inflect-Nano-v1) en una CPU Intel Xeon de 4 núcleos.
- • Inflect-Nano-v1 fue el más rápido a 7.3x en tiempo real (RTF de 0.1376) pero está limitado por un tope de truncamiento de 15 segundos y audio metálico.
- • Supertonic-3 de 5 pasos logró un RTF de 0.3164 y una alta puntuación de calidad de audio de 4.37 MOS.
- • Kokoro-82M fue el modelo más lento probado, pero proporcionó la calidad de audio más humana, con su versión ONNX superando a PyTorch.
Los desarrolladores que crean funciones de voz pueden seleccionar el modelo TTS de pesos abiertos óptimo para entornos de bajo costo y solo para CPU según la velocidad y la calidad del audio.
17. Mimo 2.5 supera a sus competidores en inferencia local de alto contexto
Mimo 2.5 ha demostrado un rendimiento de alto contexto en GPU duales RTX Pro 6000 mediante la utilización de un mecanismo de atención de ventana deslizante local/global de 5 a 1. Por el contrario, MiniMax M3 y DeepSeek V4 experimentan una degradación significativa del rendimiento a alto contexto en GPU de grado consumidor porque sus kernels personalizados están diseñados para hardware Blackwell de centro de datos. El rendimiento de DeepSeek V4 cae a 14 tokens por segundo cuando las operaciones vuelven a la CPU, mientras que Step 3.7 Flash logra aproximadamente 40 tokens por segundo a 178k de contexto. En benchmarks de codificación privados, Mimo 2.5 completó tareas en aproximadamente 4 minutos, en comparación con 40 minutos para MiniMax M3, mientras que funcionaba a un nivel de calidad comparable a Claude 3.5 Sonnet.
- • Mimo 2.5 mantiene un rendimiento de alto contexto en GPU duales RTX Pro 6000 utilizando un mecanismo de atención de ventana deslizante local/global de 5 a 1.
- • Por el contrario, MiniMax M3 y DeepSeek V4 experimentan una degradación severa del rendimiento en GPU de consumidor porque sus kernels están optimizados para hardware Blackwell de centro de datos.
- • DeepSeek V4 cae a 14 tokens por segundo cuando vuelve a la CPU, mientras que Step 3.7 Flash logra 40 tokens por segundo a 178k de contexto.
- • En benchmarks de codificación privados, Mimo 2.5, MiniMax 2.7, MiniMax M3 y Step 3.7 Flash funcionan a un nivel de calidad comparable a Claude 3.5 Sonnet.
- • Mimo 2.5 completó el benchmark en 4 minutos, en comparación con 40 minutos para MiniMax M3.
Los desarrolladores que implementan modelos de alto contexto en GPU de estaciones de trabajo locales pueden lograr una inferencia más rápida eligiendo modelos optimizados con atención de ventana deslizante.
18. Lanzamiento de cuantizaciones GGUF optimizadas de Qwen3.6-27B para 16GB VRAM
El usuario cHunter789 ha lanzado dos nuevas cuantizaciones GGUF de Qwen3.6-27B optimizadas específicamente para GPU Nvidia con 16GB de VRAM. El modelo Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS.gguf se ha ajustado para priorizar la lógica para tareas de codificación sobre el conocimiento general, logrando una perplejidad de 7.4131 sobre 12 fragmentos a n_ctx=65536. El modelo Qwen3.6-27B.i1-IQ4_KS_KT-attn_qkv-IQ4_KS.gguf utiliza una cuantización de algoritmo Trellis experimental aplicada a tensores con distribuciones casi gaussianas, logrando una perplejidad de 7.4091. También se han creado versiones de predicción de múltiples tokens (MTP) para admitir la decodificación especulativa.
- • Dos nuevas cuantizaciones GGUF de Qwen3.6-27B optimizadas para 16GB VRAM y GPU Nvidia fueron lanzadas por el usuario cHunter789.
- • La variante IQ4_KS se ajusta para priorizar la lógica para tareas de codificación sobre el conocimiento general, logrando una perplejidad de 7.4131 a n_ctx=65536.
- • La variante IQ4_KS_KT utiliza una cuantización de algoritmo Trellis experimental en distribuciones casi gaussianas, logrando una perplejidad de 7.4091.
- • También se crearon versiones de predicción de múltiples tokens (MTP) para admitir la decodificación especulativa.
Los desarrolladores que ejecutan modelos locales en GPU Nvidia de 16GB VRAM pueden implementar cuantizaciones optimizadas de Qwen3.6-27B adaptadas para la lógica de codificación.
19. Anthropic actualiza su política de privacidad y términos de datos
Anthropic ha publicado una nueva Política de Privacidad, efectiva el 8 de julio de 2026, que rige la recopilación, el uso y el procesamiento de datos personales en su sitio web, Claude.ai y otros servicios. La política describe la recopilación de datos de identidad, contacto, pago y técnicos, así como las entradas y salidas del usuario. Se permite a los usuarios optar por no participar en el uso de sus entradas y salidas para el entrenamiento de modelos, excepto cuando se marquen para revisiones de seguridad o se informen explícitamente. La política también establece a Anthropic Ireland, Limited como el controlador de datos para la Región Europea y a Anthropic PBC para los usuarios fuera de esa región.
- • Anthropic publicó una nueva Política de Privacidad efectiva el 8 de julio de 2026, que rige la recopilación de datos para Claude.ai y otros servicios.
- • Los usuarios pueden optar por no participar en el uso de sus entradas y salidas para el entrenamiento de modelos, excepto cuando se marquen para revisiones de seguridad.
- • Anthropic no vende datos personales y utiliza cláusulas contractuales estándar para transferencias internacionales de datos.
- • Anthropic Ireland, Limited sirve como controlador de datos para la Región Europea, mientras que Anthropic PBC sirve como controlador para otras regiones.
Los desarrolladores que utilizan los servicios de Anthropic deben prepararse para los términos de privacidad actualizados y los posibles requisitos de verificación de identidad a partir del 8 de julio de 2026.
20. Anthropic requerirá verificación de identidad para cuentas de Claude marcadas
A partir del 8 de julio, Anthropic puede requerir verificación de identidad para un pequeño subconjunto de usuarios cuyas cuentas están marcadas pero no prohibidas. La compañía no ha especificado las circunstancias exactas o los desencadenantes bajo los cuales se pedirá a los usuarios que proporcionen documentos emitidos por el gobierno. Anthropic se ha asociado con Persona para servir como su proveedor de verificación de identidad para este proceso de verificación.
- • A partir del 8 de julio, Anthropic puede requerir verificación de identidad para un pequeño subconjunto de cuentas marcadas pero no prohibidas.
- • Anthropic utilizará Persona como su proveedor externo de verificación de identidad.
- • La compañía no ha especificado los desencadenantes exactos que provocarán una solicitud de documentos emitidos por el gobierno.
Los desarrolladores y usuarios de Claude deben ser conscientes de que Anthropic puede requerir verificación de identidad emitida por el gobierno para cuentas marcadas a partir del 8 de julio.