Inference Brew

Anthropic lanza Claude Opus 5 con pensamiento ajustable y seguridad de código relajada

00:00 / --:--

← Volver al inicio

Anthropic lanza Claude Opus 5 con pensamiento ajustable y seguridad de código relajada

1. Anthropic lanza Claude Opus 5 con pensamiento ajustable y seguridad de código relajada

Anthropic ha lanzado Claude Opus 5 como su nuevo modelo insignia, reemplazando a Claude Opus 4.8. El modelo está diseñado para tareas complejas y delimitadas, y sirve como el nuevo estándar para el nivel de consumo Claude Max. Se acerca a las capacidades de Claude Fable 5 en muchos dominios, mientras que tiene un mejor desempeño en tareas de codificación complejas. Para abordar la seguridad, Anthropic ha relajado las salvaguardas para permitir la detección de vulnerabilidades en el código fuente, manteniendo al mismo tiempo las restricciones en el escaneo basado en binarios y la generación de exploits. El modelo también presenta tasas más bajas de comportamiento engañoso y menores tasas de éxito de inyección indirecta de prompts. Además, Anthropic está trabajando con socios gubernamentales para realizar pruebas independientes del modelo.

  • Claude Opus 5 tiene un precio de 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida, igualando a su predecesor Opus 4.8.
  • El modelo cuenta con una ventana de contexto de 1 millón de tokens y admite hasta 128 mil tokens de salida en la API de mensajes síncronos.
  • El pensamiento (Thinking) está habilitado por defecto, con un parámetro de esfuerzo ajustable que controla la profundidad del razonamiento; establecer max_tokens con un esfuerzo superior a 4096 devuelve un error 400.
  • Anthropic ha relajado las salvaguardas de seguridad para permitir el escaneo de vulnerabilidades en el código fuente, manteniendo las restricciones en la generación de exploits.
  • Las nuevas funciones de la API incluyen un modo rápido (Fast) por el doble de precio, enrutamiento de respaldo automático y soporte para cambios de herramientas a mitad de la conversación.

Los desarrolladores obtienen un modelo insignia altamente capaz y rentable con controles de razonamiento nativos y menos restricciones en el análisis de seguridad del código fuente.

2. Microsoft extiende MAI-Image-2.5-Pro y MAI-Voice-2-Flash a vista previa pública

Basándose en la reciente integración de MAI-Image-2.5-Pro y MAI-Voice-2-Flash en productos principales como PowerPoint y Bing, Microsoft ha puesto estos modelos a disposición de los desarrolladores en vista previa pública. Este lanzamiento amplía el acceso a la generación de imágenes de alta fidelidad y a las capacidades de voz de baja latencia que antes estaban reservadas para el uso interno de los productos.

  • MAI-Image-2.5-Pro y MAI-Voice-2-Flash ya están disponibles en vista previa pública para desarrolladores.
  • Esto sigue a su reciente despliegue en productos de consumo de Microsoft como Bing y PowerPoint.
  • Los modelos ahora forman parte de la línea de modelos de producción de Microsoft para uso externo.

Los desarrolladores ahora pueden integrar los mismos modelos de alto rendimiento que impulsan las aplicaciones de consumo principales de Microsoft en su propio software.

SOURCES

3. El fork CachyLLama optimiza las sesiones de agentes locales con almacenamiento en caché KV persistente

CachyLLama es un fork de llama.cpp diseñado para optimizar el procesamiento repetido de prompts en hardware más lento. El proyecto cuenta con puntos de control KV persistentes respaldados por SSD y una caché de prompts del sistema para restaurar el contexto procesado previamente. Los puntos de control de CachyLLama son capaces de sobrevivir a reinicios del servidor. El software no aumenta la velocidad de generación, pero reduce el tiempo de evaluación de prompts al evitar trabajo redundante.

  • CachyLLama es un fork de llama.cpp que cuenta con puntos de control KV persistentes respaldados por SSD y una caché de prompts del sistema que sobrevive a los reinicios del servidor.
  • El software reduce los tiempos de evaluación de prompts, logrando tiempos de procesamiento en caliente de 0,99 segundos para 15.700 tokens en un sistema 7840U.
  • Admite arquitecturas híbridas, incluyendo Qwen 3.5/3.6, Gemma 4 y GLM-4.7.

Los desarrolladores que ejecutan agentes locales pueden eliminar la sobrecarga de procesamiento de prompts redundantes y mantener el contexto a través de reinicios del servidor.

SOURCES

4. Construya tuberías de OCR de alta resolución con el modelo Unlimited-OCR de 3B de Baidu

Un nuevo tutorial demuestra cómo construir una tubería de OCR de extremo a extremo utilizando el modelo de visión-lenguaje Unlimited-OCR de 3B de parámetros de Baidu. El flujo de trabajo está diseñado para ejecutarse en Google Colab en GPU compatibles con CUDA, con selección automática de precisión bfloat16 o float16 según la compatibilidad del hardware. La tubería incluye configuraciones para la generación de contexto largo, controles de repetición y manejo de salida estructurada para producir artefactos de texto, Markdown, MMD y JSON.

  • La tubería utiliza el modelo de visión-lenguaje Unlimited-OCR de 3B de parámetros de Baidu ejecutándose en GPU compatibles con CUDA con selección automática de bfloat16/float16.
  • Admite dos modos de inferencia: modo Gundam para recortes de imágenes en mosaico en diseños densos y modo Base para una vista única de 1024 píxeles.
  • Los PDF de varias páginas se analizan rasterizando las páginas en PNG usando PyMuPDF y procesándolas con la función infer_multi().
  • La tubería genera artefactos estructurados de texto, Markdown, MMD y JSON con controles para la generación de contexto largo y repetición.

Los desarrolladores pueden implementar una tubería de OCR de alta resolución y varias páginas localmente o en Colab con salidas estructuradas en Markdown y JSON utilizando un modelo ligero de 3B.

SOURCES

5. SupraLabs lanza un corpus de razonamiento de 5 millones de muestras para el ajuste fino de modelos pequeños

SupraLabs ha lanzado un conjunto de datos de corpus de razonamiento que contiene 5 millones de muestras en Hugging Face. El conjunto de datos está diseñado para facilitar el ajuste fino supervisado (SFT) y el entrenamiento de modelos de lenguaje pequeños (SLM). Todas las muestras están limitadas a una longitud de secuencia de 5.000 tokens para garantizar la compatibilidad con configuraciones de entrenamiento de bajos recursos.

  • El conjunto de datos contiene 5 millones de muestras y está alojado en Hugging Face como SupraLabs/reasoning-corpus-4K-5M-v1.
  • Cada muestra incluye un prompt de usuario, una traza de pensamiento del modelo, una respuesta del asistente, un ID de repositorio y la longitud total de tokens en formato ChatML.
  • Todas las muestras están limitadas a una longitud de secuencia de 5.000 tokens para facilitar el ajuste fino supervisado (SFT) de modelos pequeños.

Los desarrolladores pueden utilizar este corpus de razonamiento estructurado para ajustar modelos pequeños y específicos de tareas con trazas de pensamiento explícitas y un límite de secuencia de 5.000 tokens.

SOURCES

6. Noema Overfit permite que Gemma 4 26B se ejecute en iPhone mediante paginación de modelos en SSD

Noema ha lanzado una función llamada Noema Overfit en la aplicación Noema. Noema Overfit permite que modelos grandes, como la versión Gemma 4 26B A4B (Q4_K_M), se ejecuten en dispositivos como el iPhone 17 Pro utilizando una técnica de paginación. La técnica de paginación almacena los pesos no expertos en la RAM mientras lee los expertos del modelo desde el SSD. El sistema está diseñado para escenarios donde la precisión de la respuesta tiene prioridad sobre la velocidad y también es adecuado para MacBooks con poca RAM.

  • La función Noema Overfit en la aplicación Noema permite que el modelo Gemma 4 26B A4B se ejecute en dispositivos como el iPhone 17 Pro.
  • La técnica de paginación almacena los pesos no expertos en la RAM mientras lee dinámicamente los expertos del modelo desde el SSD.
  • Las pruebas en un iPhone 17 Pro arrojaron una velocidad de prellenado de 34,4 tokens por segundo y una velocidad de decodificación de 3,5 tokens por segundo.
  • El sistema está diseñado para escenarios de alta precisión donde la velocidad es secundaria, y también es compatible con MacBooks con poca RAM.

Los desarrolladores pueden implementar modelos de pesos abiertos más grandes y capaces directamente en hardware móvil y de consumo de bajas especificaciones aprovechando la paginación de pesos respaldada por SSD.

SOURCES

7. Hetzner lanza una API experimental gratuita de inferencia LLM para el modelo Qwen MoE

Hetzner ha lanzado un servicio experimental de inferencia LLM que actualmente es gratuito y carece de SLA o garantías de producción. El servicio proporciona una API compatible con OpenAI para el modelo Qwen/Qwen3.6-35B-A3B-FP8, que es un modelo de mezcla de expertos (Mixture-of-Experts) de 35 mil millones de parámetros con 3 mil millones de parámetros activos, una ventana de contexto de 262K y pesos cuantizados en FP8. Las ofertas de servidores GPU dedicados públicos de Hetzner consisten actualmente en GPU NVIDIA RTX 4000 SFF Ada Generation y NVIDIA RTX PRO 6000 Blackwell Max-Q.

  • El servicio experimental de inferencia LLM de Hetzner es actualmente gratuito y proporciona una API compatible con OpenAI sin SLA.
  • El servicio aloja el modelo Qwen/Qwen3.6-35B-A3B-FP8, un modelo MoE de 35B con 3B de parámetros activos y una ventana de contexto de 262K.
  • Las pruebas de referencia registraron un tiempo medio hasta el primer token de 153 ms y una velocidad de salida de 224 tokens por segundo.
  • La API incluye un parámetro enable_thinking no documentado para alternar el presupuesto de razonamiento del modelo.
  • Las opciones de servidores GPU dedicados públicos de Hetzner cuentan actualmente con GPU NVIDIA RTX 4000 SFF Ada y RTX PRO 6000 Blackwell Max-Q.

Los desarrolladores pueden probar un modelo MoE de 35B cuantizado y altamente receptivo de forma gratuita con un punto final compatible con OpenAI antes de realizar el despliegue en hardware GPU dedicado.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.