Inference Brew

Anthropic, Claude Opus 5.5 출시: 가격 인하 및 안전성 강화

00:00 / --:--

← 메인으로

Anthropic, Claude Opus 5.5 출시: 가격 인하 및 안전성 강화

1. Anthropic, Claude Opus 5.5 출시: 가격 인하 및 안전성 강화

Claude Opus 5와 Fable 5.1 시리즈 출시에 이어 Anthropic이 Claude Opus 5.5를 선보였습니다. 새로운 플래그십 모델은 기본 토큰 가격을 20% 인하하여 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 책정했으며, 캐시 읽기 비용은 60% 절감했습니다. Opus 5.5는 이전 모델보다 30% 더 빠르며, 경계 우회 시도를 85% 줄이고 민감한 사이버 보안 및 생물학 관련 질의를 자동 라우팅하는 등 더욱 엄격한 안전 장치를 도입했습니다.

  • • Claude Opus 5.5는 100만 토큰 컨텍스트 윈도우를 지원하는 Claude 5 제품군의 최신 모델입니다.
  • • 기본 가격은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 20% 인하되었으며, 캐시 읽기 비용은 100만 토큰당 0.20달러로 60% 절감되었습니다.
  • • 이 모델은 Opus 5보다 30% 이상 빠르며, 현재 Artificial Analysis Intelligence Index에서 58점으로 1위를 차지하고 있습니다.
  • • 강화된 안전 프로토콜을 통해 이전 버전 대비 경계 우회 시도를 85% 감소시켰습니다.
  • • 민감한 사이버 보안 및 생물학 관련 요청은 자동으로 이전 모델 버전(각각 Opus 4.8 및 Opus 5)으로 재라우팅됩니다.

개발자들은 기존 Claude 5 릴리스의 기능을 바탕으로, 현재 Artificial Analysis Intelligence Index에서 선두를 달리는 더욱 비용 효율적이고 안전한 플래그십 모델을 사용할 수 있게 되었습니다.

2. OpenAI, GPT-6 라인업에 Sol 및 Luna 모델 추가

OpenAI는 이달 초 에이전트형 GPT-6 Astra 모델을 처음 공개한 데 이어, GPT-6 Sol과 GPT-6 Luna를 정식 출시하며 GPT-6 모델 제품군을 확장했습니다. 이번 신규 모델들은 개발자들에게 고성능 Astra 모델에 대한 메인스트림 및 경제적인 대안을 제공하며, GPT-5.6 시리즈 대비 상당한 가격 인하와 개선된 환각(hallucination) 발생률을 특징으로 합니다.

  • • OpenAI가 Sol 및 Luna 모델을 출시하며 GPT-6 시리즈를 확장했습니다.
  • • GPT-6 Sol은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러입니다.
  • • GPT-6 Luna는 입력 100만 토큰당 0.10달러, 출력 100만 토큰당 0.50달러입니다.
  • • 두 모델 모두 환각 발생률이 개선되었으며, GPT-6 아키텍처에서 도입된 90% 프롬프트 캐시 할인을 유지합니다.
  • • GPT-6 Sol은 더 낮은 비용으로 AutomationBench 벤치마크에서 Claude Opus 5를 능가하는 성능을 보여줍니다.

개발자들은 이제 더 넓은 범위의 GPT-6 모델을 선택할 수 있게 되어, 새로운 아키텍처 전반에서 성능, 비용, 추론 능력 간의 균형을 맞출 수 있습니다.

3. Xiaomi, MiMo-V2.6 시리즈에 Flash 옴니모달 모델 추가

Xiaomi는 최근 MiMo-V2.6-Pro 출시에 이어 3D 장면 구성에서 에이전트를 조정하도록 설계된 Flash 옴니모달 모델을 출시했습니다. 또한 V2.6 시리즈에 대한 기술 보고서, 학습 환경 및 강화 학습 코드를 오픈소스로 공개했습니다. 두 모델 모두 100만 토큰 컨텍스트 윈도우를 지원하며 텍스트, 이미지, 음성 및 비디오 입력을 처리할 수 있습니다.

  • • Xiaomi는 기존에 발표된 MiMo-V2.6-Pro와 함께 Flash 옴니모달 모델을 출시했습니다.
  • • 이 모델들은 상호작용형 3D 장면을 구성하고 테스트하기 위한 에이전트 조정용으로 설계되었습니다.
  • • Xiaomi는 V2.6 시리즈의 기술 보고서, 학습 환경 및 강화 학습 코드를 오픈소스로 공개했습니다.
  • • 두 모델 모두 100만 토큰 컨텍스트 윈도우를 지원하며 텍스트, 이미지, 음성 및 비디오 입력을 처리합니다.

개발자들은 이제 새로운 Flash 모델을 포함한 MiMo-V2.6 제품군 전체와 상호작용형 3D 에이전트 워크플로우 구축을 위한 포괄적인 오픈소스 학습 자원을 활용할 수 있습니다.

4. StepFun, 100만 컨텍스트 윈도우를 갖춘 Step 5 Preview 출시

StepFun은 총 6000억 파라미터(활성 파라미터 270억)와 100만 토큰 컨텍스트 윈도우를 갖춘 새로운 플래그십 모델 Step 5 Preview를 출시했습니다. 이 모델은 텍스트, 이미지, 비디오 입력을 지원하며, Artificial Analysis Intelligence Index에서 Kimi K3 (max)와 동등한 성능을 보이면서도 작업당 비용은 2.8배 낮습니다. 현재 StepFun의 자체 API를 통해 입력 100만 토큰당 1달러, 출력 100만 토큰당 2.70달러에 이용 가능하며, 10월 15일에 가중치 공개(open weights)가 예정되어 있습니다.

  • • StepFun은 총 6000억 파라미터와 270억 활성 파라미터를 갖춘 플래그십 모델 Step 5 Preview를 출시했습니다.
  • • 이 모델은 100만 토큰 컨텍스트 윈도우를 지원하며 텍스트, 이미지, 비디오 입력을 처리합니다.
  • • Step 5 Preview는 Artificial Analysis Intelligence Index에서 Kimi K3 (max)와 동등한 성능을 내면서 작업당 비용은 2.8배 저렴합니다.
  • • 가격은 입력 100만 토큰당 1달러, 출력 100만 토큰당 2.70달러이며, 캐시된 입력은 100만 토큰당 0.05달러입니다.
  • • 이 모델은 StepFun API를 통해 이용 가능하며, 10월 15일에 가중치 공개가 예정되어 있습니다.

개발자들은 긴 컨텍스트 멀티모달 작업을 위한 매우 비용 효율적인 플래그십 모델을 확보하게 되었으며, 다음 달에는 가중치 공개 버전도 출시될 예정입니다.

5. AntLing, UI/UX 디자인 최적화 6B 모델 제품군 Ming-Image-0.1-Design 오픈소스 공개

AntLing은 6B Ming-Image-0.1-Design 및 6B Ming-Image-0.1-Design-Layer 모델로 구성된 Ming-Image-0.1-Design 모델 제품군을 오픈소스로 공개했습니다. UI/UX 작업에 특화된 이 기본 모델은 현재 Artificial Analysis UI/UX 디자인 리더보드에서 오픈 가중치 모델 중 1위를 차지하고 있습니다. 이번 릴리스에는 Ling UI 디자인 스킬과 이미지-편집 가능 PPT 스킬이라는 두 가지 오픈소스 에이전트 스킬도 포함되어 있습니다.

  • • AntLing은 6B 파라미터의 Ming-Image-0.1-Design 및 Ming-Image-0.1-Design-Layer 모델을 오픈소스로 공개했습니다.
  • • 이번 릴리스에는 Ling UI 디자인 스킬과 이미지-편집 가능 PPT 스킬이라는 두 가지 오픈소스 에이전트 스킬이 포함되어 있습니다.
  • • Ming-Image-0.1-Design은 Artificial Analysis UI/UX 디자인 리더보드에서 오픈 가중치 모델 중 1위를 차지하고 있습니다.

개발자들은 UI 디자인 및 편집 가능한 프레젠테이션 생성에 특화된 최상위권 오픈 가중치 모델을 직접 호스팅할 수 있습니다.

SOURCES

6. StepFun, 단어 오류율 1.7%의 StepAudio 3 ASR 출시

StepFun은 API를 통해 이용 가능한 새로운 비스트리밍 음성 인식(Speech to Text) 모델 StepAudio 3 ASR을 출시했습니다. 이 모델은 AA-WER 지수에서 1.7%의 단어 오류율(WER)을 기록하여 Alibaba의 Fun-Realtime-ASR-preview와 공동 1위를 차지했으며, StepAudio 2.5의 4.7% WER 대비 크게 개선되었습니다. 그러나 실시간 속도 대비 88배의 속도로, MAI-Transcribe-2(374배)와 같은 더 빠른 대안들에 비해 뒤처지며 시간당 0.40달러의 프리미엄 가격이 책정되었습니다.

  • • StepFun은 API를 통해 이용 가능한 비스트리밍 음성 인식 모델 StepAudio 3 ASR을 출시했습니다.
  • • 이 모델은 AA-WER 지수에서 1.7%의 단어 오류율(WER)을 기록하여 Alibaba의 Fun-Realtime-ASR-preview와 공동 1위를 차지했습니다.
  • • StepAudio 3 ASR의 전사 속도는 실시간 대비 88배로, MAI-Transcribe-2(374배)나 Grok Voice Transcribe 2.0(154배) 같은 경쟁사보다 느립니다.
  • • 가격은 시간당 0.40달러(1,000분당 6.67달러)로, 가장 정확한 5개 모델 중 가장 비쌉니다.

음성 기능을 구축하는 개발자들은 매우 정확한 음성 인식 옵션을 얻게 되었지만, 높은 비용과 더 빠른 대안들 사이에서 선택을 고려해야 합니다.

SOURCES

7. Qwen-Image 2.1, 이미지 생성을 위해 9B 프롬프트 재작성 모델 사용

Qwen-Image 2.1은 이미지 생성 전 사용자 요청을 확장하기 위해 9B 파라미터 프롬프트 재작성 모델을 활용합니다. 이 재작성 모델은 bf16 형식에서 20GB의 메모리를 필요로 하며, 1,700단어의 시스템 프롬프트를 사용하고 출력 전 약 1,600토큰의 '사고' 과정을 거칩니다. 리소스가 제한된 환경을 위해 노트북에서도 실행 가능한 0.8B 파라미터 압축 버전이 출시되었습니다.

  • • Qwen-Image 2.1은 이미지 생성 전 사용자 요청을 확장하기 위해 9B 파라미터 프롬프트 재작성 모델을 사용합니다.
  • • 9B 프롬프트 재작성 모델은 bf16 형식에서 20GB의 메모리가 필요하며 1,700단어의 시스템 프롬프트를 사용합니다.
  • • 재작성 모델은 답변 생성 전 약 1,600토큰 동안 사고합니다.
  • • 노트북에서 실행할 수 있는 0.8B 파라미터 압축 버전이 제공됩니다.

Qwen-Image 2.1의 프롬프트 확장 아키텍처를 이해하면 개발자가 이미지 생성 파이프라인과 하드웨어 요구 사항을 최적화하는 데 도움이 됩니다.

SOURCES

8. AWS, Strands 프레임워크를 새로운 Agent Harness에 통합

지난 6월 Strands Agents 프레임워크의 오픈소스 릴리스에 이어, AWS가 Strands Agent Harness를 출시했습니다. 이 새로운 서비스는 프레임워크를 관리형 실행 환경으로 전환하여 웹 검색, 명령 실행, 파일 편집 및 작업 위임 기능을 내장함으로써, 개발자가 LLM만 제공하면 즉시 에이전트를 배포할 수 있도록 지원합니다.

  • • AWS는 오픈소스 Strands Agents 프레임워크의 진화된 형태인 Strands Agent Harness를 출시했습니다.
  • • 이 Harness는 웹 검색, 명령 실행, 파일 편집을 위한 즉시 실행 가능한 환경을 제공합니다.
  • • 내장된 메모리 및 보조 에이전트에 대한 작업 위임 기능을 포함합니다.
  • • 개발자는 기본 LLM만 제공하면 실행을 시작할 수 있습니다.

개발자들은 이제 완전히 관리되는 AWS 환경 내에서 기존 Strands 프레임워크를 활용하여, 도구 실행 및 위임 기능이 내장된 에이전트 워크플로우 배포를 간소화할 수 있습니다.

SOURCES

9. DigitalOcean, 관리형 에이전트(Managed Agents) 퍼블릭 프리뷰 출시

DigitalOcean은 Claude Code, Codex 또는 사용자 정의 LangGraph 워크플로우와 같은 자율 에이전트를 실행하기 위해 특별히 설계된 서버리스 런타임 환경인 Managed Agents를 퍼블릭 프리뷰로 출시했습니다. 이 서비스는 75개 이상의 오픈소스 및 독점 모델을 지원하며, 청구를 통합하고 에이전트 도구를 위한 단일 관리형 엔드포인트를 제공합니다. 인프라 비용을 최적화하기 위해 관리형 런타임은 에이전트가 유휴 상태일 때 자동으로 일시 중지됩니다.

  • • DigitalOcean Managed Agents가 퍼블릭 프리뷰에 진입했습니다.
  • • 이 서비스는 Claude Code, Codex 또는 사용자 정의 LangGraph 에이전트를 유휴 시 일시 중지되는 런타임 환경에서 실행합니다.
  • • 75개 이상의 오픈소스 및 독점 모델을 지원합니다.
  • • 플랫폼은 에이전트 도구를 위한 단일 관리형 엔드포인트를 제공하고 청구를 통합합니다.

개발자들은 유휴 상태일 때 자동으로 일시 중지되어 비용을 절감하는 안전한 관리형 환경에서 자율 에이전트를 배포하고 실행할 수 있습니다.

SOURCES

10. Rabbit, BYOK 모델을 갖춘 에이전트 운영체제 OS3 출시

Rabbit은 회사의 R1 하드웨어(제조 중단됨) 없이도 Windows, Mac, Linux 기기에서 실행되도록 설계된 에이전트 운영체제 OS3를 발표했습니다. OS3는 사용자가 OpenAI나 Anthropic 같은 제공업체의 API 키를 직접 통합할 수 있는 'Bring Your Own Key'(BYOK) 모델로 작동합니다. 이 시스템은 사용자의 기기에서 로컬 에이전트 노드를 실행하여 소프트웨어 작업 수행, 코드 작성 및 디버깅을 처리하며, 필요한 파일, 앱 및 모델을 자동으로 조정합니다.

  • • Rabbit은 Windows, Mac, Linux 및 R1 기기에서 실행되는 에이전트 운영체제 OS3를 발표했습니다.
  • • OS3는 사용자가 OpenAI나 Anthropic의 API 키를 직접 제공하는 'Bring Your Own Key'(BYOK) 모델을 사용합니다.
  • • 플랫폼은 호스트 기기의 로컬 에이전트 노드를 사용하여 소프트웨어 작업 수행, 코드 작성 및 디버깅을 처리합니다.
  • • Rabbit은 R1 하드웨어 제조를 중단했으며, 향후 몇 달 내에 '바이브 코딩(vibe coding)'을 위한 'Cyberdeck' 기기를 출시할 계획입니다.

개발자와 파워 유저는 자신의 API 키를 사용하여 소프트웨어 작업을 수행하고 코드를 작성하는 로컬 에이전트 노드를 실행할 수 있습니다.

11. Firecrawl, 7,500만 달러 투자 유치 및 Alexandria 클라우드 서비스 출시

웹 스크래핑 스타트업 Firecrawl이 Smash Ventures가 주도하는 시리즈 B 펀딩 라운드에서 7,500만 달러를 유치했습니다. 투자와 함께 Firecrawl은 웹 스크래핑 데이터를 과학 초록 및 코드 파일과 같은 타사 및 큐레이팅된 데이터셋과 통합하는 새로운 클라우드 서비스 Alexandria를 출시했습니다. Alexandria는 이 데이터를 단일 API를 통해 노출하여 개발자가 사용자 정의 커넥터를 구축할 필요를 없애고, 스마트 대기(smart wait) 및 자동 양식 제출과 같은 Firecrawl의 에이전트 최적화 스크래핑 기능을 활용합니다.

  • • Firecrawl은 Smash Ventures가 주도하는 시리즈 B 펀딩 라운드에서 7,500만 달러를 유치했습니다.
  • • 플랫폼은 스마트 대기 및 자동 사용자 작업(스크롤, 클릭) 기능을 갖춘 AI 에이전트 최적화 웹 스크래핑 도구를 제공합니다.
  • • Firecrawl은 웹 데이터를 타사 및 큐레이팅된 데이터셋(과학 초록, 코드 파일)과 통합하는 새로운 클라우드 서비스 Alexandria를 출시했습니다.
  • • Alexandria는 단일 API를 통해 데이터를 제공하여 사용자 정의 커넥터 구축의 필요성을 제거합니다.

AI 에이전트를 구축하는 개발자들은 더 강력하고 자금력이 풍부한 스크래핑 플랫폼을 확보하게 되었으며, 웹 데이터를 큐레이팅된 코드 및 과학 데이터셋과 함께 액세스할 수 있는 통합 API를 사용할 수 있게 되었습니다.

SOURCES

12. Jev Catalog, 의사결정 모델을 위한 도구 및 통합 기능 큐레이션

Jev는 자유 형식의 텍스트를 생성하는 대신 옵션을 선택하거나, 예/아니오 확률을 제공하거나, 항목의 점수를 매겨 데이터 질의에 답하도록 설계된 특수 도구입니다. Jev를 통합하기 위해 개발자는 typesafe-sdk API 키로 구성된 공식 JavaScript, TypeScript 또는 Python SDK를 사용합니다. 브라우저 자동화 및 코딩 에이전트 지원 도구를 포함하여 36개의 검토된 프로젝트로 구성된 큐레이팅된 카탈로그가 4시간마다 업데이트되어 커뮤니티 통합 사례를 보여줍니다.

  • • Jev는 텍스트 생성 대신 옵션 선택, 예/아니오 확률 제공 또는 점수 매기기를 통해 질문에 답하는 도구입니다.
  • • 이 프로젝트는 typesafe-sdk와 TYPESAFE_API_KEY를 필요로 합니다.
  • • JavaScript, TypeScript 및 Python SDK를 통해 공식 지원이 제공됩니다.
  • • 큐레이팅된 카탈로그는 브라우저 자동화, 코딩 에이전트 지원 및 게임 도구를 포함한 36개의 엄선된 프로젝트를 제공합니다.

개발자들은 구조화된 의사결정 모델을 중심으로 구축된 36개 프로젝트 및 통합 사례의 큐레이팅된 카탈로그를 탐색할 수 있습니다.

SOURCES

13. 에이전트형 LLM을 사용한 Rust 코드 성능 최적화

한 개발자가 에이전트형 LLM을 사용하여 Rust 코드를 반복적으로 최적화하여 2배에서 20배의 성능 향상을 달성하는 매우 효과적인 방법을 문서화했습니다. 이 워크플로우는 구조화된 'Ur-Prompt'와 AGENTS.md 파일에 정의된 규칙 세트에 의존하여, 부정행위를 방지하면서 criterion crate를 사용한 벤치마킹을 통해 LLM을 안내합니다. 이 과정은 GPT-5.6 Luna 하위 에이전트를 사용하여 최적화 가설을 탐색하고, 성능 저하 없이 소스 코드 라인을 최소 20% 줄이는 리팩토링 단계를 포함합니다.

  • • 작성자는 LLM이 Rust 코드를 벤치마킹하고 최적화하도록 안내하는 'Ur-Prompt'와 AGENTS.md 규칙을 개발했습니다.
  • • 이 과정은 다양한 도메인에서 2배에서 20배에 이르는 성능 향상을 달성했습니다.
  • • 벤치마킹은 criterion crate를 사용하여 수행되며, 안전하지 않은 코드(unsafe code) 및 병렬 실행은 금지됩니다.
  • • 워크플로우는 GPT-5.6 Luna 하위 에이전트를 사용하여 최적화 가설을 탐색하고, 소스 코드 라인을 20% 줄이는 리팩토링 단계를 포함합니다.
  • • GPT-6 Astra와 같은 최신 프론티어 모델은 추가적인 2배~3배의 속도 향상을 위한 알고리즘 재구현 능력을 보여주었습니다.

개발자들은 구조화된 프롬프트 규칙과 하위 에이전트 워크플로우를 채택하여 로컬 코드베이스의 벤치마킹 및 최적화를 자동화할 수 있습니다.

SOURCES

14. Artificial Analysis, 다국어 지원 및 발음 벤치마크로 Speech Arena 확장

Artificial Analysis는 Controlled Voice Arena를 9개 언어(일본어, 중국어, 힌디어, 스페인어, 독일어, 프랑스어, 포르투갈어, 베트남어, 아랍어)로 확장하고 발음 견고성 벤치마크를 도입했습니다. 이번 업데이트는 영어 및 기타 주요 언어에서 모델 성능을 추적하던 기존 Speech Arena를 기반으로 합니다. 새로운 벤치마크는 454개의 까다로운 문장을 통해 TTS 모델을 평가하며, 현재 Google Gemini 3.1 Flash TTS가 88.1%의 정확도로 선두를 달리고 있습니다. 이 플랫폼에서 최고 성능으로 주목받았던 Cartesia의 Sonic 3.6은 새로 추가된 9개 언어 중 7개에서 선두를 차지하고 있습니다.

  • • Artificial Analysis는 Controlled Voice Arena에 일본어, 중국어, 아랍어 등 9개 언어를 추가했습니다.
  • • 새로운 발음 견고성 벤치마크는 454개 문장에 걸쳐 TTS 정확도를 평가합니다.
  • • Google Gemini 3.1 Flash TTS가 88.1%의 정확도로 새로운 발음 벤치마크를 선도하고 있습니다.
  • • Cartesia의 Sonic 3.6은 새로 추가된 9개 언어 중 7개에서 1위를 차지했습니다.
  • • Kokoro 82M v1.0은 초당 242자로 테스트된 모델 중 가장 빠르지만, 발음 견고성에서는 55.5%를 기록했습니다.

개발자들은 이제 확장된 언어 지원과 특정 발음 정확도 지표를 사용하여 글로벌 애플리케이션을 위한 TTS 모델을 평가할 수 있으며, 기존 Artificial Analysis 벤치마킹 제품군의 유용성을 확장할 수 있습니다.

15. Jev-클래스 모델 평가 표준화를 위한 JevBench 출시

구조화된 의사결정을 위해 설계된 특수 시스템인 Jev-클래스 모델 생태계가 계속 성장함에 따라, 개발자들이 JevBench를 출시했습니다. 이 오픈소스 벤치마킹 도구는 534개의 영어 의사결정 문제로 구성된 재현 가능한 Harness를 제공하여, 다양한 Jev 스타일 구현 전반에 걸쳐 지능, 보정, 속도 및 비용에 대한 표준화된 평가를 가능하게 합니다.

  • • JevBench는 Jev-클래스 모델을 평가하기 위한 표준화된 오픈소스 Harness를 제공합니다.
  • • 이 도구는 534개의 영어 의사결정 작업에 걸쳐 정확도, 보정, 지연 시간 및 비용을 측정합니다.
  • • 이번 릴리스는 상용, 오픈소스 및 DIY 구현을 포함한 Jev 스타일 모델의 성장하는 생태계를 지원합니다.
  • • Harness, 아티팩트 및 채점 코드는 GitHub에서 이용 가능합니다.

표준화된 벤치마킹을 통해 개발자들은 다양한 Jev-클래스 모델과 DIY 구현의 성능을 비교할 수 있어, 구조화된 의사결정 작업을 위한 더 나은 선택과 최적화가 가능해집니다.

SOURCES

16. TypeSafe AI, if문 최적화를 위한 Jev2 및 SemIf 모델 출시

9월 16일 Jev 프레임워크 출시에 이어, TypeSafe AI는 if-then 의사결정을 간소화하도록 특별히 설계된 두 가지 새로운 모델인 Jev2와 SemIf를 도입했습니다. 이 모델들은 원래의 Jev 아키텍처를 기반으로 하며, 테스트에서 비용을 99% 절감하고 정확도를 47%에서 80% 이상으로 향상시켜 AI 기반 조건부 로직의 경제성을 더욱 개선했습니다.

  • • Jev2와 SemIf는 if-then 의사결정을 최적화하기 위해 설계된 새로운 모델입니다.
  • • 이 모델들은 9월 16일 초기 Jev 프레임워크 출시에 이어 나왔습니다.
  • • 테스트 결과 비용 99% 절감 및 정확도 47%에서 80% 이상으로 향상됨을 보여줍니다.
  • • 이 모델들은 AI 생산 시스템의 경제성을 더욱 변화시키는 것을 목표로 합니다.

이 업데이트는 개발자들에게 복잡한 조건부 로직을 대체할 수 있는 더 전문적이고 효율적인 도구를 제공하며, 원래의 Jev 릴리스 대비 API 비용을 크게 낮춥니다.

SOURCES

17. 오픈소스 루트리스(Rootless) Linux 샌드박스 Drop, gVisor 지원 추가

Drop은 신뢰할 수 없는 타사 프로그램을 격리된 환경에서 실행하도록 설계된 오픈소스 루트리스 Linux 샌드박스로, LLM이 생성한 신뢰할 수 없는 코드를 실행하는 개발자에게 매우 유용합니다. 이 도구는 Linux 네임스페이스를 활용하여 격리를 강제하며, 쓰기 가능하고 일회용인 홈 디렉토리를 제공하는 동시에 구성 파일을 읽기 전용으로 마운트합니다. 최신 업데이트에서는 선택적 gVisor 사용자 공간 커널 지원을 도입하여 루트 권한 없이도 호스트 커널 익스플로잇에 대한 강화된 보호 기능을 제공합니다.

  • • Drop은 타사 프로그램을 격리된 환경에서 실행하도록 설계된 루트리스 Linux 샌드박스입니다.
  • • 이 도구는 Linux 네임스페이스(user, mount, network, PID, IPC, cgroup)를 사용하여 격리를 강제합니다.
  • • 쓰기 가능하고 일회용인 홈 디렉토리를 제공하며 구성 파일을 읽기 전용으로 마운트합니다.
  • • 최신 업데이트는 호스트 커널 익스플로잇으로부터 보호하기 위해 선택적 gVisor 사용자 공간 커널 지원을 추가했습니다.

에이전트 런타임을 구축하거나 LLM이 생성한 신뢰할 수 없는 코드를 실행하는 개발자들은 루트 권한 없이도 호스트 시스템을 보호하기 위해 Drop을 사용할 수 있습니다.

SOURCES

18. Cisco Talos, AI 통합 악성코드 분석을 위한 CAIRN 프레임워크 공개

Cisco Talos는 AI 통합 악성코드를 분류하고 분석하기 위해 CAIRN(Cognitive Artifact Intelligence Research Network)이라는 오픈소스 프레임워크를 출시했습니다. 연구원들은 CAIRN을 사용하여 4개의 LLM(DeepSeek, Qwen, Mistral, Google Gemini)을 자율적으로 폴링하여 행동을 결정하는 Windows 자격 증명 및 암호화폐 탈취 악성코드인 CLOSEDQUORUM을 식별했습니다. 이번 릴리스는 이전에 문서화된 LAMEHUG 악성코드가 Hugging Face를 통해 Qwen2.5-Coder와 통신한 것처럼, 공격자들이 LLM API를 운영화하는 증가하는 추세를 강조합니다.

  • • Cisco Talos는 AI 통합 악성코드를 분류하고 분석하기 위해 오픈소스 CAIRN 프레임워크를 출시했습니다.
  • • 연구원들은 CAIRN을 사용하여 DeepSeek, Qwen, Mistral, Gemini를 자율적으로 폴링하여 행동을 결정하는 Windows 악성코드 CLOSEDQUORUM을 식별했습니다.
  • • CLOSEDQUORUM은 로그인 자격 증명과 암호화폐를 훔치도록 설계되었습니다.
  • • 2025년 7월, Hugging Face API를 통해 Qwen2.5-Coder-32B-Instruct와 통신하는 LAMEHUG 악성코드를 사용하는 피싱 캠페인이 발견되었습니다.

개발자와 보안 팀은 CAIRN을 사용하여 공격을 조정하기 위해 LLM API를 사용하는 악성코드와 같은 새로운 AI 기반 위협을 분석할 수 있습니다.

SOURCES

19. 온프레미스 펜테스팅을 위한 Aikido Altar 오픈 가중치 모델 출시

Aikido Altar는 Aikido Machine의 펜테스팅 기능을 향상시키기 위해 설계된 오픈 가중치 AI 모델로 출시되었습니다. 주권 보안(sovereign security)을 위해 특별히 구축된 이 모델은 고객의 로컬 인프라 내에서 완전히 실행되므로, 개발자는 민감한 코드나 네트워크 데이터를 외부 클라우드 API에 노출하지 않고도 자동화된 보안 테스트를 수행할 수 있습니다.

  • • Aikido Altar는 Aikido Machine의 펜테스팅 기능을 향상시키기 위해 설계된 오픈 가중치 AI 모델입니다.
  • • 이 모델은 고객의 자체 인프라 내에서 완전히 작동하도록 구축되었습니다.

보안을 중시하는 개발자들은 민감한 데이터를 외부 API로 보내지 않고도 인프라를 스캔하기 위해 특수 펜테스팅 모델을 로컬에 배포할 수 있습니다.

SOURCES

20. Unsloth Studio에서 Qwen Image 2.1 Fast FP8 지원

사용자들은 Unsloth Studio를 사용하여 10GB 미만의 VRAM에서 Qwen Image 2.1(Fast FP8) 모델을 로컬에서 성공적으로 실행했다고 보고했습니다. 이 고성능, 저메모리 이미지 생성 옵션에 액세스하려면 개발자는 Unsloth Studio를 최신 버전으로 업데이트하는 것이 좋습니다.

  • • Qwen Image 2.1(Fast FP8)은 Unsloth Studio에서 10GB 미만의 VRAM으로 실행할 수 있습니다.
  • • 이 모델은 고성능으로 프리미엄 품질의 이미지를 생성합니다.
  • • 사용자는 최신 모델 옵션에 액세스하려면 Unsloth Studio를 업데이트해야 합니다.

개발자들은 낮은 메모리 요구 사항으로 소비자용 GPU에서 고품질 이미지 생성을 로컬에서 실행할 수 있습니다.

SOURCES

21. K2-Horizon 모델을 위한 GGUF 양자화 버전 제공

9월 3일 K2-Horizon 오픈 가중치 모델 제품군 출시에 이어, 양자화된 GGUF 버전이 Hugging Face에서 제공됩니다. 0.9B에서 36B MoVA 모델에 이르는 이 버전들은 로컬 실행을 가능하게 하지만, 현재 공식 지원이 보류 중이므로 llama.cpp의 특정 포크가 필요합니다.

  • • K2-Horizon 모델 시리즈의 양자화된 GGUF 버전이 Hugging Face에서 제공됩니다.
  • • 지원되는 모델은 K2-Horizon-MoVA-36B, 32B, 7B, 3.7B 및 0.9B입니다.
  • • 공식 지원이 진행 중이므로 로컬 실행에는 llama.cpp의 특정 포크가 필요합니다.

이 업데이트를 통해 개발자들은 초기 모델 가중치 릴리스를 확장하여 소비자 하드웨어에서 K2-Horizon 모델을 로컬로 실행할 수 있습니다.

SOURCES

22. GGUF 파일을 최적화하는 Dynamic Quantiser 도구

Dynamic Quantiser는 로컬 모델의 사용자 정의 고품질 GGUF 양자화를 생성하도록 설계된 새로운 오픈소스 도구입니다. Dinkelbach 알고리즘과 분리 가능한 Lagrangian 내부 루프를 사용하여 전체 모델 코사인 편차를 최소화함으로써, 각 텐서에 대한 최적의 양자화 수준을 결정합니다. 순수 텍스트 작업에서 Unsloth dynamic 3.0보다 성능은 낮지만, 표준 K-quants보다 더 정확하다고 보고되었습니다.

  • • Dynamic Quantiser는 사용자 정의 GGUF 양자화를 생성하기 위한 오픈소스 GitHub 저장소입니다.
  • • 이 도구는 Dinkelbach 알고리즘을 사용하여 모델 정확도를 향상시키기 위해 전체 모델 코사인 편차를 최소화합니다.
  • • 동적 양자화, 코사인 편차 최소화, 디스크 크기 최소화의 세 가지 알고리즘을 제공합니다.
  • • 순수 텍스트 작업에서 Unsloth dynamic 3.0보다 성능은 낮지만 표준 K-quants보다 정확합니다.
  • • 초기 테이블 구축은 Ryzen 5 3600 프로세서에서 27B 모델 기준 약 25분이 소요됩니다.

로컬 모델을 실행하는 개발자들은 표준 K-quants보다 뛰어난 매우 정확한 사용자 정의 양자화를 생성할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.