1. Anthropic, Slack 내 에이전트형 팀원 'Claude Tag' 출시
Anthropic은 Claude Enterprise 및 Team 고객을 대상으로 Claude Tag 베타 버전을 출시하며 기존 'Claude in Slack' 앱을 대체합니다. Claude Opus 4.8 모델 기반의 이 에이전트는 채널 맥락을 파악하고, 스레드에 참여하며, 비동기적으로 작업을 수행하는 자율적인 팀원 역할을 하도록 설계되었습니다. 관리자는 Claude Tag의 접근 권한을 특정 채널로 제한하고, 토큰 사용 한도를 설정하며, 수행된 모든 작업의 상세 로그를 검토할 수 있습니다. Anthropic은 자사 제품 팀이 이미 내부 버전의 도구를 사용하여 코드의 65%를 생성하고 있다고 밝혔습니다. 적격 조직에는 서비스 테스트를 위한 출시 기념 크레딧이 제공됩니다.
- • Anthropic은 Claude Enterprise 및 Team 고객을 위해 Claude Tag 베타를 출시하며 기존 Slack용 Claude 앱을 대체함.
- • 이 에이전트는 Claude Opus 4.8 모델로 구동되며 Slack 채널 내에서 상시 대기하는 지속적인 팀원 역할을 수행함.
- • 주요 기능으로는 다중 사용자 상호작용, 장기 기억, 능동적 환경 모니터링, 비동기 작업 실행 등이 있음.
- • 관리자는 Claude의 채널 접근 권한을 제한하고, 토큰 사용 한도를 설정하며, 상세 활동 로그를 검토할 수 있음.
- • Anthropic은 자사 제품 팀 코드의 65%가 현재 내부 버전의 Claude Tag에 의해 생성되고 있다고 보고함.
개발자는 Slack 채널에 직접 상주하는 자율형 AI 팀원을 배치하여 작업을 실행하고, 맥락을 학습하며, 코드를 작성하게 할 수 있습니다.
2. 추론 모델 'VibeThinker-3B', 주요 최첨단 모델 성능과 대등
VibeThinker-3B는 소형 언어 모델의 검증 가능한 추론을 연구하기 위해 개발된 30억 파라미터 밀집 모델입니다. Spectrum-to-Signal 사후 학습 패러다임(커리큘럼 기반 SFT, 다중 도메인 RL, 오프라인 자기 증류 포함)을 사용하여 학습된 이 모델은 AIME26에서 94.3점을 기록했으며, 테스트 타임 스케일링 적용 시 97.1점까지 향상되었습니다. 또한 LiveCodeBench v6에서 80.2의 Pass@1 점수를 기록했고, 최근 비공개 LeetCode 대회에서 96.1%의 수락률을 보였습니다. VibeThinker-3B는 높은 지시 제어 능력을 유지하면서도 추론 작업에서 DeepSeek V3.2, GLM-5, Gemini 3 Pro와 같은 대형 플래그십 모델의 성능과 대등하거나 그 이상의 결과를 보여줍니다.
- • VibeThinker-3B는 새로운 Spectrum-to-Signal 사후 학습 패러다임(SFT + GRPO)을 사용하여 학습된 30억 파라미터 밀집 모델임.
- • AIME26에서 94.3점(테스트 타임 스케일링 시 97.1점)을 기록하고 LiveCodeBench v6에서 80.2의 Pass@1을 달성함.
- • 추론 작업에서 DeepSeek V3.2, GLM-5, Gemini 3 Pro와 같은 대형 플래그십 모델의 성능과 대등하거나 능가함.
- • IFEval 벤치마크에서 93.4점을 기록하며 높은 지시 제어 능력을 유지함.
개발자는 코딩 및 수학 벤치마크에서 높은 추론 성능을 발휘하는 30억 파라미터 규모의 소형 모델을 활용할 수 있습니다.
3. Mistral AI, 다국어 문서 모델 'Mistral OCR 4' 출시
Mistral AI는 텍스트, 경계 상자, 블록 분류 및 인라인 신뢰도 점수를 추출하는 문서 이해 모델 Mistral OCR 4를 출시했습니다. 10개 언어 그룹에 걸쳐 170개 언어를 지원하는 이 모델은 엔터프라이즈 검색, RAG 및 도메인별 검색 파이프라인에 최적화되어 있습니다. 엄격한 데이터 규정 준수 요구 사항을 충족하기 위해 자체 호스팅 환경의 단일 컨테이너로 배포할 수 있습니다. Mistral OCR 4는 Mistral Search Toolkit에 통합되어 있으며 Mistral Studio, Amazon SageMaker, Microsoft Foundry를 통해 이용 가능하고, 곧 Snowflake 지원도 추가될 예정입니다.
- • Mistral AI는 10개 언어 그룹에 걸쳐 170개 언어를 지원하는 문서 이해 모델 Mistral OCR 4를 출시함.
- • 이 모델은 추출된 텍스트, 경계 상자, 블록 분류 및 인라인 신뢰도 점수를 제공함.
- • API 가격은 1,000페이지당 4달러이며, Batch-API 사용 시 1,000페이지당 2달러의 할인 요금이 적용됨.
- • 데이터 규정 준수를 위해 자체 호스팅 환경의 단일 컨테이너로 배포 가능함.
- • Mistral Studio, Amazon SageMaker, Microsoft Foundry를 통해 이용 가능하며 곧 Snowflake Parse Document 지원 예정.
개발자는 API 또는 자체 호스팅 컨테이너를 통해 고도로 다국어화된 문서 이해 모델을 RAG 및 검색 파이프라인에 통합할 수 있습니다.
4. Krea, 오픈 가중치 이미지 모델 'Krea 2 Raw' 및 'Turbo' 출시
Krea는 120억 파라미터 Diffusion Transformer 아키텍처를 기반으로 한 Krea 2 AI 이미지 모델 제품군을 Hugging Face에 공개했습니다. Krea 2 Raw는 구조적 학습 및 파인튜닝을 위해 설계된 비증류 베이스 모델이며, Krea 2 Turbo는 2초 만에 생성이 가능한 속도 최적화 증류 버전입니다. Krea 2 커뮤니티 라이선스는 개인 및 최대 50석 규모의 소규모 기업에 무료 상업적 사용을 허용합니다. 모든 사용자는 불법적이거나 유해한 자료 생성을 방지하기 위한 기술적 안전장치를 구현해야 할 계약상 의무가 있습니다.
- • Krea는 Krea 2 Raw 및 Krea 2 Turbo를 Hugging Face에서 다운로드 가능한 오픈 가중치 모델로 출시함.
- • Krea 2 Turbo는 2초의 생성 속도를 자랑하며 가장 빠른 이미지 생성 모델 중 하나임.
- • 이 모델들은 120억 파라미터 Diffusion Transformer 아키텍처를 기반으로 함.
- • Krea 2 커뮤니티 라이선스는 개인 및 최대 50석 규모의 기업에 무료 상업적 사용을 허용함.
- • 사용자는 불법적이거나 유해한 자료 생성을 방지하기 위한 기술적 안전장치를 구현해야 함.
개발자는 소규모 팀을 위한 무료 상업적 사용 라이선스가 포함된 빠르고 강력한 120억 파라미터 이미지 생성 모델을 자체 호스팅할 수 있습니다.
5. 다중 작업 컴퓨터 비전 모델 제품군 'YOLO26' 출시
엔드투엔드 다중 작업 컴퓨터 비전 모델 제품군인 YOLO26이 출시되었습니다. 객체 탐지, 인스턴스 분할, 자세 추정, 방향성 객체 탐지 및 이미지 분류를 지원하며 Nano부터 Extra Large까지 5가지 크기 변형을 제공합니다. YOLO26은 지연 시간을 줄이기 위해 비최대 억제(NMS)를 제거하고, 엣지 및 저전력 하드웨어와의 호환성을 개선하기 위해 분포 초점 손실(DFL) 모듈을 삭제했습니다. YOLO26-N 변형은 YOLO11-N 대비 최대 43% 더 빠른 CPU 추론 속도를 제공하며, TFLite, CoreML, OpenVINO, TensorRT, ONNX 등 다양한 내보내기 형식을 지원합니다.
- • YOLO26은 객체 탐지, 분할, 자세 추정 및 분류를 지원하는 엔드투엔드 다중 작업 컴퓨터 비전 모델 제품군임.
- • NMS와 DFL을 제거하여 지연 시간을 줄이고 엣지 하드웨어 호환성을 개선함.
- • YOLO26-N 변형은 YOLO11-N 모델 대비 최대 43% 더 빠른 CPU 추론 속도를 제공함.
- • TFLite, CoreML, OpenVINO, TensorRT, ONNX 등 다양한 내보내기 형식을 지원함.
- • COCO 데이터셋에서 40.9~57.5 mAP 및 1.7~11.8ms의 T4 지연 시간을 기록함.
개발자는 지연 시간이 크게 단축된 고도로 최적화된 다중 작업 컴퓨터 비전 모델을 엣지 또는 저전력 하드웨어에 배포할 수 있습니다.
6. Alibaba, 비디오 생성 모델 'HappyHorse 1.1' 출시
Alibaba는 엔터프라이즈 소프트웨어 통합을 위해 설계된 AI 비디오 생성 모델 HappyHorse 1.1을 출시했습니다. Alibaba Cloud Model Studio에서 이용 가능한 이 모델은 텍스트-비디오, 이미지-비디오, 피사체-비디오 생성 및 비디오 편집을 지원합니다. 아이디어 구상부터 후반 작업까지 상업용 비디오 제작 워크플로우를 지원하도록 설계되었습니다. 출시를 기념하여 Alibaba는 출시 후 첫 2주 동안 사이트 전체에서 40% 할인 혜택을 제공합니다.
- • Alibaba는 API를 통한 엔터프라이즈 소프트웨어 통합을 위해 설계된 HappyHorse 1.1 비디오 생성 모델을 출시함.
- • Alibaba Cloud Model Studio에서 이용 가능하며 텍스트-비디오, 이미지-비디오, 피사체-비디오 및 비디오 편집을 지원함.
- • 출시 후 첫 2주 동안 사이트 전체에서 40% 할인 혜택을 제공함.
- • 아이디어 구상부터 후반 작업까지 상업용 비디오 제작 워크플로우를 지원하도록 최적화됨.
개발자는 API를 통해 새로운 엔터프라이즈급 비디오 생성 모델을 애플리케이션에 통합할 수 있으며, 한시적으로 40% 할인 혜택을 받을 수 있습니다.
7. 멀티모달 스트림 처리를 위한 'DataClaw0 9B' 모델 출시
원시 멀티모달 데이터 스트림의 에이전트형 처리를 위해 설계된 90억 파라미터 모델 DataClaw0가 출시되었습니다. 이 모델은 5개의 서로 다른 도메인에서 작동하며 비디오, GUI 및 구현된 데이터 소스에서 노이즈를 필터링하도록 구축되었습니다. 사실적 앵커와 의미론적 합성을 사용하여 원시 신호를 밀집된 감독 데이터로 재구성합니다. DataClaw0의 학습 과정에는 지도 미세 조정(SFT)과 그룹 상대 정책 최적화(GRPO)가 사용되었습니다. 이번 출시에는 성능 평가를 위한 벤치마크도 포함되어 있습니다.
- • DataClaw0는 5개 도메인에 걸쳐 원시 멀티모달 데이터 스트림을 에이전트형으로 처리하기 위해 설계된 새로운 90억 파라미터 모델임.
- • 비디오, GUI 및 구현된 데이터 소스에서 노이즈를 필터링하고 사실적 앵커와 의미론적 합성을 사용하여 신호를 재구성함.
- • 학습 과정에는 지도 미세 조정(SFT)과 그룹 상대 정책 최적화(GRPO)가 사용됨.
- • 성능 평가를 위한 벤치마크가 함께 제공됨.
원시 비디오, GUI 또는 구현된 데이터 스트림을 처리하는 개발자는 특수 90억 파라미터 모델을 사용하여 노이즈를 필터링하고 신호를 구조화된 데이터로 재구성할 수 있습니다.
8. 장기 문서 파싱을 위한 'Unlimited-OCR' 출시
Unlimited-OCR이 Deepseek-OCR의 오픈 소스 발전형으로 출시되었으며, 관련 연구 논문이 arXiv에 게재되었습니다. 이 모델은 ModelScope와 Hugging Face에서 이용 가능하며, NVIDIA GPU에서 Hugging Face 트랜스포머를 사용한 로컬 추론과 SGLang 서버를 통한 추론을 지원합니다. Unlimited-OCR은 640 이미지 크기의 'gundam'과 1024 이미지 크기의 'base'라는 두 가지 이미지 구성을 제공합니다. 개발자들은 Deepseek-OCR, Deepseek-OCR-2 및 PaddleOCR의 아키텍처적 영향을 인정했습니다.
- • Unlimited-OCR은 Deepseek-OCR의 오픈 소스 발전형으로 출시되었으며 연구 논문이 arXiv에 게재됨.
- • ModelScope와 Hugging Face에서 이용 가능하며 트랜스포머 및 SGLang 서버를 통한 추론을 지원함.
- • 640 이미지 크기의 'gundam'과 1024 이미지 크기의 'base'라는 두 가지 이미지 구성을 제공함.
- • Deepseek-OCR, Deepseek-OCR-2 및 PaddleOCR의 영향을 받았음을 명시함.
개발자는 새로운 오픈 소스 장기 문서 파싱 모델을 NVIDIA GPU에서 로컬로 실행하거나 SGLang을 통해 실행할 수 있습니다.
9. Ai2, 추측적 디코딩을 지원하는 'Tmax' 터미널 에이전트 LLM 출시
Ai2는 Qwen3.6을 기반으로 DPPO 강화 학습을 거친 터미널 에이전트 LLM 제품군 Tmax를 출시했습니다. Tmax-27B 모델은 Terminal Bench 2.0에서 약 43%, TB Lite에서 69%의 성능을 달성합니다. 27B 모델의 경우 2~5비트 가중치 범위의 중요도 행렬 보정 GGUF 양자화 버전을 사용할 수 있습니다. 중요한 점은 각 양자화 버전에 추측적 디코딩을 지원하기 위해 Q8_0의 grafted MTP 드래프트 헤드가 포함되어 있다는 것입니다. 10개의 보류된 SWE-rebench 인스턴스에 대한 에이전트 테스트 결과, 다양한 양자화 수준에서 50%~70%의 통과율을 보였으며 Ollama 또는 llama.cpp를 통해 모델에 접근할 수 있습니다.
- • Ai2는 Qwen3.6 기반으로 DPPO 강화 학습을 거친 터미널 에이전트 LLM 제품군 Tmax를 출시함.
- • Tmax-27B 모델은 Terminal Bench 2.0에서 43%, TB Lite에서 69%의 성능을 달성함.
- • 2~5비트 GGUF 양자화 버전을 사용할 수 있으며, 추측적 디코딩을 위해 Q8_0의 MTP 드래프트 헤드가 포함됨.
- • SWE-rebench 인스턴스 테스트에서 양자화 수준에 따라 50%~70%의 통과율을 보임.
- • Ollama 또는 llama.cpp를 통해 로컬에서 모델에 접근 가능함.
개발자는 내장된 추측적 디코딩을 활용하여 더 빠른 실행 속도를 내는 특수 터미널 에이전트 모델을 소형 GPU에서 로컬로 실행할 수 있습니다.
10. Pioneer, 코딩 작업을 위한 'Model Router' 출시
Pioneer는 코딩 작업을 위해 특별히 설계된 모델 라우터를 출시했습니다. 이 도구는 추론 요청을 모니터링하고 작업 복잡성을 실시간으로 분석하여 개발자 워크플로우를 최적화합니다. 적절한 경우 더 가벼운 모델 옵션을 자동으로 제안함으로써 개발자가 실행 속도를 개선하고, API 비용을 절감하며, 작업 정확도를 유지하도록 돕습니다.
- • Pioneer는 코딩 워크플로우 최적화를 위해 설계된 모델 라우터를 출시함.
- • 이 도구는 추론 요청을 모니터링하고 작업 복잡성을 실시간으로 분석함.
- • 실행 속도 개선, 비용 절감 및 정확도 유지를 위해 더 가벼운 모델 옵션을 자동으로 제안함.
개발자는 작업 복잡성에 따라 코딩 작업을 가장 비용 효율적이고 빠른 모델로 자동 라우팅할 수 있습니다.
11. Claude Code, 'Extended Thinking' 추론 출력 암호화
Anthropic은 Claude Code의 'Extended Thinking' 추론 과정을 암호화했습니다. 암호화 키는 Anthropic이 보유하므로 원시 추론 데이터는 사용자의 로컬 머신으로 전송되지 않습니다. 대신 표준 Claude Code API가 추론 요약을 제공합니다. 암호화되지 않은 전체 추론 출력에 대한 접근 권한은 활성 엔터프라이즈 계약을 체결한 사용자로 제한됩니다.
- • Claude Code의 'Extended Thinking' 추론 과정은 암호화되며 키는 Anthropic이 보유함.
- • 추론 데이터는 로컬 머신으로 전송되지 않으며, Claude Code API는 추론 요약본만 제공함.
- • 암호화되지 않은 전체 추론 출력에 대한 접근은 활성 엔터프라이즈 계약을 체결한 사용자로 제한됨.
Claude Code를 사용하는 개발자는 전체 'Extended Thinking' 추론 단계가 암호화되어 엔터프라이즈 계약으로 제한되며, 표준 API를 통해서는 요약본만 제공된다는 점을 알아야 합니다.
12. Hugging Face Storage, 대규모 로봇 공학 및 비디오 AI 데이터에 활용
Hugging Face는 로봇 공학 및 비디오 AI 애플리케이션에서 대규모의 추가 전용(append-only) 데이터셋을 위한 스토리지 백엔드로 점점 더 많이 활용되고 있습니다. Hugging Face에 호스팅된 공개 로봇 공학 데이터셋 수는 2025년 초 1,000개에서 현재 60,000개로 증가했으며, 플랫폼에는 그보다 두 배 많은 비공개 데이터셋이 호스팅되어 있습니다. 초당 140MB로 기록하는 로봇과 같은 높은 대역폭 요구 사항을 지원하기 위해, 사전 예열된 캐시를 사용하여 Hugging Face Hub에서 직접 스트리밍하면 GPU가 약 1,326MB/s의 데이터 전송 속도를 달성할 수 있습니다. LeRobot은 이러한 스트리밍 워크플로우를 촉진하기 위해 Hugging Face Storage 버킷과 통합되었습니다.
- • Hugging Face는 로봇 공학 및 비디오 AI를 위한 대규모 추가 전용 데이터셋 호스팅에 사용되며, 비공개 데이터셋이 공개 데이터셋보다 두 배 많음.
- • 플랫폼의 공개 로봇 공학 데이터셋 수는 2025년 초 1,000개에서 현재 60,000개로 증가함.
- • 사전 예열된 캐시를 사용하여 Hugging Face Hub에서 직접 스트리밍하면 GPU가 약 1,326MB/s의 전송 속도를 달성할 수 있음.
- • LeRobot은 이러한 고속 스트리밍 워크플로우를 촉진하기 위해 Hugging Face Storage 버킷과 직접 통합됨.
비디오 또는 로봇 공학을 위한 대규모 추가 전용 데이터셋을 다루는 개발자는 Hugging Face Storage 버킷을 활용하여 고속 GPU 데이터 스트리밍을 구현할 수 있습니다.
13. Artificial Analysis, 'Speech to Speech Index' 출시
Artificial Analysis는 네이티브 음성-음성 모델을 평가하기 위해 설계된 새로운 합성 지표인 Speech to Speech Index를 도입했습니다. 이 지표는 음성 추론을 위한 Big Bench Audio, 대화 역학을 위한 Full Duplex Bench, 에이전트 성능을 위한 𝜏-Voice 등 3개의 동일한 가중치를 가진 데이터셋을 기반으로 모델 점수를 매깁니다. OpenAI의 GPT-Realtime-2 (High)가 77.2%의 성능 점수로 현재 지표를 선도하고 있으며, Deepslate Opal은 0.44초의 첫 오디오 응답 시간(TTFA)으로 가장 빠른 속도를 기록했습니다. Google의 Gemini 3.1 Flash Live Preview (Minimal)는 입력 오디오 시간당 1.50달러로 지표에서 가장 저렴한 모델로 확인되었습니다.
- • Artificial Analysis는 3개의 데이터셋을 통해 네이티브 음성-음성 모델 품질을 측정하는 Speech to Speech Index를 출시함.
- • OpenAI GPT-Realtime-2 (High)가 77.2%의 성능 점수로 1위, xAI Grok Voice Think Fast 1.0이 75.7%로 그 뒤를 이음.
- • Deepslate Opal은 0.44초의 첫 오디오 응답 시간(TTFA)으로 가장 빠른 속도를 기록함.
- • Google Gemini 3.1 Flash Live Preview (Minimal)는 입력 오디오 시간당 1.50달러로 가장 저렴한 모델임.
- • 음성 추론(Big Bench Audio), 대화 역학(Full Duplex Bench), 에이전트 성능(𝜏-Voice)을 기준으로 모델을 평가함.
실시간 음성 애플리케이션을 구축하는 개발자는 표준화된 지표를 사용하여 네이티브 음성-음성 모델의 품질, 지연 시간 및 비용을 비교할 수 있습니다.
14. 보안 버그 탐지 평가를 위한 'Will It Mythos?' 벤치마크 제품군 출시
한 개발자가 AI 모델이 취약점을 효과적으로 식별할 수 있는지 테스트하기 위해 9개의 확인된 보안 버그가 포함된 벤치마크 제품군 'Will It Mythos?'를 만들었습니다. 벤치마크 환경은 모델이 과거 커밋 데이터에 접근하는 것을 방지하기 위해 .git 디렉토리가 제거된 소스 체크아웃을 포함하는 컨테이너화된 설정을 사용합니다. 테스트에서 Qwen 3.6 27B는 여러 대형 상업용 모델보다 더 많은 버그를 식별하고 오탐지는 줄이는 높은 성능을 보여주었습니다. MiMo와 DeepSeek는 Opus 4.8 및 GPT 5.5와 같은 최첨단 모델과 경쟁하면서도 훨씬 낮은 가격대를 유지했으며, Gemma 4 MoE는 반복적인 루핑 오류를 자주 경험했습니다.
- • AI 모델의 취약점 식별 능력을 테스트하기 위해 9개의 확인된 보안 버그가 포함된 새로운 벤치마크 제품군이 생성됨.
- • 벤치마크 환경은 과거 커밋 데이터 유출을 방지하기 위해 .git 디렉토리가 제거된 컨테이너화된 설정을 사용함.
- • Qwen 3.6 27B는 여러 대형 상업용 모델보다 더 많은 버그를 식별하고 오탐지는 줄이는 높은 성능을 보여줌.
- • MiMo와 DeepSeek는 Opus 4.8 및 GPT 5.5와 같은 최첨단 모델과 경쟁하면서도 훨씬 낮은 가격대를 유지함.
- • Gemma 4 MoE 모델은 4/9의 탐지율을 기록했으나 테스트 중 반복적인 루핑 오류를 자주 겪음.
개발자는 새로운 컨테이너화된 벤치마크 제품군을 사용하여 다양한 LLM이 코드 내 보안 취약점을 얼마나 효과적으로 식별하는지 평가할 수 있습니다.
15. 소형 LLM을 활용한 '지식 에이전트', 최첨단 모델 성능과 대등
Anthropic의 Mythos 모델 제거 이후, 대형 최첨단 AI 모델의 성능과 대등한 '지식 에이전트'를 구축하기 위한 새로운 방법론이 개발되었습니다. Qwen 3.6 27B와 같은 소형 모델에 구체적이고 관련성 높은 지식을 주입함으로써 개발자는 고품질의 결과를 얻을 수 있습니다. 이 방법론은 데이터 구조화, 임베딩 및 다중 검색 패스 실행을 포함하여 전문적인 쿼리 및 독점 데이터를 위해 LLM을 보강합니다.
- • 새로운 방법론은 '지식 에이전트'가 대형 최첨단 AI 모델의 성능과 대등할 수 있음을 보여줌.
- • 이 접근 방식은 Qwen 3.6 27B와 같은 소형 모델을 구조화된 데이터, 임베딩 및 다중 검색 패스와 결합함.
- • 이 기술은 더 크고 비싼 모델 없이도 전문적인 쿼리 및 독점 데이터를 위해 LLM을 최적화함.
- • 이번 출시는 Anthropic이 Mythos 모델을 제거한 시점에 이루어짐.
개발자는 구조화된 데이터, 임베딩 및 다중 패스 검색을 사용하여 소형 모델이 최첨단 모델의 성능과 대등하게 작동하도록 하는 '지식 에이전트'를 구축할 수 있습니다.
16. CPU 전용 TTS 벤치마크, 오픈 가중치 모델 평가
AI 코딩 에이전트 Neo가 실행한 엔드투엔드 벤치마크는 4코어 Intel Xeon CPU와 15.6GB RAM 환경에서 3개의 오픈 가중치 텍스트-음성 변환(TTS) 모델을 평가했습니다. 테스트는 5가지 구성과 6가지 텍스트 길이에 걸쳐 150회의 시간 측정 실행으로 구성되었으며, UTMOS 지표를 사용하여 오디오 품질을 점수화했습니다. Inflect-Nano-v1은 7.3배 실시간(RTF 0.1376)으로 가장 빠른 속도를 달성했지만 금속성 오디오를 생성했고 15초 절단 제한에 걸렸습니다. Supertonic-3 5-step은 RTF 0.3164와 4.37의 높은 MOS를 기록했습니다. Kokoro-82M은 테스트된 모델 중 가장 느렸지만 가장 인간과 유사한 오디오 품질을 제공했으며, ONNX 버전이 PyTorch보다 더 빠르게 작동했습니다.
- • 벤치마크는 4코어 Intel Xeon CPU에서 3개의 오픈 가중치 TTS 모델(Kokoro 82M, Supertonic 3, Inflect-Nano-v1)을 평가함.
- • Inflect-Nano-v1은 7.3배 실시간(RTF 0.1376)으로 가장 빨랐으나 15초 절단 제한과 금속성 오디오 문제가 있음.
- • Supertonic-3 5-step은 RTF 0.3164와 4.37의 높은 오디오 품질 점수(MOS)를 기록함.
- • Kokoro-82M은 가장 느렸지만 가장 인간과 유사한 오디오 품질을 제공했으며, ONNX 버전이 PyTorch보다 성능이 뛰어남.
음성 기능을 구축하는 개발자는 속도와 오디오 품질을 기준으로 저비용 CPU 전용 환경에 최적화된 오픈 가중치 TTS 모델을 선택할 수 있습니다.
17. Mimo 2.5, 고맥락 로컬 추론에서 경쟁 모델 능가
Mimo 2.5는 5대 1 로컬/글로벌 슬라이딩 윈도우 어텐션 메커니즘을 활용하여 듀얼 RTX Pro 6000 GPU에서 고맥락 성능을 입증했습니다. 반면 MiniMax M3와 DeepSeek V4는 커스텀 커널이 데이터센터 Blackwell 하드웨어용으로 설계되어 소비자용 GPU에서 고맥락 시 성능이 크게 저하됩니다. DeepSeek V4는 작업이 CPU로 폴백될 때 초당 14토큰으로 성능이 떨어지는 반면, Step 3.7 Flash는 178k 맥락에서 초당 약 40토큰을 달성합니다. 비공개 코딩 벤치마크에서 Mimo 2.5는 약 4분 만에 작업을 완료한 반면 MiniMax M3는 40분이 소요되었으며, 품질 수준은 Claude 3.5 Sonnet과 대등했습니다.
- • Mimo 2.5는 5대 1 로컬/글로벌 슬라이딩 윈도우 어텐션 메커니즘을 사용하여 듀얼 RTX Pro 6000 GPU에서 고맥락 성능을 유지함.
- • MiniMax M3와 DeepSeek V4는 커널이 데이터센터 Blackwell 하드웨어에 최적화되어 소비자용 GPU에서 성능이 심각하게 저하됨.
- • DeepSeek V4는 CPU 폴백 시 초당 14토큰으로 떨어지며, Step 3.7 Flash는 178k 맥락에서 초당 40토큰을 달성함.
- • 비공개 코딩 벤치마크에서 Mimo 2.5, MiniMax 2.7, MiniMax M3, Step 3.7 Flash는 Claude 3.5 Sonnet과 대등한 품질을 보임.
- • Mimo 2.5는 벤치마크를 4분 만에 완료한 반면 MiniMax M3는 40분이 소요됨.
로컬 워크스테이션 GPU에 고맥락 모델을 배포하는 개발자는 슬라이딩 윈도우 어텐션으로 최적화된 모델을 선택하여 더 빠른 추론을 달성할 수 있습니다.
18. 16GB VRAM용 최적화 Qwen3.6-27B GGUF 양자화 버전 출시
사용자 cHunter789가 16GB VRAM을 탑재한 Nvidia GPU에 특별히 최적화된 두 가지 새로운 Qwen3.6-27B GGUF 양자화 버전을 출시했습니다. Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS.gguf 모델은 일반 지식보다 코딩 작업의 논리를 우선시하도록 조정되었으며, n_ctx=65536에서 12개 청크에 걸쳐 7.4131의 퍼플렉시티를 달성했습니다. Qwen3.6-27B.i1-IQ4_KS_KT-attn_qkv-IQ4_KS.gguf 모델은 가우시안 분포에 가까운 텐서에 적용된 실험적 Trellis 알고리즘 양자화를 사용하여 7.4091의 퍼플렉시티를 달성했습니다. 추측적 디코딩을 지원하기 위해 다중 토큰 예측(MTP) 버전도 생성되었습니다.
- • 사용자 cHunter789가 16GB VRAM 및 Nvidia GPU에 최적화된 두 가지 새로운 Qwen3.6-27B GGUF 양자화 버전을 출시함.
- • IQ4_KS 변형은 일반 지식보다 코딩 작업 논리를 우선시하며 n_ctx=65536에서 7.4131의 퍼플렉시티를 달성함.
- • IQ4_KS_KT 변형은 가우시안 분포에 가까운 텐서에 실험적 Trellis 알고리즘 양자화를 사용하여 7.4091의 퍼플렉시티를 달성함.
- • 추측적 디코딩을 지원하기 위해 다중 토큰 예측(MTP) 버전도 생성됨.
16GB VRAM Nvidia GPU에서 로컬 모델을 실행하는 개발자는 코딩 논리에 맞춰진 최적화된 Qwen3.6-27B 양자화 버전을 배포할 수 있습니다.
19. Anthropic, 개인정보 보호정책 및 데이터 약관 업데이트
Anthropic은 웹사이트, Claude.ai 및 기타 서비스 전반에 걸친 개인 데이터의 수집, 사용 및 처리를 규정하는 새로운 개인정보 보호정책을 2026년 7월 8일부로 시행한다고 발표했습니다. 이 정책은 신원, 연락처, 결제 및 기술 데이터와 사용자 입력 및 출력의 수집을 명시합니다. 사용자는 안전 검토를 위해 플래그가 지정되거나 명시적으로 보고된 경우를 제외하고, 자신의 입력 및 출력이 모델 학습에 사용되는 것을 거부할 수 있습니다. 또한 이 정책은 유럽 지역의 데이터 컨트롤러로 Anthropic Ireland, Limited를, 그 외 지역의 컨트롤러로 Anthropic PBC를 지정합니다.
- • Anthropic은 Claude.ai 및 기타 서비스에 대한 데이터 수집을 규정하는 새로운 개인정보 보호정책을 2026년 7월 8일부로 시행함.
- • 사용자는 안전 검토를 위해 플래그가 지정된 경우를 제외하고 모델 학습에 입력 및 출력이 사용되는 것을 거부할 수 있음.
- • Anthropic은 개인 데이터를 판매하지 않으며 국제 데이터 전송을 위해 표준 계약 조항을 활용함.
- • Anthropic Ireland, Limited가 유럽 지역의 데이터 컨트롤러 역할을 하며, Anthropic PBC가 기타 지역의 컨트롤러 역할을 함.
Anthropic 서비스를 사용하는 개발자는 2026년 7월 8일부터 시행되는 업데이트된 개인정보 보호 약관과 잠재적인 신원 확인 요구 사항에 대비해야 합니다.
20. Anthropic, 플래그 지정된 Claude 계정에 신원 확인 요구 예정
7월 8일부터 Anthropic은 계정이 플래그 지정되었으나 차단되지 않은 소수의 사용자에 대해 신원 확인을 요구할 수 있습니다. 회사는 사용자가 정부 발급 문서를 제공해야 하는 정확한 상황이나 트리거를 명시하지 않았습니다. Anthropic은 이 확인 과정을 위한 신원 확인 제공업체로 Persona와 파트너십을 맺었습니다.
- • 7월 8일부터 Anthropic은 플래그 지정되었으나 차단되지 않은 소수의 계정에 대해 신원 확인을 요구할 수 있음.
- • Anthropic은 제3자 신원 확인 제공업체로 Persona를 사용할 예정임.
- • 정부 발급 문서 제출을 요구하게 될 정확한 트리거는 명시되지 않음.
Claude의 개발자와 사용자는 7월 8일부터 Anthropic이 플래그 지정된 계정에 대해 정부 발급 신분증 확인을 요구할 수 있다는 점을 인지해야 합니다.