1. OpenAI, GPT-5.6 Sol 가격 인하 후 재조정
OpenAI는 GPT-5.6 Sol 모델의 가격을 향후 3개월간 입력 토큰 100만 개당 4달러, 출력 토큰 100만 개당 20달러로 수정했습니다. 이번 업데이트는 8월 17일에 발표된 50% 가격 인하(각각 2.50달러 및 15.00달러) 이후의 조치로, 플래그십 모델에 대한 새로운 가격 체계를 의미합니다.
- • OpenAI는 GPT-5.6 Sol 모델의 새로운 가격을 입력 토큰 100만 개당 4달러, 출력 토큰 100만 개당 20달러로 설정했습니다.
- • 이는 8월 17일에 발표된 50% 가격 인하 이후의 조치입니다.
- • 새로운 가격 체계는 3개월 동안 유효합니다.
이번 조정으로 개발자들은 플랫폼에서 대규모 에이전트 및 코딩 워크로드를 수행할 때의 비용을 다시 예측할 수 있게 되었습니다.
2. Anthropic, 에이전트 기능을 통합하여 정식 프로덕션 환경으로 출시
인앱 브라우저 액세스 및 관리형 오케스트레이션과 같은 에이전트 기능을 점진적으로 출시해 온 Anthropic이 통합 프로덕션 환경을 선보였습니다. 이 플랫폼은 컴퓨터 사용, 브라우저 액세스, 버전 관리 스킬, 재사용 가능한 파일을 통합하여 개발 팀이 개별 기능 테스트를 넘어 자율 에이전트를 위한 간소화된 프로덕션 환경을 구축할 수 있도록 지원합니다.
- • Anthropic은 컴퓨터 사용, 브라우저 액세스, 버전 관리 스킬, 재사용 가능한 파일을 단일 프로덕션 환경으로 통합했습니다.
- • 이 플랫폼은 이제 정식 출시되어 개별 기능 출시에서 통합된 에이전트 배포 환경으로 전환되었습니다.
- • 이 통합은 팀이 스킬 버전을 고정하고 파일 ID를 재사용할 수 있게 하여 운영 효율성을 지원합니다.
- • 통합 환경은 에이전트 실행 중 브라우저 왕복을 최소화하도록 설계되었습니다.
개별 기능 출시에서 통합 환경으로의 전환은 버전 고정(version pinning)을 가능하게 하고 불필요한 브라우저 왕복을 줄여 프로덕션급 에이전트 배포를 간소화합니다.
3. Mistral, 반복적 문서 검색을 위한 Search Toolkit에 Agentic Search 추가
Mistral은 기존의 통합 RAG 프레임워크였던 Search Toolkit을 확장하여 Agentic Search를 추가했습니다. 이 새로운 기능은 기존의 일회성 검색을 활성 검색 루프로 대체하며, 모델이 검색, 열기, 탐색, 읽기, grep 등 5가지 작업을 통해 긴 문서를 검사하고 답변을 동적으로 검증할 수 있게 합니다. 이번 업데이트는 복잡한 문서에 대한 검색 정확도를 크게 향상시켰으며, 내부 벤치마크 결과 FinanceBench 정확도가 26.7%에서 86%로 상승했습니다.
- • Agentic Search는 Mistral Search Toolkit의 새로운 구성 요소입니다.
- • 이 시스템은 검색, 열기, 탐색, 읽기, grep이라는 5가지 작업을 도입합니다.
- • 모델이 정적 청크에 의존하는 대신 참조를 따라가며 답변을 동적으로 검증할 수 있게 합니다.
- • 내부 테스트 결과 FinanceBench 정확도가 26.7%에서 86%로 향상되었습니다.
- • 반복적인 루프는 복잡한 문서 검색 작업 중 발생하는 테일 레이턴시(tail latency)를 줄여줍니다.
이번 업데이트는 Search Toolkit을 정적 검색 인터페이스에서 활성 에이전트 시스템으로 진화시켜, 복잡한 다중 페이지 문서에서도 더욱 신뢰할 수 있는 RAG 성능을 제공합니다.
4. DeepSeek, 실험적 비전 모델로 V4-Flash 시리즈 확장
기존 V4-Flash API 및 추론 변형 모델을 기반으로 DeepSeek는 deepseek-v4-flash-vision-exp 모델을 출시했습니다. 이 실험적 릴리스는 V4-Flash 생태계에 다중 모달 이미지 분석 기능을 추가하며, JPEG, PNG, GIF, WebP 형식을 지원하고 OpenAI 및 Anthropic API와 드롭인 호환성을 제공합니다.
- • 새로운 deepseek-v4-flash-vision-exp 모델은 다중 모달 이미지 분석을 지원합니다.
- • OpenAI Chat Completions 및 Anthropic /messages API와 호환됩니다.
- • 인라인 base64 데이터, 외부 URL, Files API를 지원합니다.
- • 이미지는 이미지당 최대 384 토큰으로 자동 조정됩니다.
이번 확장을 통해 개발자들은 익숙한 API 표준을 사용하여 기존 V4-Flash 워크플로우에 다중 모달 비전 기능을 통합할 수 있습니다.
5. FireRedTeam, 오픈 소스 모델 FireRedAudio 및 FireRedTTS3 출시
FireRedTeam은 고급 오디오 처리 및 음성 생성을 위해 설계된 모델 제품군인 FireRedAudio와 FireRedTTS3를 오픈 소스로 공개했습니다. FireRedAudio는 ASR, 오디오 이해, 최대 1시간 길이의 녹음본에 대한 음성 편집을 지원하는 9B 파라미터 모델입니다. FireRedTTS3는 24개 언어와 21개 중국어 방언에 걸친 제로샷 음성 복제를 제공하는 Base 모델과, 자연어 설명으로 음성을 디자인하고 의미론적 음성 편집을 가능하게 하는 Instruct 모델의 두 가지 버전으로 나뉩니다.
- • FireRedAudio는 ASR, 오디오 이해, 음성 편집을 지원하는 9B 파라미터 범용 오디오 언어 모델입니다.
- • FireRedAudio는 시간적 근거(temporal grounding)를 바탕으로 최대 1시간 길이의 녹음본을 처리할 수 있습니다.
- • FireRedTTS3는 제로샷 음성 복제를 위한 FireRedTTS3-Base와 음성 디자인을 위한 FireRedTTS3-Instruct의 두 가지 버전이 있습니다.
- • FireRedTTS3-Base는 24개 언어와 21개 중국어 방언에 걸친 제로샷 음성 복제를 지원합니다.
- • FireRedTTS3-Instruct를 사용하면 자연어 설명으로 음성을 생성하고 의미론적 음성 편집을 수행할 수 있습니다.
개발자들에게 고급 오디오 이해, 생성 및 음성 디자인을 위한 강력하고 자체 호스팅 가능한 모델을 제공합니다.
6. Qwen3-TTS 커스텀 구현, 50ms 미만의 지연 시간 달성
Nari Labs는 단일 NVIDIA H100 GPU에서 50ms 미만의 p95 첫 오디오 생성 시간(TTFA)을 달성하는 Qwen3-TTS 1.7B CustomVoice의 최적화된 구현을 출시했습니다. 이 시스템은 초당 최대 10개의 요청을 처리하면서도 낮은 지연 시간을 유지하며, 초당 약 630자를 생성하고 비용은 100만 자당 약 2달러로 추정됩니다. 주요 성능 최적화에는 동적 선행 무음 제거, 생성 루프를 단일 CUDA 그래프로 캡처, 전체 프레임 기록을 재처리하지 않기 위한 상태 캐시 기반 코덱 사용 등이 포함됩니다.
- • Qwen3-TTS 1.7B CustomVoice 구현은 초당 10개 요청 시 50ms 미만의 p95 TTFA를 달성합니다.
- • 트래픽이 초당 20개 요청으로 증가해도 시스템은 100ms 미만의 TTFA를 유지합니다.
- • 최적화에는 동적 선행 무음 제거, 프레임 누적 튜닝, 공유 스케줄러가 포함됩니다.
- • 시스템은 코드 예측기의 생성 루프를 단일 CUDA 그래프로 캡처하고 상태 캐시 기반 코덱을 사용합니다.
- • 입력 스트리밍을 지원하여 전체 텍스트 응답을 받기 전에 오디오 합성을 시작할 수 있습니다.
이를 통해 초저지연의 자연스러운 음성 에이전트와 실시간 음성 대 음성(speech-to-speech) 애플리케이션 구현이 가능해집니다.
7. Anthropic, 기업용 Claude 보안에 Mythos 5 통합
7월에 출시된 Claude 보안 터미널 플러그인을 기반으로, Anthropic은 Claude Enterprise 고객을 위한 Claude 보안 공개 베타에 Claude Mythos 5 모델을 통합했습니다. 이번 확장을 통해 사용자는 GitHub 저장소에 직접 연결하여 자동 데이터 흐름 추적 및 취약점 식별을 수행할 수 있습니다. 안전을 위해 인터페이스는 직접적인 프롬프팅을 제한하며, 구조화된 스캔 결과와 사람의 승인이 필요한 패치 제안을 제공합니다. 또한 Anthropic은 오픈 소스 보안을 지원하기 위해 3,500만 달러 규모의 Defender Advantage Fund를 발표했습니다.
- • Claude 보안 공개 베타는 이제 Claude Enterprise 고객을 위해 Claude Mythos 5 모델을 통합합니다.
- • 이 서비스는 GitHub 저장소에 연결하여 데이터 흐름을 추적하고 패치를 제안합니다.
- • 인터페이스는 익스플로잇 생성을 방지하기 위해 직접적인 프롬프팅을 제한하며, 모든 패치에 대해 사람의 검토를 요구합니다.
- • Anthropic은 오픈 소스 보안을 위해 Claude 크레딧을 제공하는 3,500만 달러 규모의 Defender Advantage Fund를 출시했습니다.
이번 업데이트는 Mythos 5 모델의 고급 기능을 기업 워크플로우에 도입하여 관리형 환경 내에서 자동화된 보안 코드베이스 스캔 및 수정이 가능하게 합니다.
8. Google, Gemini Enterprise 및 IDE에 Antigravity 에이전트 도입
5월에 출시된 Antigravity 2.0 플랫폼과 최근 도입된 파일 기반 커스텀 에이전트를 기반으로, Google은 Antigravity 에이전트를 Gemini Enterprise에 통합하여 생태계를 확장했습니다. 이번 업데이트는 기업 개발자들에게 VS Code, Visual Studio, JetBrains, Zed 전반에서 통합된 에이전트 작업 공간을 제공합니다. 조직적 배포를 지원하기 위해 샌드박스, 도구 권한, 예산 및 감사를 관리하기 위한 새로운 관리 제어 기능이 포함되었습니다.
- • Antigravity 에이전트는 이제 적격한 Gemini Enterprise 구독 내에서 사용할 수 있습니다.
- • 새로운 IDE 확장은 VS Code, Visual Studio, JetBrains, Zed를 위한 통합 에이전트 작업 공간을 제공합니다.
- • 기업 관리자는 샌드박스, 예산, 감사를 위한 중앙 집중식 제어 권한을 얻습니다.
- • 이번 업데이트는 기존 Antigravity 2.0 프레임워크와 커스텀 에이전트 구성을 기반으로 합니다.
이번 개발은 Antigravity를 독립형 개발자 도구에서 기업용 IDE 통합 워크플로우로 전환하여, 개발 팀 전반에서 중앙 집중식 관리와 일관된 에이전트 액세스를 가능하게 합니다.
9. Anthropic, 회의-에이전트 워크플로우를 위한 Project Parka 미리보기
Anthropic은 실시간 회의와 자율 개발을 연결하기 위해 설계된 Mac 전용 애플리케이션인 Project Parka를 미리 공개하고 있습니다. 이 도구는 시스템 및 마이크 오디오를 캡처하고, 화자별로 구분된 대본을 Claude 에이전트로 직접 스트리밍하여 실행 가능한 구현 프롬프트를 생성합니다. 시스템은 작업 생성을 자동화하지만, Anthropic은 에이전트가 이러한 작업을 자동으로 실행할지 아니면 사람의 승인이 필요한지에 대해서는 아직 명확히 밝히지 않았습니다.
- • Project Parka는 시스템 및 마이크 오디오를 캡처할 수 있는 Mac 전용 기능입니다.
- • 시스템은 화자별 대본을 스트리밍하여 Claude 에이전트를 위한 실행 가능한 작업을 생성합니다.
- • 실시간 회의를 전체 구현 프롬프트로 직접 변환하도록 설계되었습니다.
- • Claude가 작업을 자동으로 실행할지 아니면 사용자의 수동 승인이 필요한지는 아직 불분명합니다.
실시간 회의에서 화자별 대본을 에이전트 프롬프트로 직접 스트리밍하여 실행 가능한 코드로 전환하는 과정을 자동화합니다.
10. NVIDIA, 자율 에이전트를 위한 모델 독립적 AVO 아키텍처 도입
NVIDIA는 지속적이고 장기적인 자율 에이전트 운영을 위해 설계된 모델 독립적 프레임워크인 에이전트 변형 연산자(AVO) 아키텍처를 개발했습니다. AVO는 지속적인 메모리를 사용하여 이전 추론을 저장하고, 진행 상황이 정체될 때 전략을 재설정하는 감독자 메커니즘을 활용합니다. 이 아키텍처는 텍스트 전용 64x64 그리드를 사용하여 ARC-AGI-3 벤치마크에서 100% 성공률을 달성했으며, GPU 커널을 자율적으로 최적화하여 FlashAttention-4보다 최대 10.5% 더 나은 성능을 보이는 실용적인 유용성을 입증했습니다.
- • AVO 아키텍처는 지속적인 메모리와 감독자 메커니즘을 사용하여 진행 상황을 모니터링하고 전략을 재설정합니다.
- • AVO는 ARC-AGI-3 벤치마크에서 100% 성공률을 달성하여 25개 환경 전반의 183개 레벨을 모두 완료했습니다.
- • 시스템은 ARC-AGI-3에서 텍스트 전용 방식으로 작동하며, 관찰 내용을 이미지 토큰 없이 64x64 텍스트 그리드로 수신했습니다.
- • 7일간의 GPU 커널 최적화 연구에서 AVO는 FlashAttention-4보다 최대 10.5% 더 나은 어텐션 커널을 생성했습니다.
- • AVO는 모델 독립적이며 Claude Opus 5와 GPT-5.6 Sol을 모두 사용하여 검증되었습니다.
코드를 최적화하고 복잡한 작업을 해결하는 장기 자율 에이전트를 구축하기 위한 매우 효율적이고 모델 독립적인 프레임워크를 제공합니다.
11. DeepSeek Harness v0.1.1, 네이티브 이미지 지원 및 MCP 통합 추가
DeepSeek-Harness(dsh-v0.1.1-rc.1)의 릴리스는 DeepSeek-V4-Flash-Vision-Exp 다중 모달 모델에 대한 네이티브 통합을 도입합니다. 이번 업데이트를 통해 /goal 및 /plan과 같은 명령이 텍스트와 이미지 입력을 모두 허용하게 되었으며, @ 메뉴가 파일 및 세션을 참조하도록 업데이트되었습니다. 에이전트 개발자에게 중요한 점은 모델 컨텍스트 프로토콜(MCP/ACP) 통합이 이제 지속적인 이미지 첨부를 지원하며, PTC 모드가 중첩된 이미지를 전달하도록 업데이트되었다는 것입니다.
- • DeepSeek-Harness v0.1.1-rc.1은 DeepSeek-V4-Flash-Vision-Exp 모델에 대한 지원을 도입합니다.
- • 이번 업데이트는 네이티브 이미지 요청을 가능하게 하여 /goal 및 /plan과 같은 명령이 텍스트와 이미지 입력을 모두 허용합니다.
- • MCP/ACP 통합은 이제 지속적인 이미지 첨부를 지원합니다.
- • PTC 모드는 중첩된 이미지 전달을 지원하도록 업데이트되었습니다.
개발자가 MCP 서버와 중첩된 워크플로우를 통해 지속적인 이미지를 전달할 수 있게 하여 다중 모달 에이전트 개발을 간소화합니다.
12. AutoFigure 툴킷, 과학 다이어그램 생성 자동화
AutoFigure는 텍스트 설명, 논문 내용, 방법론적 설명을 바탕으로 과학적 그림과 다이어그램을 프로그래밍 방식으로 생성하기 위해 설계된 새로운 툴킷입니다. 이 파이프라인은 오프라인 SVG 검증, PNG 렌더링, draw.io 호환 출력 생성을 지원합니다. 개발자는 API 기반 생성을 구성하고, 참조 이미지를 사용하여 스타일 가이드라인을 적용하며, 완성된 자산을 zip 아카이브로 내보내거나 HTML 갤러리에서 볼 수 있습니다.
- • AutoFigure는 텍스트 설명, 논문 내용, 방법론적 설명을 바탕으로 과학적 그림을 생성합니다.
- • 툴킷은 오프라인 SVG 검증, PNG 렌더링, draw.io 호환 출력을 지원합니다.
- • 워크플로우에는 API 기반 생성 구성과 스타일 정렬을 위한 참조 이미지 사용이 포함됩니다.
- • Colab에서 출력을 표시하고, HTML 검토 갤러리를 구축하며, 자산을 내보내기 위한 도구를 제공합니다.
SVG, PNG 및 draw.io 호환 다이어그램을 프로그래밍 방식으로 렌더링하여 문서 인텔리전스 파이프라인을 간소화합니다.
13. Claudette 도구, 장황한 Claude Code 출력을 평이한 영어로 번역
더 깔끔한 터미널 출력을 원하는 개발자들은 Claude Code 응답에서 장황하고 클릭베이트 스타일의 언어를 제거하도록 설계된 새로운 오픈 소스 도구인 Claudette를 사용할 수 있습니다. MIT 라이선스로 출시된 이 도구는 Claude의 출력을 가로채고 인증된 Gemini CLI 설치를 사용하여 평이한 영어로 번역합니다. Gemini의 번역을 그대로 출력함으로써 Claudette는 Claude가 텍스트를 다시 편집하는 것을 방지하여 직접적이고 간결한 터미널 상호작용을 보장합니다.
- • Claudette는 GitHub 저장소 adnanakil/nobuzz에서 제공되는 MIT 라이선스 도구입니다.
- • 이 도구는 Gemini CLI를 사용하여 Claude Code의 응답을 평이한 영어로 번역합니다.
- • Gemini의 번역을 그대로 출력하여 Claude가 다시 편집하거나 장황한 언어를 다시 도입하는 것을 방지합니다.
- • 요구 사항에는 Claude Code와 인증된 Gemini CLI 설치가 포함됩니다.
장황하고 대화형인 AI 응답을 직접적이고 실행 가능한 터미널 출력으로 정리하여 개발자 생산성을 향상시킵니다.
14. Speech Agent Arena, 음성 대 음성 모델 벤치마킹 시작
새로 출시된 Speech Agent Arena는 에이전트 및 비에이전트 시나리오 전반에서 유료 인간 참가자를 사용하여 음성 대 음성 모델을 평가하기 위한 표준화된 벤치마크를 제공합니다. 초기 순위는 대화 선호도와 작업 실행 간의 차이를 보여줍니다. Gemini 3.1 Flash Live Preview - Minimal은 시간당 1.50달러의 비용으로 1,046 Elo 점수를 기록하며 대화 선호도에서 앞서지만, 작업 성공률은 74.6%에 불과합니다. 반면, Grok Voice Think Fast 2.0 High는 시간당 4.80달러로 94.7%의 작업 성공률을 기록하며 선두를 달리고 있으며, OpenAI의 GPT-Realtime-2.1 High는 시간당 10.75달러로 91.5%의 성공률을 기록합니다.
- • Speech Agent Arena는 15개의 에이전트 시나리오와 20개의 비에이전트 시나리오 전반에서 유료 인간 참가자를 사용하여 모델을 평가합니다.
- • Gemini 3.1 Flash Live Preview - Minimal은 시간당 1.50달러의 비용으로 1,046 Elo 점수를 기록하며 대화 선호도에서 앞섭니다.
- • SpaceXAI Grok Voice Think Fast 2.0 High는 94.7%의 작업 성공률로 선두를 달리고 있지만 시간당 4.80달러의 비용이 듭니다.
- • Gemini 3.1 Flash Live Preview - Minimal은 대화 선호도에서 앞섰음에도 불구하고 작업 성공률은 74.6%에 그쳤습니다.
- • OpenAI의 GPT-Realtime-2.1 High는 시간당 10.75달러의 비용으로 91.5%의 작업 성공률을 기록했습니다.
실제 음성 에이전트 배포를 위한 객관적이고 인간이 평가한 비용 및 성능 벤치마크를 개발자에게 제공합니다.
15. AWS Bedrock의 Codex CLI 버그로 GPT-5.6 Sol 비용 10배 증가
Amazon Bedrock에서 네이티브 Codex CLI(버전 0.147.0)를 사용하는 개발자들은 GPT-5.6 Sol 모델에 대한 프롬프트 캐싱을 방해하는 치명적인 버그를 보고했습니다. CLI가 요청 본문에 prompt_cache_options 또는 prompt_cache_breakpoint를 직렬화하지 못하기 때문에, 에이전트 코딩 워크로드는 캐시된 입력을 활용하지 못한 채 막대한 캐시 쓰기 토큰 볼륨을 발생시키고 있습니다. 영향을 받는 세션을 분석한 결과, 캐시 쓰기 토큰이 전체 모델 비용의 약 85%를 차지하여 최대 10배 더 높은 비용이 발생하는 것으로 나타났습니다.
- • 네이티브 Codex CLI 버전 0.147.0은 Amazon Bedrock에서 GPT-5.6 Sol에 대한 명시적 프롬프트 캐싱 지원이 부족합니다.
- • 이 버그로 인해 에이전트 워크로드에서 캐시 쓰기 토큰이 예상 비용의 약 85%를 차지하게 됩니다.
- • 한 로컬 세션에서 76개의 요청이 670만 개의 캐시 쓰기 토큰을 기록했지만 캐시된 토큰은 0개였습니다.
- • 이 문제는 공급자가 요청 본문에 prompt_cache_options 또는 prompt_cache_breakpoint를 직렬화하지 못하여 발생합니다.
AWS Bedrock에서 Codex CLI를 사용하는 개발자들이 예상치 못한 막대한 API 청구서를 피하도록 돕습니다.
16. Llama.cpp 포크, 더 빠른 로컬 추론을 위해 DSpark PC Tree 구현
한 개발자가 llama.cpp의 독립적인 포크를 출시하여 PC Tree(Parent Conditioned Drafting Tree) 추론적 디코딩 방식을 구현했습니다. RTX 5090에서 Qwen 3.0을 사용한 벤치마크 테스트에서 k3/n16 구성은 초당 159토큰을 제공하여 기준 대비 1.69배의 속도 향상을 보였습니다. 이 구현은 오픈 소스이며 다양한 작업 범주에서 로컬 추론 속도를 최적화하는 것을 목표로 합니다.
- • 이 구현은 DSpark PC Tree 연구 논문을 기반으로 하며 GitHub에서 사용할 수 있습니다.
- • RTX 5090 GPU에서 Qwen 3.0으로 테스트한 결과 초당 159.00토큰을 달성하여 기준 대비 1.69배의 속도 향상을 보였습니다.
- • k3/n16 구성은 11개 SPEED-Bench 범주 중 9개에서 선형 DSpark를 능가했으며 요약에서 6.56%의 이득을 보였습니다.
- • 더 큰 k4/n22 구성은 더 많은 초안을 수락했지만 증가된 검증기 배치 비용을 상쇄하지 못했습니다.
정확도를 희생하지 않으면서 소비자용 GPU에서 로컬 모델 추론 속도를 최대 1.69배 향상시킵니다.
17. Qwen 3.8 27B의 Blackwell 네이티브 NVFP4 양자화 출시
Qwen 3.8 27B를 위한 새로운 Blackwell 네이티브, 프리필 최적화 4비트 양자화(NVFP4)가 출시되었습니다. RTX 5090에서 벤치마크한 결과, NVFP4 양자화는 2,048 토큰 프리필에서 초당 6,250토큰을 달성하여 표준 Q4_0 및 Q6_K 양자화를 능가했습니다. 이번 릴리스에는 권장 설정으로 구성할 경우 15%의 추가 성능 향상을 제공하는 양자화된 다중 토큰 예측(MTP) 초안 헤드도 포함되어 있습니다.
- • 새로운 NVFP4 양자화는 동일한 메모리 공간을 사용하는 표준 Q4 양자화보다 50% 더 빠르게 실행됩니다.
- • RTX 5090에서의 벤치마크 테스트는 2,048 프리필(pp2048)에서 초당 6,250토큰을 달성했습니다.
- • 이번 릴리스는 Unsloth의 구현과 같은 다른 NVFP4 양자화보다 4%에서 7% 더 빠르게 실행됩니다.
- • GGUF 릴리스에는 15%의 추가 속도 향상을 제공하는 양자화된 다중 토큰 예측(MTP) 초안 헤드가 포함되어 있습니다.
RTX 5090 또는 Blackwell 하드웨어에서 로컬 추론을 실행하는 개발자들이 프리필 시간에서 엄청난 속도 향상을 달성할 수 있게 합니다.
18. AMD Instinct Coder, 추론을 로컬 하드웨어로 라우팅
AMD는 Spectro Cloud와 협력하여 개발자 코딩 추론을 로컬 하드웨어에서 호스팅되는 오픈 가중치 모델로 라우팅하는 서비스인 Instinct Coder를 도입했습니다. 이 서비스는 상용 프론티어 모델에 대한 자체 호스팅 대안을 제공하도록 설계되었으며, AMD는 기업 개발 팀을 위해 최대 70%의 비용 절감 효과를 주장합니다.
- • AMD Instinct Coder는 Spectro Cloud가 지원하는 서비스입니다.
- • 이 서비스는 추론 워크로드를 로컬 하드웨어에서 실행되는 오픈 모델로 라우팅합니다.
- • 프론티어 클라우드 모델을 사용하는 것과 비교하여 최대 70%의 비용 절감을 제공한다고 주장합니다.
클라우드 기반 코딩 도우미에 대한 자체 호스팅 대안을 제공하며 최대 70%의 비용 절감을 주장합니다.
19. NVIDIA, 모델 간 KV 캐시 전송을 위한 선형 수학 기법 도입
NVIDIA 연구원들은 개발자가 프리필된 KV 캐시를 소스 모델에서 대상 모델로 직접 매핑할 수 있는 모델 간 KV 캐시 전송 기법을 도입했습니다. 간단한 선형 수학(특히 닫힌 형식의 헤드별 릿지 매퍼)을 활용함으로써 이 프레임워크는 값비싼 딥러닝 모델 학습을 피합니다. 매핑 프로세스는 처음부터 대화를 다시 계산하는 것보다 최대 25배 빠르게 실행되면서, 동일 제품군 내 전송의 경우 대상 모델의 독립적인 정확도를 최대 98%까지 유지합니다.
- • 이 기법은 닫힌 형식의 헤드별 릿지 매퍼를 사용하여 소스 모델에서 대상 모델로 프리필된 KV 캐시를 매핑합니다.
- • 매핑 프로세스는 대화를 다시 계산하는 것보다 2.7배에서 25배 더 빠르게 실행됩니다.
- • 동일 제품군 내 전송(예: Qwen3, Llama 3.1)의 경우 대상 모델의 독립적인 정확도를 최대 98%까지 유지합니다.
- • 더 복잡한 모델 쌍의 경우, 90% 이상의 정확도를 회복하기 위해 작은 비선형 다층 퍼셉트론이 사용되었습니다.
개발자들이 값비싼 재계산이나 모델 학습 없이도 서로 다른 모델 간에 활성 대화를 넘길 수 있게 합니다.