1. Kimi K3 오픈 모델, Claude 수준의 코딩 성능을 더 낮은 비용으로 제공
Kimi K3 오픈 모델이 Artificial Analysis 리더보드에 데뷔하며 Claude와 대등한 코딩 능력과 토큰 효율성을 입증했습니다. Kimi의 API 가격은 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로, Claude의 10달러 및 50달러 요금보다 훨씬 저렴하여 경쟁력이 매우 높습니다. 또한 MIT 라이선스로 출시된 GLM 5.2와 같은 다른 오픈 웨이트 모델들도 사이버 벤치마크에서 강력한 성능을 보였으며, 제한된 모델이 응답을 거부한 작업에서 Claude를 능가했습니다. 한편, OpenAI는 자사의 주력 모델인 GPT-5.6을 월 20달러 표준 구독 플랜에 통합했습니다.
- • Kimi K3 API 가격은 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로, Claude의 10달러 및 50달러 요금과 비교됩니다.
- • 이 오픈 모델은 Claude와 대등한 코딩 성능과 토큰 효율성을 제공하며 Artificial Analysis 리더보드에 등재되었습니다.
- • MIT 라이선스로 출시된 오픈 웨이트 모델인 GLM 5.2는 제한된 모델이 거부한 작업을 완료함으로써 사이버 벤치마크에서 Claude를 능가했습니다.
- • Kimi는 월 19달러부터 시작하는 유료 플랜을 제공하며, 여기에는 39달러짜리 코딩 티어가 포함되어 있습니다.
개발자들은 Claude보다 훨씬 저렴한 API 가격으로 오픈 모델을 통해 최첨단 수준의 코딩 기능을 활용할 수 있게 되었습니다.
2. OpenPangu-2.0-Flash, 로컬 배포를 위한 GGUF 형식으로 제공
92B-A6B OpenPangu-2.0-Flash 모델의 초기 오픈 소스 릴리스를 기반으로, 이제 llama.cpp의 ik_llama 포크 사용자를 위한 GGUF 버전이 제공됩니다. 이번 업데이트를 통해 개발자들은 최적화된 GGUF 형식을 사용하여 512K 컨텍스트 모델을 로컬에서 실행할 수 있습니다.
- • OpenPangu-2.0-Flash가 이제 GGUF 형식으로 제공됩니다.
- • GGUF 릴리스는 llama.cpp의 ik_llama 포크와 호환됩니다.
- • 이를 통해 512K 컨텍스트 모델의 로컬 배포가 가능해졌습니다.
이번 릴리스는 초기 모델 가중치와 실제 로컬 실행 사이의 간극을 메워, 개발자들이 고컨텍스트 모델을 로컬 추론 파이프라인에 통합할 수 있게 합니다.
3. AISI 업데이트: 오픈 웨이트 모델, 사이버 역량 격차 4~7개월로 좁혀
영국 AI 안전 연구소(AISI)는 2026년 5월 AI 사이버 역량의 급격한 가속화에 관한 보고서에 이어, 오픈 웨이트 모델에 초점을 맞춘 새로운 평가 데이터를 발표했습니다. AISI는 이전에 프론티어 모델의 역량이 급격히 두 배로 증가했음을 확인한 바 있는데, 이번 최신 평가에 따르면 GLM-5.2와 같은 오픈 웨이트 모델은 이제 프론티어 모델을 4~7개월 차이로 추격하고 있습니다. 이는 2025년에 관찰된 6~10개월의 격차보다 크게 개선된 수치입니다. AISI는 이러한 모델들이 폐쇄형 API에 대한 비용 효율적인 대안을 제공하지만, 현재 프론티어 시스템에서 볼 수 있는 배포 시점의 안전 조치가 부족하다고 지적했습니다. 연구소는 2026년 7월 말로 예정된 Kimi K3 출시 이후 평가 범위를 확대할 계획입니다.
- • GLM-5.2는 현재 가장 뛰어난 사이버 역량을 갖춘 오픈 웨이트 모델로, 프론티어 모델을 4~7개월 차이로 추격하고 있습니다.
- • 성능 격차는 2025년에 측정된 6~10개월의 지연에서 좁혀졌습니다.
- • GLM-5.2 및 DeepSeek V4-Pro와 같은 오픈 웨이트 모델은 폐쇄형 대안에 비해 상당한 비용 이점을 제공합니다.
- • AISI는 곧 출시될 Kimi K3 모델을 포함하여 평가 시리즈를 계속할 예정입니다.
오픈 웨이트 모델과 폐쇄형 모델 간의 격차가 좁혀짐에 따라 개발자들은 복잡한 기술 작업을 위해 접근 가능하고 비용 효율적인 모델에 점점 더 의존할 수 있게 되었지만, 내장된 안전 모니터링의 부재는 여전히 중요한 고려 사항입니다.
4. Google Cloud, Always-On Memory Agent 참조 구현 공개
Google Cloud는 Google ADK(Agent Development Kit)와 Gemini 3.1 Flash-Lite로 구축된 참조 구현인 Always-On Memory Agent를 출시했습니다. 이 릴리스는 2026년 7월 8일 Gemini Managed Agents 프레임워크에 도입된 백그라운드 실행 기능을 활용합니다. 기존의 벡터 데이터베이스에 의존하는 대신, 이 시스템은 구조화된 메모리 저장을 위해 SQLite를 사용합니다. 에이전트는 24시간 연중무휴 백그라운드 프로세스로 작동하며, 오케스트레이터를 사용하여 IngestAgent, ConsolidateAgent, QueryAgent라는 세 가지 전문 하위 에이전트를 관리합니다. ConsolidateAgent는 30분 타이머에 따라 실행되어 메모리 간의 연결을 합성하며, 시스템은 통합을 위해 8888 포트에서 HTTP API를 노출합니다.
- • Always-On Memory Agent는 Google ADK와 Gemini 3.1 Flash-Lite를 사용하여 구축되었습니다.
- • Gemini Managed Agents 프레임워크의 백그라운드 실행 기능을 활용합니다.
- • 기존 벡터 데이터베이스와 임베딩을 우회하여 SQLite에 구조화된 메모리를 저장합니다.
- • 오케스트레이터가 IngestAgent, ConsolidateAgent, QueryAgent라는 세 가지 전문 하위 에이전트를 관리합니다.
- • ConsolidateAgent는 30분 타이머에 따라 실행되어 저장된 메모리 간의 연결과 통찰력을 지속적으로 합성합니다.
- • 에이전트는 쉬운 통합 및 관리를 위해 8888 포트에서 HTTP API를 노출합니다.
개발자들은 이제 이전에 발표된 백그라운드 실행 프레임워크를 사용하여 진화하는 구조화된 장기 기억을 가진 에이전트를 구축하기 위한 구체적인 참조 구현을 활용할 수 있습니다.
5. NVIDIA DeepStream 9.1, Vision AI 파이프라인을 위한 에이전트 기술 도입
NVIDIA는 AI 기반 비디오 및 이미지 이해를 위한 스트리밍 분석 툴킷의 업데이트인 DeepStream 9.1을 출시했습니다. 이번 릴리스에는 코딩 에이전트가 자연어 프롬프트를 사용하여 다중 카메라 비전 파이프라인을 구축할 수 있게 해주는 13가지 에이전트 기술이 도입되었습니다. 주요 기능으로는 여러 카메라의 감지 결과를 공유 3D 좌표계로 투영하여 일관된 객체 ID를 유지하는 다중 뷰 3D 추적(MV3DT)과 기존 비디오 스트림에서 카메라 보정을 자동화하는 AutoMagicCalib(AMC)이 있습니다. 이 플랫폼은 이제 CC-BY-4.0 및 Apache-2.0 라이선스 하에 통합 오픈 소스 GitHub 저장소에서 호스팅되며, Jetson Orin 및 Thor 엣지 장치에서 NVIDIA JetPack 7.2에 대한 지원을 추가했습니다.
- • DeepStream 9.1은 자연어 프롬프트를 사용하여 다중 카메라 비전 파이프라인을 구축하기 위한 13가지 에이전트 기술을 도입합니다.
- • 새로운 다중 뷰 3D 추적(MV3DT)은 여러 카메라의 감지 결과를 공유 3D 좌표계로 투영하여 일관된 객체 ID를 유지합니다.
- • AutoMagicCalib(AMC)은 비디오 스트림에서 직접 매개변수를 추정하여 수동 체커보드 없이 카메라 보정을 자동화합니다.
- • 이 플랫폼은 이제 CC-BY-4.0 및 Apache-2.0 라이선스 하에 통합 오픈 소스 GitHub 저장소에서 호스팅됩니다.
- • 이번 릴리스는 Jetson Orin 및 Thor 엣지 장치에서 NVIDIA JetPack 7.2에 대한 지원을 추가합니다.
개발자들은 수동으로 파이프라인 코드를 작성하는 대신 자연어를 사용하여 복잡한 다중 카메라 컴퓨터 비전 애플리케이션을 구축하고 카메라 보정을 자동화할 수 있습니다.
6. Claude Code를 위한 상시 가동 Mac 설정 단계별 가이드
단계별 가이드는 컴퓨터 사용 기능이 활성화된 Claude Code를 위한 상시 가동 환경으로 여분의 Mac을 구성하는 방법에 대한 지침을 제공합니다. 이 설정을 통해 개발자는 모바일 장치나 기본 컴퓨터에서 SSH를 통해 원격으로 에이전트를 제어할 수 있습니다. 구성에는 SSH 활성화, 비밀번호 없는 sudo 설정, 절전 방지를 위한 macOS 전원 설정 조정이 포함됩니다. SSH 기반 프로세스에 대한 화면 녹화 및 접근성에 대한 macOS 보안 제한을 우회하기 위해 이 설정은 LaunchAgent와 지속적인 tmux 서버를 활용합니다. 가이드는 안전한 원격 액세스를 위해 Tailscale을, 에이전트를 격리하기 위해 별도의 GitHub 계정을 사용할 것을 권장합니다.
- • 이 설정은 여분의 Mac이 Claude Code를 지속적으로 실행하도록 구성하여 모바일 장치나 기본 컴퓨터에서 SSH를 통한 원격 제어를 가능하게 합니다.
- • LaunchAgent와 지속적인 tmux 서버를 활용하여 SSH 프로세스에 대한 화면 녹화 및 접근성에 대한 macOS 보안 제한을 우회합니다.
- • 대상 장치에 대한 안전한 피어 투 피어 원격 액세스를 설정하기 위해 Tailscale을 권장합니다.
- • 가이드는 에이전트를 격리하기 위해 별도의 GitHub 계정과 Claude for Chrome 확장을 통한 전용 Chrome 프로필을 사용할 것을 권장합니다.
개발자들은 기본 워크스테이션을 노출하지 않고도 모든 장치에서 원격으로 Claude Code의 데스크톱 자동화 기능을 안전하게 실행하고 제어할 수 있습니다.
7. Cache-Hunter 도구, LLM 하네스의 캐시 무효화 문제 식별
한 개발자가 로컬 LLM을 실행할 때 캐시 무효화 문제를 식별하도록 돕기 위해 설계된 도구인 cache-hunter를 출시했습니다. 캐시 무효화는 메시지 순서, 시스템 프롬프트, 도구 또는 reasoning_effort의 사소한 변경으로 인해 조용히 트리거될 수 있습니다. 이 도구는 로컬 포트를 통해 LLM 세션을 캡처하고 불안정한 요소를 빨간색으로 강조 표시합니다. OpenCode, Claude Code, Cline, Pi, Hermes, Vibe를 포함한 인기 있는 하네스를 테스트한 결과, 대부분이 불안정한 시스템 프롬프트, 도구, 순서 또는 콘텐츠와 관련된 문제를 보였습니다. 이 도구는 GitHub를 통해 사용할 수 있습니다.
- • cache-hunter 도구는 로컬 포트를 통해 LLM 세션을 캡처하고 불안정하여 캐시를 무효화하는 요소를 빨간색으로 강조 표시합니다.
- • 로컬 LLM의 캐시 무효화는 메시지 순서, 시스템 프롬프트, 도구 또는 reasoning_effort의 변경으로 인해 트리거될 수 있습니다.
- • 테스트 결과 Claude Code, Cline, OpenCode를 포함한 인기 있는 하네스들이 불안정한 시스템 프롬프트나 도구 구성을 자주 보이는 것으로 나타났습니다.
- • 이 도구는 오픈 소스이며 GitHub 저장소 co-l/cache-hunter에서 사용할 수 있습니다.
개발자들은 LLM 애플리케이션 하네스의 조용한 캐시 무효화 버그로 인해 발생하는 예상치 못한 지연 시간과 API 비용을 제거할 수 있습니다.
8. Fable 5, 복잡한 NP-난해 벤치마크에서 GPT-5.6 Sol 능가
평가에서는 10^1223의 추정 검색 공간을 특징으로 하는 KIRO라는 미발표 NP-난해 광섬유 네트워크 설계 문제에서 Fable 5와 GPT-5.6 Sol을 비교했습니다. Fable 5는 Fable의 병렬 포트폴리오에 유리한 8-CPU 테스트 환경의 도움을 받아 더 나은 평균 점수와 더 높은 일관성을 달성하며 GPT-5.6 Sol을 능가했습니다. 실험은 또한 Claude Code에서는 별도의 평가자 모델을 통해, Codex에서는 지속된 스레드 상태를 통해 작동하는 `/goal` 명령을 분석했습니다. `/goal` 명령은 개별 시도에서는 다수 승리했지만, 일부 실행에서 큰 성능 저하가 발생하여 두 모델 모두의 평균 성능을 떨어뜨렸습니다.
- • Fable 5는 KIRO 광섬유 네트워크 설계 문제에서 GPT-5.6 Sol보다 더 나은 평균 점수와 더 높은 일관성을 달성했습니다.
- • /goal 명령은 시도에서는 다수 승리했지만, 일부 실행에서 큰 성능 저하가 발생하여 전반적인 평균 성능을 떨어뜨렸습니다.
- • Claude Code는 별도의 평가자 모델을 사용하여 /goal을 구현하는 반면, Codex는 지속된 스레드 상태와 수명 주기 도구를 사용합니다.
- • 벤치마크 환경은 8개의 CPU를 제공했으며, 이는 Fable의 병렬 포트폴리오에 유리하게 작용했습니다.
Claude Code나 Codex를 사용하는 개발자들은 목표 지향 명령이 상당한 성능 저하를 유발할 수 있으므로 주의해서 사용해야 합니다.
9. Trivium CLI 도구, 에이전트 기술의 재현 가능한 관리 지원
에이전트 기술을 관리하기 위해 Trivium이라는 새로운 오픈 소스 CLI 도구가 출시되었습니다. 이 도구를 사용하면 개발자가 수동 파일 관리 없이도 서로 다른 기술 세트 간에 전환할 수 있습니다. Trivium은 기술을 특정 Git 커밋에 고정하고 `skills.lock` 파일을 사용하여 추적함으로써 재현성을 보장합니다. 또한 서로 다른 기술 구성을 저장하고 활성화하기 위한 명명된 환경도 지원합니다. 저장소는 GitHub에서 공개적으로 호스팅됩니다.
- • Trivium을 사용하면 개발자가 수동 파일 조작 없이도 서로 다른 에이전트 기술 세트 간에 전환할 수 있습니다.
- • 이 도구는 재현성을 위해 기술을 특정 Git 커밋에 고정하고 skills.lock 파일을 사용하여 추적합니다.
- • 서로 다른 기술 구성을 저장하고 활성화하기 위한 명명된 환경을 지원합니다.
- • 오픈 소스 저장소는 GitHub의 AlapinEnjoyer/trivium에서 호스팅됩니다.
개발자들은 수동 파일 관리 없이도 환경 전반에서 서로 다른 에이전트 기술 구성을 안정적으로 버전 관리하고 전환할 수 있습니다.