1. Mercury 2.5 출시: 더 빠른 속도와 확장된 컨텍스트 윈도우
지난 6월 출시된 Mercury 2 모델을 기반으로 한 2.5 버전은 처리량 증가, 훨씬 커진 컨텍스트 윈도우, 그리고 조정 가능한 추론 및 네이티브 스키마 정렬 JSON 출력과 같은 새로운 기능을 제공합니다. 이번 업데이트는 개발자들에게 실시간 음성 에이전트와 복잡한 에이전트 워크플로우를 위한 향상된 성능을 제공합니다.
- • Mercury 2.5는 생성 속도를 초당 1,107 토큰으로 개선하고 260K 토큰 컨텍스트 윈도우를 추가했습니다.
- • 새로운 기능으로는 조정 가능한 추론, 병렬 도구 호출, 네이티브 스키마 정렬 JSON 출력이 포함됩니다.
- • 표준 가격은 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $0.75이며, 일시적인 출시 할인이 적용됩니다.
- • 초기 사용자들은 170ms의 중앙값 지연 시간과 컨텍스트 압축 비용의 90% 절감을 보고했습니다.
- • 이 모델은 Inception API, Baseten, OpenRouter를 통해 즉시 사용할 수 있습니다.
개발자들은 이제 경쟁력 있는 가격으로 실시간 음성 에이전트와 복잡한 에이전트 워크플로우를 위해 더 높은 성능과 확장된 컨텍스트 기능을 활용할 수 있습니다.
2. OpenAI, 새로운 API 모델을 포함한 ChatGPT Images 2.5 출시
ChatGPT Images 2.5는 ChatGPT, ChatGPT Work, Codex 사용자를 위한 데스크톱, 모바일 및 웹 플랫폼에서 사용할 수 있습니다. 이번 릴리스는 멀티모달 속도와 제어 측면에서 중요한 진전을 의미하며, 개발자들에게 스케치와 국소적 편집을 통해 이미지 생성을 안내할 수 있는 더 세밀한 도구를 제공합니다.
- • OpenAI는 일반용 GPT-Image-2.5 Flare와 고정밀 창의적 워크플로우용 GPT-Image-2.5 Sunburst라는 두 가지 새로운 API 모델을 출시했습니다.
- • 새로운 이미지 엔진은 이전 Images 2.0 버전에 비해 이미지 생성 지연 시간을 최대 50%까지 줄였습니다.
- • 이 모델은 단일 AI 미학에서 벗어나 사람과 반려동물의 특징을 보존하는 능력이 향상되었습니다.
- • 새로운 편집 기능에는 참조 가이드를 직접 그리는 스케치(Sketch)와 이전 편집 내용을 유지하면서 특정 이미지 영역을 수정하는 도구가 포함됩니다.
- • 이 모델에는 AI 생성 콘텐츠를 식별하기 위한 자동 보이지 않는 워터마킹 및 C2PA 메타데이터를 포함한 안전 장치가 통합되어 있습니다.
개발자들은 더 빠르고 충실도가 높은 이미지 생성과 스케치 기반의 정밀한 편집 워크플로우를 애플리케이션에 직접 통합할 수 있습니다.
3. inclusionAI, 멀티모달 VL 모델로 Ling-3.0-flash 제품군 확장
8월 초 출시된 Ling-3.0-flash 아키텍처를 기반으로, inclusionAI는 Ling-3.0-flash-VL을 도입했습니다. 이 새로운 멀티모달 변형은 기존 모델 제품군에 네이티브 이미지 및 비디오 이해 기능을 추가했으며, 희소 MoE 설계와 시공간 추론을 위한 특수 VideoRoPE 구성 요소를 활용합니다.
- • Ling-3.0-flash-VL은 124B 파라미터 희소 MoE 모델로, 토큰당 5.5B 파라미터를 활성화합니다.
- • 이 모델은 100만 토큰 컨텍스트 윈도우를 지원합니다.
- • ViT 시각 인코더와 2계층 MLP 프로젝터를 통합하여 네이티브 멀티모달 처리를 수행합니다.
- • 특수 VideoRoPE 구성 요소는 정밀한 이벤트 위치 파악 및 비디오 편집을 가능하게 합니다.
- • 이 모델은 현재 Hugging Face에서 사용할 수 있습니다.
이번 릴리스는 Ling-3.0-flash 생태계를 확장하여 개발자들에게 복잡한 추론 작업을 위해 방대한 비디오 및 이미지 입력을 처리할 수 있는 고용량 멀티모달 모델을 제공합니다.
4. DeepSeek, 네이티브 멀티모달 지원을 포함한 Flash API V4.1로 업그레이드
V4-Flash 시리즈를 기반으로 DeepSeek는 V4.1 Flash 모델을 베타 버전으로 도입했습니다. 이번 업데이트는 기존 가격 구조를 유지하면서 네이티브 멀티모달 지원을 통합하여 이전 V4-Flash API를 발전시켰습니다. 개발자들은 이제 API 모델 문자열을 업데이트하여 이 업그레이드된 아키텍처에 액세스할 수 있으며, Flash 생태계의 진화를 이어가고 있습니다.
- • DeepSeek V4.1 Flash는 네이티브 멀티모달 지원을 갖춘 새로운 아키텍처를 도입합니다.
- • 베타 버전은 API 모델 이름을 deepseek-v4.1-flash-expires-on-0910으로 설정하여 액세스할 수 있습니다.
- • 가격은 이전 V4-Flash 모델과 동일합니다.
- • 베타 버전에는 계정당 20개의 동시 요청 제한이 포함되어 있습니다.
개발자들은 이제 API 모델 문자열을 업데이트함으로써 V4-Flash 생태계에서 구축된 기능을 바탕으로 업그레이드된 네이티브 멀티모달 플래시 모델에 액세스할 수 있습니다.
5. Reducto, r-1 단일 패스 문서 파서 출시
텍스트, 표 구조, 레이아웃, 읽기 순서 및 서식을 단일 패스로 통합함으로써 r-1은 다단계 파이프라인의 지연 시간과 복합적인 오류를 우회합니다. Reducto는 향후 r-1 미니 모델과 자동 페이지별 라우팅으로 라인업을 확장할 계획입니다.
- • r-1 모델은 복잡한 다단계 에이전트 OCR 파이프라인을 대체하여 전체 페이지를 단일 패스로 처리합니다.
- • Reducto는 기존 에이전트 문서 파싱 파이프라인 대비 오류율이 20% 감소했다고 보고합니다.
- • 가격은 기존 모델의 페이지당 3~6센트에서 페이지당 1센트의 고정 비용으로 설정되었습니다.
- • 이 모델은 Reducto의 V3 Parse API를 통해 미리보기로 제공되며 활성화하려면 특정 구성 플래그가 필요합니다.
- • Reducto는 조직이 다른 파서와 나란히 비교할 수 있도록 최대 5,000달러의 크레딧을 제공하고 있습니다.
- • 현재 r-1 모델에 대해 공개 가중치나 로컬 자체 호스팅 옵션은 없습니다.
개발자들은 RAG 파이프라인을 위한 텍스트, 표 및 레이아웃 추출의 정확도를 향상시키면서 문서 수집 비용을 크게 낮출 수 있습니다.
6. Anthropic, API 및 구독 토큰 도난을 포함하도록 보안 경고 확대
인포스틸러(infostealer) 악성코드에 대한 이전 보안 조치를 바탕으로, Anthropic은 이제 Claude API 및 구독 토큰을 훔치려는 지속적인 시도에 대해 구독자들에게 경고했습니다. 이러한 상황은 무단 액세스 시도가 세션 하이재킹을 넘어 진화했음을 나타내며, 개발자들은 API 키를 감사하고 비정상적인 사용에 대해 청구 대시보드를 모니터링해야 합니다.
- • Anthropic은 Claude API 및 구독 토큰 도난에 관한 새로운 경고를 발표했습니다.
- • 이는 인포스틸러 악성코드로 인한 세션 하이재킹을 완화하려는 이전 노력에 따른 것입니다.
- • 개발자들은 API 키를 교체하고 무단 사용 급증에 대해 청구 대시보드를 모니터링할 것을 권장합니다.
개발자들은 이제 무단 청구 요금을 방지하기 위해 보안 감사를 세션 관리에서 활성 API 키 및 구독 자격 증명까지 확장해야 합니다.
7. NVIDIA, 새로운 SIMT 컴파일러로 Rust-for-GPU 이니셔티브 확장
NVIDIA는 'CUDA Rust' 이니셔티브 하에 Rust-for-GPU 노력을 공식화했습니다. 이는 이전에 출시된 cutile-rs(타일 기반 시스템)를 확장하여 SIMT 실행 모델을 위해 설계된 새로운 트랙인 cuda-oxide를 도입합니다. cutile-rs는 JIT 컴파일된 타일 기반 커널을 위해 계속 사용할 수 있지만, cuda-oxide는 Rust MIR을 PTX로 컴파일하는 경로를 제공하며, 고정된 나이트리(nightly) 툴체인과 컴퓨팅 성능 8.0 이상의 하드웨어가 필요합니다. 두 프로젝트 모두 현재 알파 단계입니다.
- • 'CUDA Rust' 이니셔티브는 이제 기존 cutile-rs와 새로운 cuda-oxide 프로젝트를 모두 포함합니다.
- • cuda-oxide는 Rust MIR을 PTX로 컴파일하여 SIMT 실행 모델을 타겟팅합니다.
- • cuda-oxide는 고정된 나이트리 툴체인, Linux, 컴퓨팅 성능 8.0 이상의 NVIDIA GPU가 필요합니다.
- • cutile-rs는 타일 기반 커널 개발을 위해 안정적인 Rust 1.89+ 및 CUDA 13.3을 계속 지원합니다.
- • 두 트랙 모두 알파 단계이며 아직 프로덕션용으로는 권장되지 않습니다.
이 이니셔티브는 NVIDIA의 Rust 지원을 통합하여 개발자들에게 메모리 안전 GPU 커널 개발을 달성하기 위한 SIMT와 타일이라는 두 가지 별도의 경로를 제공합니다.
8. Infercat, 암호화된 P2P 터널을 통해 로컬 AI 모델 공유
Infercat은 로컬 하드웨어를 사실상 개인용 미니 클라우드로 전환합니다. 공개 포트나 복잡한 네트워크 구성이 필요 없으므로 개발자가 서로 다른 장치에서 로컬 모델을 협업하거나 테스트할 수 있는 매우 안전하고 마찰 없는 방법을 제공합니다.
- • Infercat은 tailcat을 사용하여 호스트 머신과 클라이언트 간에 안전한 종단간 암호화 P2P 터널을 구축합니다.
- • 이 도구는 llama.cpp, vLLM, Ollama, LM Studio를 포함한 인기 있는 로컬 추론 엔진을 지원합니다.
- • OpenAI 호환 API를 제공하여 Cursor, Claude Code, Open WebUI와의 원활한 통합을 가능하게 합니다.
- • 사용자는 외부 계정이나 시스템 수준의 VPN 구성 없이도 간단한 초대 코드를 생성하여 액세스 권한을 부여할 수 있습니다.
- • 호스트 머신은 기본적인 사용 통계를 기록하지만 개인 대화 기록은 저장하지 않습니다.
개발자가 복잡한 VPN이나 클라우드 호스팅을 설정하지 않고도 로컬 GPU 설정을 외부 클라이언트, 협업자 또는 코딩 도구에 노출할 수 있습니다.
9. I-Have-ADHD 플러그인, Claude Code에서 대화형 필러 제거
현대 LLM의 전형적인 정중하지만 시간이 많이 걸리는 대화형 군더더기를 제거함으로써, i-have-adhd 플러그인은 터미널 기반 코딩 어시스턴트를 순수한 속도와 유틸리티에 최적화합니다. 이는 로컬 개발 환경을 최대의 집중력을 위해 사용자 정의할 수 있는 매우 실용적인 방법을 제공합니다.
- • 이 플러그인은 다음 행동을 먼저 제시하고 목록을 5개 항목으로 제한하는 것을 포함하여 LLM 응답에 대한 10가지 특정 규칙을 적용합니다.
- • 서론, 요약, 맺음말과 같은 대화형 요소를 엄격히 금지합니다.
- • 이 도구는 오픈 소스이며 MIT 라이선스 하에 GitHub에서 호스팅되며 ADHD 대처 전략을 느슨하게 기반으로 합니다.
- • Claude Code 설치를 위해서는 저장소를 복제하고 CLI 명령을 사용하여 로컬 마켓플레이스에 플러그인을 추가해야 합니다.
개발자들은 반복적인 대화형 필러를 제거하고 모델이 즉시 실행 가능한 코드를 제시하도록 강제함으로써 Claude Code와의 상호 작용 속도를 높일 수 있습니다.
10. Hip-Agent: 200줄의 가벼운 Python 에이전트 하네스
프롬프트 내에 직접 맞도록 설계된 hip-agent는 더 큰 에이전트 프레임워크의 복잡성을 피합니다. 작업을 셸 명령으로, 하위 에이전트를 자식 프로세스로 처리함으로써 LLM 기반 자동화를 구축하고 오케스트레이션하는 깔끔하고 Unix와 유사한 접근 방식을 제공합니다.
- • hip-agent의 핵심 루프는 약 200줄의 Python 코드로 구현됩니다.
- • 하네스는 구성을 위해 표준 환경 변수를 사용하고 셸 명령을 통해 작업을 실행합니다.
- • 하네스 내의 하위 에이전트는 표준 자식 프로세스로 구현됩니다.
- • 이 도구에는 Codex API와 통합하기 위한 전용 모듈이 포함되어 있습니다.
- • 나머지 에이전트 기능을 위해 기존 프로토콜과 형식을 따릅니다.
개발자들에게 비대해진 에이전트 프레임워크에 대한 간단하고 매우 투명한 대안을 제공하여 에이전트 실행 루프를 쉽게 검사, 사용자 정의 및 디버깅할 수 있게 합니다.
11. Deltafin, SSD 스트리밍을 통해 2.8T Kimi K3 모델 로컬 실행
Deltafin은 Moonshot AI와 제휴하지 않은 독립적인 오픈 소스 프로젝트로 운영됩니다. 가지치기(pruning)를 피하고 대신 고속 SSD에서 전체 2.8조 파라미터 모델을 스트리밍함으로써, 접근 가능한 하드웨어에서 거대한 전문가 혼합(MoE) 모델을 로컬로 실행할 수 있는 새로운 경로를 제공합니다.
- • Deltafin은 128GB RAM을 탑재한 M1 Max MacBook Pro에서 512토큰 답변에 대해 초당 1.0 토큰의 안정적인 디코딩 속도를 달성했습니다.
- • 이 도구는 SSD에서 모델 전문가를 스트리밍하며, 단일 드라이브에서 52%에서 4개 드라이브 구성에서 90%까지 성능이 확장됩니다.
- • 현재 프리필(prefill) 제한으로 인해 반복적인 전문가 읽기로 인해 512토큰 프롬프트가 첫 번째 토큰을 생성하는 데 6.3분이 걸립니다.
- • 개발자들은 추측 디코딩(speculative decoding)을 통해 Qwen 모델을 통합하여 원시 텍스트 완성을 가속화할 수 있으며, 여기서 더 작은 모델이 Kimi K3가 검증할 토큰을 제안합니다.
- • Deltafin은 MIT 라이선스 하에 표준 채팅 및 완성 엔드포인트를 지원하는 OpenAI 호환 서버를 포함합니다.
개발자들이 엔터프라이즈급 GPU 클러스터 없이도 표준 워크스테이션에서 거대한 프론티어급 모델을 로컬로 실행할 수 있게 합니다.
12. Edge Browser Agent, 구형 모바일 하드웨어에서 1B 미만 모델 실행
이 실험은 엣지 에이전트를 위한 입력 표현을 최적화하는 것의 엄청난 성능 향상을 강조합니다. 작은 모델들은 여전히 주제별 미끼를 식별하는 것과 같은 판단 기반 작업에 어려움을 겪지만, 구조화된 인식 계층은 10년 된 하드웨어에서도 기본적인 웹 스크래핑과 데이터 추출을 매우 실행 가능하게 만듭니다.
- • 연구원들은 Termux 내의 llama.cpp를 사용하여 2017년형 Samsung Galaxy Note 8에서 Qwen3-0.6B와 같은 모델을 성공적으로 실행했습니다.
- • 이 시스템은 원시 HTML이나 무거운 스크린샷 대신 약 200토큰의 구조화된 웹페이지 표현을 모델에 제공합니다.
- • Qwen3-0.6B 및 Llama-3.2-3B를 포함한 1B 및 2B 미만 모델은 샌드박스 도서 스크래핑 작업에서 10/10 성공률을 달성했습니다.
- • 구조화된 인식 대신 원시 HTML을 사용하면 작업 실행 시간이 80초에서 22분으로 증가하고 작업 실패가 발생했습니다.
- • 이 프로젝트는 오픈 소스이며 GitHub(github.com/e2llm/edge-browser-agent)에서 사용할 수 있습니다.
개발자들이 값비싼 클라우드 API나 고사양 모바일 GPU 없이도 장치에서 완전히 실행되는 매우 효율적이고 지연 시간이 짧은 브라우저 에이전트를 구축할 수 있음을 증명합니다.
13. 262K 컨텍스트에서 Qwen3.8-Flash-Next에 대한 추론 엔진 벤치마크
벤치마크는 NVIDIA RTX PRO 6000 Blackwell GPU와 AMD Ryzen 9 9950X CPU가 장착된 워크스테이션에서 수행되었습니다. GSM8K 및 MATH-500과 같은 표준 벤치마크에서의 정확도는 모든 엔진에서 통계적으로 동일하게 유지되었지만, 프리필 시간과 에너지 소비의 극적인 차이는 프로덕션 수준의 로컬 배포를 위한 엔진 선택의 중요성을 강조합니다.
- • 262K 컨텍스트 윈도우에서 SGLang은 첫 토큰 생성 시간이 35.4초였으며, FreeToken은 80.4초, 기본 llama.cpp는 258.4초였습니다.
- • FreeToken은 컨텍스트 스윕 전반에 걸쳐 초당 100.1~94.8 토큰의 일정한 디코딩 속도를 유지한 반면, 기본 llama.cpp는 초당 101.9에서 20.2 토큰으로 성능이 저하되었습니다.
- • llama.cpp Multi-Token Prediction 포크는 코딩 테스트에서 디코딩 속도를 최대 1.69배 향상시켰지만, 모든 모델 전문가가 GPU에 남아 있을 때만 가능했습니다.
- • SGLang은 요청 기간이 짧아 전체 윈도우 요청에 대해 약 13kJ의 GPU 에너지를 소비한 반면, 기본 llama.cpp는 116kJ을 소비했습니다.
- • 첫 번째 답변에 도달하는 시작 시간은 llama.cpp가 16초로 가장 빨랐으며, SGLang은 108초, FreeToken은 126초였습니다.
개발자들은 하드웨어에 최적화된 추론 엔진을 선택함으로써 긴 컨텍스트 로컬 모델의 지연 시간과 에너지 비용을 크게 줄일 수 있습니다.
14. Qwen3.8 27B, 이전 양자화 저하 문제 극복
Q4_K_M 양자화를 사용하는 27B 모델에서 상당한 수학 및 추론 저하를 확인했던 이전 보고서를 바탕으로, Qwen3.8 27B 모델에 대한 새로운 평가 결과 이 버전이 GPQA Diamond 및 Terminal-Bench 2.1과 같은 주요 벤치마크에서 전체 정밀도 성능을 보존함을 확인했습니다. 이는 최신 모델 아키텍처가 이전 모델보다 표준 4비트 압축에 더 탄력적임을 나타냅니다.
- • Qwen3.8 27B의 Q4_K_M 양자화는 GPQA Diamond 및 Terminal-Bench 2.1에서 전체 정밀도 BF16 성능과 일치합니다.
- • 이는 동일한 Q4_K_M 양자화 하에서 수학 정확도가 9% 하락한 것을 보여준 이전 27B 모델 평가와 대조됩니다.
- • 이 모델은 약 64k 토큰의 컨텍스트를 유지하면서 단일 24GB GPU에 맞습니다.
- • 극단적인 1비트 양자화는 이전 모델 세대의 결과와 일관되게 여전히 사용할 수 없습니다.
개발자들은 이제 이전 27B 반복에서 관찰되었던 정확도 절충 없이 소비자용 하드웨어에서 4비트 양자화를 사용하여 Qwen3.8 27B 모델을 배포할 수 있습니다.
15. 듀얼 RTX 4090 GPU에서의 로컬 에이전트 동시성 벤치마킹
벤치마크는 동시 에이전트 슬롯에 관계없이 총 프리필 처리량이 초당 약 1,500 토큰으로 일정하게 유지됨을 보여줍니다. 이러한 로컬 모델을 활성 워크플로우에 통합하려는 개발자들을 위해, 이 설정은 Claude Code 내의 하위 에이전트로 작동하도록 MCP 서버로 노출될 수 있습니다.
- • 128GB RAM을 탑재한 듀얼 RTX 4090 시스템은 64k 컨텍스트에서 5개의 동시 에이전트에서 소프트 제한에 도달했으며, 그 이상에서는 처리량 증가 없이 지연 시간이 증가했습니다.
- • 시스템의 하드 제한은 VRAM 가용성에 의해 엄격히 제한되는 64k 컨텍스트에서 9개의 동시 에이전트였습니다.
- • Qwen 27B 모델은 도구 호출당 3.40초를 달성하여 11.91초가 걸린 122B MoE 모델보다 훨씬 뛰어난 성능을 보였습니다.
- • 최대 251,557 토큰까지의 장거리 검색에 대해 Q4_K_M, Q6_K_XL, Q8_K_XL 양자화 간에 측정 가능한 정확도 차이는 발견되지 않았습니다.
- • KV 캐시에 q8_0을 사용하면 f16 대비 품질이나 속도 저하 없이 슬롯당 1.4 GiB의 VRAM을 절약했습니다.
개발자들은 모델 크기와 양자화 수준을 특정 VRAM 및 동시성 제한에 맞춤으로써 로컬 에이전트 아키텍처를 최적화할 수 있습니다.