1. Thinking Machines Lab, 첫 공개 멀티모달 모델 'Inkling' 출시
지난 5월 멀티모달 상호작용 아키텍처를 선보였던 Thinking Machines Lab이 첫 번째 공개 모델인 Inkling을 출시했습니다. 이번 출시는 연구용 프리뷰에서 프로덕션 수준의 오픈 웨이트 모델로 전환되었음을 의미하며, 총 9750억 개의 파라미터와 제어 가능한 추론 노력을 특징으로 합니다. 45조 개의 멀티모달 데이터 토큰으로 처음부터 학습된 이 모델은 256개의 라우팅 전문가와 2개의 공유 전문가로 구성된 66계층 디코더 전용 트랜스포머를 활용합니다.
- • Inkling은 총 9750억 개의 파라미터와 410억 개의 활성 파라미터를 갖춘 오픈 웨이트 기반의 네이티브 멀티모달 MoE 모델입니다.
- • 개발자가 추론 예산을 0.2에서 0.99 사이로 프로그래밍 방식으로 조정할 수 있는 '제어 가능한 사고 노력(controllable thinking effort)' 메커니즘을 제공합니다.
- • 100만 토큰의 컨텍스트 윈도우를 지원하며 텍스트, 이미지, 오디오 입력을 처리할 수 있습니다.
- • Apache 2.0 라이선스로 출시되었으며, Hugging Face에서 가중치를 이용할 수 있습니다.
- • TogetherAI, Fireworks, Modal, Databricks, Baseten 등 파트너사의 호스팅 API를 통해 Inkling에 액세스할 수 있습니다.
이번 출시를 통해 해당 기업의 멀티모달 기술이 대중에게 공개되었으며, 개발자들은 이전에 발표된 상호작용 연구를 기반으로 한 고파라미터 모델을 활용할 수 있게 되었습니다.
2. Soofi 컨소시엄, Soofi S 30B-A3B 하이브리드 MoE 모델 출시
KI Bundesverband가 주도하는 Soofi 컨소시엄이 Hugging Face에 Soofi S 30B-A3B의 프리뷰 가중치를 공개했습니다. 하이브리드 Mamba-Transformer MoE로 구축된 이 모델은 Mamba-2 시퀀스 혼합 계층과 세분화된 MoE 및 GQA(Grouped-Query Attention) 계층을 결합하여 성능과 효율성을 최적화했습니다. 학습 과정에서는 26조 6800억 개의 토큰에 걸쳐 Warmup–Stable–Decay 스케줄을 사용했으며, 2단계 학습에서 독일어 데이터 비중을 15.32%까지 높였습니다.
- • Soofi S 30B-A3B는 총 316억 개의 파라미터와 토큰당 32억 개의 활성 파라미터를 가진 오픈 웨이트 하이브리드 Mamba-Transformer MoE 모델입니다.
- • 최대 100만 토큰의 컨텍스트 윈도우를 지원하며 vLLM을 통해 배포할 수 있습니다.
- • 아키텍처는 23개의 Mamba-2 시퀀스 혼합 계층, 23개의 세분화된 MoE 계층, 6개의 GQA 계층을 포함한 총 52개 계층으로 구성됩니다.
- • 다른 오픈 베이스 모델들과 비교 평가한 결과, 영어 종합 점수 70.1점, 독일어 종합 점수 79.1점을 기록했습니다.
- • 독일 연방 경제기후보호부의 지원을 받아 학습되었으며, Deutsche Telekom의 Industrial AI Cloud에서 최대 512개의 NVIDIA B200 GPU를 사용하여 수행되었습니다.
개발자들은 vLLM을 사용하여 100만 토큰 컨텍스트 윈도우를 갖춘 고효율 오픈 웨이트 독일어/영어 하이브리드 모델을 배포할 수 있습니다.
3. Google, Pixel 10 TPU에 최적화된 Gemma 4 E2B 공식 출시
Gemma 4 12B 모델 출시와 이후 모바일 하드웨어에서 이를 구동하려는 커뮤니티의 노력을 바탕으로, Google은 Gemma 4 E2B를 선보였습니다. 이 버전은 Pixel 10의 TPU(Tensor Processing Unit)에 특별히 최적화되어, 이전의 커뮤니티 구현 방식을 뛰어넘는 네이티브, 저지연, 오프라인 멀티모달 기능을 제공합니다.
- • Gemma 4 E2B는 Gemma 4 아키텍처를 TPU에 최적화한 공식 버전입니다.
- • 오디오 전사 및 이미지 식별을 포함한 네이티브 오프라인 멀티모달 작업을 지원합니다.
- • 개인 음성 또는 텍스트 명령을 통해 시스템 수준의 전화 기능을 직접 제어할 수 있습니다.
- • 실험적인 커뮤니티 주도의 로컬 추론에서 지원되는 하드웨어 가속 네이티브 기능으로 전환되었습니다.
이번 공식 최적화를 통해 개발자들은 실험적인 커뮤니티 설정을 넘어, Pixel 10 애플리케이션에 개인화된 온디바이스 멀티모달 AI를 통합할 수 있는 안정적이고 고성능의 경로를 확보하게 되었습니다.
4. SpaceXAI, Grok Build 터미널 코딩 에이전트 오픈소스화
SpaceXAI는 Grok Build의 소스 코드를 공개하며, 기존의 유료 폐쇄형 베타 상태였던 터미널 기반 개발자 도구를 오픈소스 프로젝트로 전환했습니다. 전체 화면 텍스트 사용자 인터페이스(TUI)로 작동하는 Grok Build는 대화형으로 실행하거나 CI 파이프라인 내에서 헤드리스(headless) 방식으로 실행할 수 있습니다. 또한 표준화된 Agent Client Protocol을 사용하여 외부 편집기와 통합되므로 현대적인 개발 환경에 유연하게 추가할 수 있습니다.
- • Grok Build는 이제 Apache License 2.0 하에 오픈소스화되었습니다.
- • 터미널 기반 AI 코딩을 위한 전체 화면 TUI로 작동합니다.
- • 대화형 사용, CI를 위한 헤드리스 작동, Agent Client Protocol을 통한 편집기 통합을 지원합니다.
- • macOS, Linux, Windows용 사전 빌드 바이너리가 제공되며, 소스 빌드에는 Rust와 protoc이 필요합니다.
- • 오픈소스 라이선스임에도 불구하고 외부 기여는 허용되지 않습니다.
오픈소스 전환을 통해 이전에는 유료 구독이 필요했던 터미널 기반 AI 코딩 에이전트를 개발자들이 자유롭게 접근하고 수정할 수 있게 되었습니다.
5. deja, SSH 동기화 메모리를 위해 로컬 코딩 에이전트 기록 인덱싱
실시간으로 새로운 데이터를 캡처하는 메모리 플랫폼과 달리, deja는 설치 전 생성된 세션을 포함한 기존 에이전트 로그를 인덱싱합니다. 이 도구는 MCP(Model Context Protocol) 워크플로우와 통합되는 안전한 로컬 메모리 계층을 제공하며, Go, npm, Homebrew 또는 셸 스크립트를 통해 설치할 수 있습니다.
- • deja는 Claude Code, Codex, opencode의 로컬 대화 기록을 인덱싱하는 제로 의존성 Go 바이너리입니다.
- • 로컬에서 증분 인덱싱을 수행하며 데이터를 ~/.cache/deja의 역색인(inverted index)에 저장합니다.
- • 인덱싱 과정에서 API 키, 토큰, JWT와 같은 민감한 자격 증명을 자동으로 마스킹합니다.
- • MCP 리콜, 세션 시작 시 자동 리콜, 공유 폴더나 SSH를 통한 기기 간 동기화 기능을 제공합니다.
- • 네트워크 코드 없이 완전히 로컬에서 작동하여 데이터 프라이버시를 보장하며 MIT 라이선스를 따릅니다.
Claude Code와 같은 코딩 에이전트를 사용하는 개발자들에게 기기 간 자동 동기화 및 민감한 자격 증명 마스킹 기능을 갖춘 로컬, 보안, 검색 가능한 메모리 계층을 제공합니다.
6. Google, WebGPU 가속 브라우저 추론을 위한 LiteRT.js 출시
Google의 LiteRT.js 출시는 웹 브라우저에 고성능 하드웨어 가속 온디바이스 추론을 제공합니다. 이 라이브러리는 모델을 가속기에 완전히 위임해야 하며, 위임할 수 없는 경우 CPU 실행으로 대체됩니다. Google은 모델 추론에는 LiteRT.js를 사용하고, 전처리 및 후처리 작업에는 TensorFlow.js를 계속 사용할 것을 권장합니다.
- • LiteRT.js는 네이티브 LiteRT(구 TensorFlow Lite) 런타임을 WebAssembly로 컴파일하여 브라우저에서 모델을 직접 실행합니다.
- • CPU용 XNNPACK, GPU용 WebGPU 기반 ML Drift, NPU용 실험적 WebNN API 등 세 가지 백엔드를 활용합니다.
- • Google은 다른 웹 런타임 대비 최대 3배 빠른 성능을 보고하며, GPU/NPU 백엔드에서는 CPU 대비 5~60배의 속도 향상을 제공합니다.
- • TorchDynamo로 내보낼 수 있고 정적 차원을 가진 PyTorch 모델은 LiteRT Torch를 사용하여 .tflite 형식으로 변환할 수 있습니다.
- • 개발자는 LiteRT.js에서 메모리 누수를 방지하기 위해 delete를 호출하여 텐서 메모리를 수동으로 관리해야 합니다.
웹 개발자들이 WebGPU와 WebAssembly를 사용하여 최대 3배 빠른 성능으로 브라우저에서 직접 하드웨어 가속 온디바이스 AI 모델을 실행할 수 있게 합니다.
7. ExLlamaV3, 주요 성능 업그레이드와 함께 프로덕션 v1.0.0 도달
1년 이상의 개발 끝에 ExLlamaV3가 첫 번째 프로덕션 준비 릴리스에 도달했습니다. 이번 업데이트는 성능과 배포 용이성에 중점을 두어 외부 flash-attention-2 및 xformers 라이브러리에 대한 의존성을 제거했습니다. 또한 MoE 커널 티켓 스케줄러를 도입하고 GptOssForCausalLM 및 NemotronHForCausalLM 모델에 대한 지원을 추가했으며, 컴파일 속도도 향상되었습니다.
- • ExLlamaV3 v1.0.0은 flash-attention-2 및 xformers에 대한 의존성을 제거하여 로컬 빌드 및 배포 과정을 간소화했습니다.
- • Gemma 4를 포함한 대부분의 모델에 텐서 병렬 지원이 확장되었습니다.
- • 새로운 어텐션 커널이 온라인 캐시 양자화와 SWA 계층 및 어텐션 싱크를 위한 이중 입력을 지원합니다.
- • 새로운 conv1d 커널이 도입되어 causal_conv1d가 필요하지 않게 되었습니다.
- • Ampere 아키텍처에서의 GEMM/GEMV 성능 향상과 새로운 INT8 GEMV 커널을 포함한 성능 개선이 이루어졌습니다.
flash-attention-2와 같은 무거운 의존성을 제거하고 Gemma 4와 같은 모델에 대한 텐서 병렬 지원을 추가하여 로컬 LLM 추론을 가속화하고 배포를 간소화합니다.
8. Anthropic, Claude 메모리 데이터 유출 취약점 수정
한 보안 연구원이 일일 요약 및 검색 도구를 통해 고충실도 사용자 프로필을 저장하는 Claude의 메모리 시스템에 대한 데이터 유출 공격을 시연했습니다. 공격자는 Claude가 악성 웹사이트를 방문하도록 유도하여 web_fetch 도구가 링크 디렉토리 구조를 따라가게 함으로써 민감한 사용자 데이터를 인코딩하고 유출할 수 있었습니다. Anthropic은 web_fetch가 외부 링크를 따라가지 못하도록 제한하여 이 위협을 완화했습니다.
- • 보안 연구원 Ayush Paul이 저장된 사용자 프로필을 유출할 수 있는 Claude 메모리 시스템의 취약점을 발견했습니다.
- • 이 공격은 Claude의 web_fetch 도구를 악용하여 모델이 악성 사이트의 URL 경로를 통해 민감한 데이터를 인코딩하고 전송하도록 강제했습니다.
- • 사용자가 Claude에게 악성 사이트 방문을 요청하거나 해당 사이트가 검색 결과에 나타날 경우 취약점이 트리거될 수 있었습니다.
- • Anthropic은 web_fetch가 외부 페이지의 링크를 따라가는 기능을 비활성화하여 탐색 범위를 검색 결과 및 사용자가 제공한 URL로 제한함으로써 문제를 해결했습니다.
- • 이 취약점은 Anthropic의 HackerOne 버그 바운티 프로그램을 통해 공개되었으나, 내부적으로 이미 식별된 문제였기에 별도의 포상금은 지급되지 않았습니다.
웹 브라우징 에이전트를 구축하는 개발자들에게 중요한 데이터 유출 경로를 알리고, Claude의 web_fetch 도구에서 외부 링크 추적을 비활성화한 Anthropic의 완화 조치를 설명합니다.
9. Ambiance LLM 하니스, Unix 파일 시스템을 에이전트 인터페이스로 활용
Ambiance는 데이터, 로그, 구성을 저장하기 위한 기본 인터페이스로 로컬 파일 시스템을 처리함으로써 에이전트 런타임 환경을 재정의합니다. 이벤트 기반 커널을 사용하여 파일 시스템 변경 사항을 모니터링함으로써, 이 하니스는 에이전트가 외부 상태 변화에 즉각 대응하도록 보장하며 기존 에이전트 루프에 대한 구조화된 대안을 제공합니다.
- • Ambiance는 에이전트의 기존 코딩 및 시스템 관리 지식을 활용하여 인지 부하를 줄입니다.
- • 시스템은 파일 시스템 변경 사항을 모니터링하여 LLM 응답을 트리거하는 이벤트 버스 역할을 하는 '커널'을 특징으로 합니다.
- • 시스템 작업을 위한 'root', 인간 상호작용을 위한 'pai', 저널링을 위한 'librarian' 등 세 가지 기본 LLM 인스턴스를 정의합니다.
- • 이 프로젝트는 Recurse Center에서 시작되었으며 whitematterlabs.ai 또는 설치 스크립트를 통해 테스트할 수 있습니다.
더 안정적이고 반응성이 뛰어난 LLM 에이전트를 구축하기 위한 실험적인 Unix 스타일의 로컬 환경과 이벤트 기반 커널을 제공합니다.