1. DeepReinforce, Ornith 모델 제품군 1.5 버전 업데이트
DeepReinforce는 기존 Ornith-1.0 및 2.0 버전에 이어 Ornith-1.5 모델 제품군을 출시했습니다. 이번 업데이트에는 엔드투엔드 자기 개선 루프를 통해 학습된 9B 밀집 모델, 35B MoE, 397B MoE 모델이 포함됩니다. 1.5 버전은 이전 버전의 성능을 개선했으며, 397B 모델은 Claude Opus 4.8 벤치마크와 대등한 성능을 보이고, 9B 모델은 이제 iOS 및 Android 모바일 배포를 지원합니다.
- • Ornith-1.5 제품군은 9B 밀집 모델, 35B MoE, 397B MoE 모델로 구성됩니다.
- • 397B MoE 모델은 주요 벤치마크에서 Claude Opus 4.8과 대등한 성능을 기록했습니다.
- • 9B 밀집 모델에는 iOS 및 Android용 모바일 최적화 버전이 포함되어 있습니다.
- • 모델들은 작업 생성 및 솔루션 롤아웃을 위한 엔드투엔드 자기 개선 루프로 학습되었습니다.
- • 해당 제품군은 Hugging Face에서 표준 및 GGUF 형식으로 제공됩니다.
이번 릴리스는 개발자들에게 복잡한 추론 및 에이전트 워크플로우를 위한 최신 고성능 오픈 웨이트 모델을 제공하며, 모바일 최적화 옵션까지 포함하고 있습니다.
2. InclusionAI, 베이스 모델 체크포인트로 Ling-3.0 생태계 확장
Ling-3.0 모델 웨이트 초기 공개에 이어, InclusionAI는 Ling-3.0-tiny 및 Ling-3.0-flash에 대한 6개의 베이스 모델 체크포인트를 오픈소스로 공개했습니다. 사전 학습, 중간 학습, WSM 병합 단계에 걸친 이 체크포인트들은 개발자들에게 맞춤형 파인튜닝과 지속적인 사전 학습을 위한 세밀한 시작점을 제공합니다. 모델들은 기존의 학습률 감쇠 방식을 대체하는 WSM(Weighted Checkpoint Merging)을 활용하며, 124B 파라미터 Flash 변형 모델은 코딩 및 추론 작업에서 강력한 성능을 보여줍니다.
- • Ling-3.0-tiny 및 Ling-3.0-flash의 사전 학습, 중간 학습, WSM 병합 단계를 포함하는 6개의 체크포인트가 공개되었습니다.
- • Ling-3.0-tiny-base는 총 7.9B 파라미터(활성 1.3B)를 가지며 기존 Ling-2.5-mini-base보다 뛰어난 성능을 보입니다.
- • Ling-3.0-flash-base는 총 124B 파라미터(활성 5.1B)를 가지며 코딩, 추론, 긴 문맥 작업에 최적화되어 있습니다.
- • 학습 과정에서는 전통적인 학습률 감쇠 대신 WSM(Weighted Checkpoint Merging)을 사용합니다.
- • 완전한 포스트 트레이닝 버전은 Ling-3.0-tiny 및 Ling-3.0-flash로 계속 이용 가능합니다.
이 중간 체크포인트들은 이전에 공개된 최종 웨이트보다 개발자들에게 파인튜닝 및 지속적인 사전 학습을 위한 더 큰 유연성을 제공합니다.
3. TrueFoundry, AI 에이전트 하니스 'TrueForge' 오픈소스 공개
TrueFoundry는 기업 개발자들이 비용 효율적이고 벤더 중립적인 에이전트를 구축 및 관리할 수 있도록 돕는 MIT 라이선스 AI 에이전트 하니스 'TrueForge'를 오픈소스로 공개했습니다. TrueForge는 대규모 도구 결과를 파일로 오프로딩하고 대화 기록을 압축하는 등의 컨텍스트 엔지니어링 기술을 사용하여 API 비용을 최소화합니다. 또한, 샌드박스-애즈-어-툴(sandbox-as-a-tool) 아키텍처를 통해 안전한 코드 실행을 위한 격리된 환경을 필요에 따라 제공하며, 관리형 에이전트 플랫폼에 대한 매우 효율적인 대안을 제시합니다.
- • TrueForge는 TrueFoundry에 의해 MIT 라이선스로 공개되었습니다.
- • 모델 비용 절감을 위해 컨텍스트 엔지니어링(대규모 도구 결과 파일 오프로딩, 기록 압축)을 활용합니다.
- • 필요할 때만 격리된 환경을 프로비저닝하는 샌드박스-애즈-어-툴 아키텍처를 특징으로 합니다.
- • TrueFoundry는 Enterprise-Bench에서 GLM-5.2를 사용하는 TrueForge가 Claude Opus 4.8을 사용하는 Claude Managed Agents보다 75% 저렴하다고 주장합니다.
- • 액세스 제어 및 거버넌스를 위해 TrueFoundry의 상용 AI Gateway와 연동할 수 있습니다.
개발자들에게 샌드박싱과 컨텍스트 최적화가 내장된 벤더 중립적이고 비용 효율적인 AI 에이전트 배포 및 관리 프레임워크를 제공합니다.
4. 프로덕션급 에이전트 포스트 트레이닝을 위한 Miles v0.1 출시
Miles v0.1이 프로덕션급 AI 에이전트 포스트 트레이닝을 위한 오픈 시스템으로 출시되었습니다. 이 프레임워크를 통해 개발자는 격리된 샌드박스 환경에서 여러 에이전트 인스턴스를 실행하고, 성능을 자동으로 점수화하여 그 결과를 강화 학습 루프에 다시 반영할 수 있습니다. Miles는 비동기 학습과 활성 워커에 대한 모델 업데이트 핫스왑을 지원하여 파이프라인 중단 없이 지속적인 에이전트 개선을 가능하게 합니다.
- • Miles v0.1은 강화 학습을 사용하여 AI 에이전트를 포스트 트레이닝하기 위한 오픈 시스템입니다.
- • 격리된 환경에서 여러 에이전트 복사본을 실행하여 작업 성능을 점수화하고 학습에 반영합니다.
- • 학습 파이프라인을 중단하지 않고 워커에게 업데이트된 모델을 배포할 수 있습니다.
- • 롤아웃, 샌드박싱, 비동기 학습, 리플레이, 모델 업데이트, 다중 하드웨어 스케일링을 위한 구성 요소를 포함합니다.
개발자들에게 프로덕션 워크플로우를 중단하지 않고도 업데이트된 에이전트 모델을 지속적으로 학습, 평가 및 배포할 수 있는 자동화된 파이프라인을 제공합니다.
5. 감사 가능한 인간-에이전트 협업을 위한 CHAP 0.2 출시
Brightbeam AI는 인간과 AI 에이전트 간의 구조화되고 감사 가능한 협업을 위해 설계된 오픈 프로토콜인 CHAP 0.2(Collaborative Human-Agent Protocol)를 출시했습니다. CHAP은 에이전트 초안에 대한 인간의 편집 내용을 쿼리 가능한 콘텐츠 해시 봉투에 저장하여 단일 진실 공급원(Single Source of Truth)을 유지합니다. 이번 릴리스에는 Python 및 TypeScript 참조 구현, MCP 지원, LangGraph, Pydantic AI, LlamaIndex와 같은 인기 라이브러리를 위한 프레임워크 브리지가 포함되어 있습니다.
- • CHAP(Collaborative Human-Agent Protocol) 0.2가 공개 초안으로 제공됩니다.
- • 에이전트 초안에 대한 인간의 편집 내용을 콘텐츠 해시로 연결된 쿼리 가능하고 검증 가능한 봉투에 저장합니다.
- • TypeScript 및 Python 참조 구현, 적합성 하니스, MCP 및 A2A 전송 지원을 포함합니다.
- • LangGraph, Pydantic AI, AG2, LlamaIndex, Google ADK를 위한 프레임워크 브리지를 제공합니다.
- • 선택적 보안 기능으로 OIDC 바인딩 서명 및 외부 투명성 로그 앵커링이 포함됩니다.
개발자들에게 감사 추적이 내장된 인간 개입형(human-in-the-loop) 에이전트 워크플로우를 구축할 수 있는 표준화되고 안전한 프레임워크를 제공합니다.
6. 코딩 도구, 코드베이스 이해를 위해 AGENTS.md 채택
Cursor, Codex, Amp를 포함한 AI 코딩 도구들이 AI 에이전트의 코드베이스 이해도를 높이기 위해 AGENTS.md라는 새로운 표준화된 마크다운 형식을 채택하고 있습니다. Claude Code 전용 CLAUDE.md 형식의 도구 독립적 대안으로 설계된 AGENTS.md는 개발자가 자율 코딩 에이전트를 위해 코드베이스 구조, 가이드라인, 컨텍스트를 문서화할 수 있는 통합된 방법을 제공합니다.
- • Codex, Amp, Cursor가 표준화된 마크다운 파일 형식으로 AGENTS.md를 채택하고 있습니다.
- • 이 형식은 코딩 에이전트가 코드베이스를 이해할 수 있는 통합된 방법을 제공하도록 설계되었습니다.
- • Claude Code 전용인 CLAUDE.md의 도구 독립적 대안 역할을 합니다.
개발자들에게 독점적인 형식을 대체하여 AI 코딩 에이전트를 위해 특별히 코드베이스를 문서화할 수 있는 도구 독립적인 방법을 제공합니다.
7. Modular, Mojo 1.0 오픈소스 공개 및 플랫폼 지원 확대
Modular는 Mojo 1.0 프로그래밍 언어가 이제 Apache 2.0 라이선스 하에 완전히 오픈소스가 되었다고 발표했습니다. 오픈소스 릴리스와 함께 Modular는 공유 및 전용 배포를 위한 Modular Cloud를 출시했으며, 플랫폼의 하드웨어 지원을 AWS Trainium, Google TPU, Qualcomm 가속기로 확대했습니다. 또한, MAX 라이선스가 업데이트되어 장치 사용 제한이 제거되었으며, 새로운 오픈 얼라이언스 프로그램 하의 소스 가용 모델로 전환되었습니다.
- • Mojo 1.0은 이제 Apache 2.0 라이선스 하에 완전히 오픈소스입니다.
- • Modular Cloud는 console.modular.com에서 공개적으로 이용 가능하며 공유 엔드포인트와 전용 배포를 제공합니다.
- • Modular 플랫폼은 AWS Trainium, Google TPU, Qualcomm Cloud AI 100 및 Dragonfly 가속기로 하드웨어 지원을 확대했습니다.
- • Modular는 Microsoft와 협력하여 Mojo에 대한 네이티브 Windows 지원을 개발 중입니다.
- • MAX 라이선스는 장치 사용 제한을 제거하도록 업데이트되었으며 소스 가용 방식으로 제공될 예정입니다.
개발자들에게 더 넓은 하드웨어 호환성을 갖춘 AI 시스템 엔지니어링용 완전 오픈소스 고성능 언어를 제공합니다.
8. 벡터 검색 및 AI 워크플로우를 위한 PostgreSQL 활용
PostgreSQL은 특수 확장 기능을 통해 AI 엔지니어링에서의 유용성을 지속적으로 확장하고 있습니다. 벡터 임베딩을 위한 pgvector 확장과 직접적인 LLM 인덱싱 및 모델 호출을 위한 pgai 확장을 활용함으로써, 개발자는 데이터베이스, 벡터 검색, LLM 통합 계층을 통합할 수 있습니다. 이러한 생태계는 JSON 저장소, 전체 텍스트 검색, unlogged 테이블을 통한 고성능 캐싱에 대한 기본 지원과 결합되어 팀이 단일 데이터베이스 내에서 강력한 AI 백엔드를 구축할 수 있게 합니다.
- • pgvector 확장을 통해 PostgreSQL이 AI 워크플로우를 위한 벡터 데이터베이스 역할을 할 수 있습니다.
- • pgai 확장은 PostgreSQL 내에서 직접 데이터를 인덱싱하고 LLM 모델을 호출하는 것을 용이하게 합니다.
- • PostgreSQL은 전체 텍스트 검색, JSON 문서 저장, 파티셔닝, 공통 테이블 식(CTE)을 지원합니다.
- • SELECT .. FOR UPDATE 및 SKIP LOCKED를 사용하여 고성능 큐잉 시스템으로 기능할 수 있습니다.
- • Unlogged 테이블은 비영구적 고성능 캐싱에 사용할 수 있습니다.
개발자들이 관계형 데이터, 벡터 임베딩, LLM 통합을 위해 단일하고 신뢰할 수 있는 데이터베이스를 사용하여 스택을 단순화하도록 돕습니다.
9. 개발자들, Claude의 새로운 워터마크 우회 도구 공개
Claude 모델에 Google의 SynthID-Text 워터마크가 최근 구현된 이후, 개발자들은 이미 이 기술을 우회하는 방법을 만들어냈습니다. 롤아웃 후 4시간 이내에 개발자 Guillaume Meyer는 워터마크를 제거하도록 설계된 오픈소스 오버라이드 도구를 공개했습니다. 커뮤니티에서 확인된 다른 우회 방법으로는 텍스트 의역, 번역, 재정렬 등이 있으며, 이는 AI 출처 확인 노력과 사용자 측 수정 사이의 지속적인 긴장을 보여줍니다.
- • Anthropic은 최근 EU AI 법을 준수하기 위해 Claude 모델에 SynthID-Text 워터마크를 구현했습니다.
- • 개발자 Guillaume Meyer는 발표 후 4시간 이내에 이 워터마크를 제거하는 오픈소스 도구를 공개했습니다.
- • 커뮤니티 구성원들은 텍스트 재정렬 및 번역을 포함한 추가적인 우회 기술을 확인했습니다.
- • Anthropic은 워터마크가 응답 품질에 영향을 미치지 않는다고 주장하며 탐지 API를 출시할 계획입니다.
Anthropic의 새로운 워터마크 구현에 대한 즉각적인 커뮤니티 반응을 보여주며, 개발자들에게 모델 출력물에서 합성 식별자를 제거할 수 있는 도구를 제공합니다.
10. Inco AI, 기존 추측 디코딩 연구를 기반으로 DFlash 2 출시
기존 DFlash 추측 디코딩 연구를 기반으로 Inco AI는 DFlash 2를 출시했습니다. 이번 업데이트는 경량 경로 선택기와 로컬 컨볼루션 모듈을 도입하여 접미사 감쇠(suffix decay)를 완화하고, 1,650만 개의 파라미터를 추가하면서 기존 DFlash 대비 처리량을 16%에서 25%까지 향상시켰습니다. 이 기술은 이제 통합 가능하며 llama.cpp 및 vLLM에 이미 지원이 추가되어, Qwen3.8-27B가 표준 자기회귀 디코딩 대비 최대 3.4배의 처리량을 달성할 수 있게 되었습니다.
- • DFlash 2는 기존 DFlash 대비 처리량을 16%에서 25% 향상시킵니다.
- • 새로운 기능에는 경량 경로 선택기와 접미사 감쇠를 해결하기 위한 16.5M 파라미터 로컬 컨볼루션 모듈이 포함됩니다.
- • Inco AI는 Hugging Face에 Qwen3.8-27B 및 Meta의 Muse Glimmer를 위한 DFlash 2 드래프터를 공개했습니다.
- • Llama.cpp 풀 리퀘스트 #27342는 DFlash 2 지원을 추가하여 RTX 6000에서 Qwen3.8-27B에 대해 최대 3배의 속도 향상을 보여줍니다.
- • vLLM 기반 구현은 RTX 3090에서 단일 사용자 요청에 대해 초당 138토큰을 달성했습니다.
로컬 LLM 추론을 위해 DFlash 추측 디코딩 프레임워크를 이미 사용 중인 개발자들에게 상당한 성능 향상을 제공합니다.
11. Unsloth, 동적 v3.0 GGUF 양자화 출시
Unsloth는 동적 v3.0 양자화 형식을 도입하고 Qwen3.8-27B에 대한 업데이트된 GGUF 모델을 출시했습니다. 새로운 양자화 방식은 정교한 imatrix 보정 데이터셋을 활용하여 에이전트 코딩, 채팅 및 다국어 성능을 최적화합니다. QAT 및 QAD를 피함으로써 Unsloth는 이전 버전 대비 10%의 정확도 향상을 제공하며, 8GB RAM만 있는 하드웨어에서도 70% 이상의 정확도를 유지하는 초저용량 1비트 양자화를 포함합니다.
- • 동적 v3.0 GGUF는 llama.cpp 및 Unsloth Desktop과 호환됩니다.
- • 양자화 방식은 에이전트 코딩, 채팅 및 다국어 작업을 위해 정교화된 고품질 imatrix 보정 데이터셋을 사용합니다.
- • 이 과정은 양자화 인식 학습(QAT)이나 양자화 인식 증류(QAD) 없이 전적으로 포스트 트레이닝 양자화에 의존합니다.
- • 새로운 1비트 UD-IQ1_S 양자화는 크기가 6.2GB이며 72%~77%의 정확도를 유지하고 8GB RAM에서 실행 가능합니다.
- • Unsloth는 디스크 공간을 약 500MB 절약하기 위해 UD-Q2_K_XL 미만의 소형 양자화에서 MTP 모듈을 제거했습니다.
개발자들이 최소한의 메모리 점유율로 소비자용 하드웨어에서 로컬로 매우 정확한 양자화 모델을 실행할 수 있게 합니다.
12. FreeToken, 효율적인 로컬 MoE 서빙 지원
연구원들은 Mixture-of-Experts(MoE) 모델의 효율적인 엣지 네이티브 서빙을 위해 설계된 기술인 FreeToken을 도입했습니다. 전문가, 모델 상태, CPU/GPU 워크로드 및 에이전트 상태 재사용을 호스트 머신의 가용 메모리 및 대역폭에 맞게 동적으로 재매핑함으로써, FreeToken은 소비자용 하드웨어에서 거대한 모델을 실행할 수 있게 합니다. 이 시스템은 8GB 노트북 GPU에서 35B 모델을 실행하는 것부터 단일 워크스테이션 GPU에서 753B GLM 모델을 실행하는 것까지 20개 이상의 MoE 모델을 지원합니다.
- • FreeToken은 가용 메모리에 따라 전문가, 모델 상태, CPU/GPU 작업 및 에이전트 상태 재사용을 동적으로 재매핑합니다.
- • 이 기술은 20개 이상의 MoE 모델을 지원합니다.
- • 지원되는 설정은 8GB 노트북 GPU에서 35B 모델을 실행하는 것부터 단일 워크스테이션 GPU에서 753B GLM 모델을 실행하는 것까지 다양합니다.
메모리와 대역폭을 최적화하여 개발자들이 표준 워크스테이션이나 노트북에서 로컬로 거대한 MoE 모델을 실행할 수 있게 합니다.
13. 소프트웨어 엔진, Tesla V100 GPU에서 네이티브 FP4/FP8 지원
한 개발자가 Volta 세대 Tesla V100 GPU에서 NVFP4 및 FP8 모델 웨이트를 네이티브로 실행하도록 설계된 소프트웨어 엔진 'v100-skinny'를 공개했습니다. 맞춤형 QPN(Quantized Processing Network) 커널을 활용하여 저정밀도 웨이트를 Volta Tensor Core와 호환되는 FP16 형식으로 변환함으로써 하드웨어의 네이티브 FP4/FP8 지원 부족을 우회합니다. Qwen 3.8을 사용한 테스트에서 4개의 V100 클러스터는 초당 219.1토큰을 달성하여 최신 RTX 5090의 단일 요청 디코드 성능과 대등한 결과를 보였습니다.
- • 'v100-skinny' 엔진을 통해 4개의 Tesla V100 GPU가 Qwen 3.8에서 초당 219.1토큰의 디코드 처리량을 달성합니다.
- • 성능은 NInfer 엔진을 실행하는 RTX 5090의 단일 요청 디코드 속도와 일치합니다.
- • 이 시스템은 QPN(Quantized Processing Network) 커널을 사용하여 FP4 및 FP8 웨이트를 Volta Tensor Core와 호환되는 FP16 형식으로 변환합니다.
- • 버전 1.1은 모델의 혼합 FP4/FP8 할당을 그대로 유지하기 위한 특정 SM70 실행 경로를 제공합니다.
- • 이 설정은 약 600 호주 달러의 하드웨어 비용으로 구입한 4개의 V100 GPU를 사용하여 구축되었습니다.
개발자들이 저렴한 구형 엔터프라이즈 GPU를 재활용하여 최신 플래그십 카드의 단일 요청 디코드 성능을 구현할 수 있게 합니다.
14. OpenAI, 제로 데이터 보존을 위한 비공개 안전 처리 테스트
OpenAI는 일부 기업 고객을 대상으로 '비공개 안전 처리(Private Safety Processing)' 테스트를 시작했습니다. 이 새로운 기술은 오용 패턴과 안전 위반을 감지하는 동시에 제로 데이터 보존(ZDR) 보호를 완전히 유지하도록 설계되어, 엄격한 규정 준수 요구 사항이 있는 조직이 OpenAI의 프론티어 모델을 안전하게 활용할 수 있도록 합니다.
- • 이 기술은 '비공개 안전 처리(Private Safety Processing)'라고 합니다.
- • 제로 데이터 보존 보호를 유지하면서 오용 패턴을 식별하도록 설계되었습니다.
- • 이 기능은 현재 초기 기업 고객들을 대상으로 테스트되고 있습니다.
- • 기업들이 OpenAI가 데이터를 보존하도록 요구하지 않고도 OpenAI의 가장 진보된 모델을 사용할 수 있게 합니다.
엄격한 데이터 개인정보 보호 및 보존 요구 사항을 타협하지 않고도 규제가 심한 산업의 개발자들이 고급 OpenAI 모델을 사용할 수 있게 합니다.