Inference Brew

GLM 5.2 토큰 최적화 및 로컬 성능 지표

00:00 / --:--

← 메인으로

GLM 5.2 토큰 최적화 및 로컬 성능 지표

1. GLM 5.2 토큰 최적화 및 로컬 성능 지표

GLM 5.2는 추론 기능을 확장하여 토큰 제한을 GLM 5.1의 16.7k에서 36.7k로 늘렸습니다. z.ai의 기술 보고서에 따르면, 개발자는 'max' 대신 'high' 노력 수준을 사용하여 로컬 및 API 배포를 최적화할 수 있습니다. 이는 코딩 작업 성능의 98%를 유지하면서 토큰 소비량을 절반 이상 절감합니다. 6x RTX 3090과 같은 멀티 GPU 설정에서의 로컬 테스트 결과, 90K 컨텍스트에서 초당 7.8 토큰의 허용 가능한 생성 속도를 보였으나, 사용자는 Xeon 기반 하드웨어에서는 현재 극심한 응답 지연이 발생한다고 지적합니다.

  • GLM 5.2의 추론 토큰은 GLM 5.1의 16.7k에서 36.7k로 증가했습니다.
  • z.ai 기술 보고서에 따르면 'high' 노력 수준은 'max' 수준 지능의 98%를 제공하며 토큰 사용량은 절반 이하입니다.
  • Q4 양자화 및 'high' 노력 수준을 적용한 GLM 5.2의 로컬 테스트 결과, 'max' 수준과 유사한 수학적 성능을 보였습니다.
  • 6x RTX 3090 GPU를 사용한 커뮤니티 벤치마크에서 unsloth UD-IQ2_M 양자화 및 90K 컨텍스트를 사용하여 초당 7.8 토큰의 생성 속도를 달성했습니다.
  • 사용자들은 현재 Xeon 하드웨어에서 과도한 응답 대기 시간으로 인해 GLM 5.2를 사용할 수 없다고 보고합니다.

이를 통해 개발자는 높은 코딩 품질을 유지하면서 일상적인 워크플로우에서 API 비용과 지연 시간을 대폭 절감할 수 있습니다.

SOURCES

2. Cloudflare, AI 에이전트 배포를 위한 임시 계정 도입

Cloudflare는 완전 자율적인 에이전트 워크플로우를 촉진하기 위해 설계된 'Agents용 임시 Cloudflare 계정' 기능을 도입했습니다. `wrangler deploy --temporary`를 실행하면 AI 에이전트는 기존 계정이나 수동 인증 없이도 웹사이트, API 및 Cloudflare Worker를 배포할 수 있습니다. 이러한 임시 배포는 60분 동안 활성 상태로 유지되며, 개발자나 에이전트는 리소스가 자동으로 삭제되기 전에 영구적으로 확보할 수 있는 시간을 갖게 됩니다.

  • AI 에이전트는 `wrangler deploy --temporary` 명령을 실행하여 임시 배포를 시작할 수 있습니다.
  • 임시 배포는 60분 동안 활성 상태로 유지되며, 이 기간 동안 계정과 리소스를 영구적으로 전환할 수 있습니다.
  • 확보되지 않은 임시 계정과 관련 리소스는 60분 후 자동으로 삭제됩니다.
  • Wrangler CLI는 인증 장벽에 부딪혔을 때 에이전트에게 `--temporary` 플래그에 대한 정보를 제공하도록 업데이트되었습니다.
  • 이 기능은 인간의 개입 없이 신속하고 반복적인 에이전트 워크플로우를 지원하도록 설계되었습니다.

이를 통해 코딩 에이전트가 인간의 인증 병목 현상 없이 완전히 자동화된 작성-배포-검증 주기를 수행할 수 있습니다.

SOURCES

3. Cisco AI, FAPO 프롬프트 최적화 시스템 공개

Cisco AI는 다단계 LLM 파이프라인을 최적화하기 위해 설계된 Claude Code 기반 시스템인 FAPO(Fully Automated Prompt Optimization)를 오픈소스로 공개했습니다. Apache 2.0 라이선스로 출시된 FAPO는 단계별 실패 귀속(step-level failure attribution)을 사용하여 파이프라인 오류를 검색, 캐스케이딩, 형식 또는 추론 실패로 분류합니다. 이후 프롬프트 편집, 매개변수 조정, 구조적 변경이라는 세 가지 단계적 수준에서 파이프라인을 최적화합니다. 평가에서 FAPO는 GEPA 최적화 도구보다 평균 14.1% 포인트, 구조적 변경이 필요한 벤치마크에서는 최대 33.8% 포인트 더 높은 성능을 보였으며, 과적합을 방지하기 위해 학습 데이터 분할 검사 등의 가드레일을 사용합니다.

  • FAPO(Fully Automated Prompt Optimization)는 Apache 2.0 라이선스로 오픈소스화되었습니다.
  • 이 시스템은 다단계 LLM 파이프라인을 개선하기 위해 Claude Code 및 Codex를 최적화 에이전트로 지원합니다.
  • 단계별 실패 귀속을 사용하여 오류를 검색, 캐스케이딩, 형식 또는 추론 실패로 분류합니다.
  • FAPO는 프롬프트 편집, 매개변수 조정, 구조적 변경의 세 가지 수준에서 파이프라인을 최적화합니다.
  • 벤치마크에서 FAPO는 GEPA 최적화 도구보다 평균 14.1% 포인트 앞섰으며, HoVer와 같은 구조적 벤치마크에서는 33.8% 포인트까지 격차를 벌렸습니다.
  • 과적합 방지를 위한 내장 가드레일에는 학습 데이터 분할 검사 및 독립적인 제안 검토가 포함됩니다.

개발자는 내장된 과적합 가드레일을 통해 프롬프트 편집, 매개변수 조정, 구조적 변경을 거쳐 복잡한 LLM 파이프라인을 자동으로 최적화할 수 있습니다.

SOURCES

4. Nous Research, Hermes Agent에 'Blank Slate' 모드 추가

Nous Research는 보안에 민감하고 감사가 가능한 배포를 위해 설계된 새로운 'Blank Slate' 구성 모드를 오픈소스 Hermes Agent에 업데이트했습니다. 이 모드를 활성화하면 에이전트는 기본 공급자 설정, 파일 작업 및 터미널 액세스만으로 초기화되며, 웹 브라우징, 코드 실행, 비전 및 MCP 서버와 같은 기본 기능은 비활성화됩니다. 소프트웨어 업데이트 전반에 걸쳐 구성의 지속성을 보장하기 위해 이 모드는 명시적인 `disabled_toolsets` 및 `platform_toolsets.cli` 파일을 디스크에 직접 기록합니다.

  • Blank Slate 모드는 Hermes Agent를 공급자/모델 설정, 파일 작업 및 터미널만 활성화된 상태로 초기화합니다.
  • 웹 액세스, 브라우저, 코드 실행, 비전, 메모리 및 MCP 서버와 같은 기본 기능은 비활성화됩니다.
  • 구성은 명시적인 'disabled_toolsets' 및 'platform_toolsets.cli' 목록을 디스크에 기록하여 업데이트 후에도 유지됩니다.
  • Hermes Agent는 최소 64,000 토큰의 컨텍스트 윈도우를 가진 LLM이 필요합니다.
  • 이 모드는 보안에 민감한 배포, 재현 가능한 팀 환경 및 교육적 감사를 위해 설계되었습니다.

이는 민감한 프로덕션 환경에서 에이전트를 실행하기 위한 매우 안전하고 재현 가능하며 감사가 가능한 환경을 제공합니다.

SOURCES

5. Cosine, 능동적 모의 해킹을 위한 Kimi K2.6 사후 학습

Cosine(YC W23)은 시스템 취약점을 능동적으로 식별하도록 설계된 사이버 보안 AI 도구를 출시했습니다. Kimi K2.6 기본 모델을 기반으로 하는 이 도구는 10년간의 CTF(Capture-the-Flag) 대회 데이터를 사용하여 지도 미세 조정(SFT) 및 검증 가능한 보상을 통한 강화 학습(RL)으로 사후 학습되어 보안 테스트 중 표준적인 안전 거부를 방지합니다. CLI를 통해 작동하는 이 도구는 읽기 전용 로컬 코드 스캐너와 샌드박스 시스템을 공격하려는 능동적 모의 해킹 모드를 갖추고 있으며, 정확한 익스플로잇 요청과 응답을 표시하여 개발자에게 구체적인 취약점 증거를 제공합니다.

  • 이 도구는 10년간의 CTF 데이터를 SFT 및 검증 가능한 보상을 통한 RL로 사후 학습한 Kimi K2.6 기본 모델을 기반으로 합니다.
  • CLI를 통해 작동하며 읽기 전용 로컬 코드 스캔 모드와 샌드박스 시스템을 위한 능동적 모의 해킹 모드를 제공합니다.
  • 능동적 모의 해킹 모드는 실제 시스템을 공격하려고 시도하며 익스플로잇 요청과 응답을 표시하여 취약점 증거를 제공합니다.
  • 이 시스템은 오케스트레이터가 병렬 하위 에이전트 전반에 작업을 분배하는 다중 에이전트 스웜 하네스를 사용합니다.
  • 설치는 무료이며 최대 200만 토큰까지 스캔할 수 있는 무료 티어를 포함하고 있으며, 컨텍스트는 TLS를 통해 추론 API로 전송됩니다.

개발자는 샌드박스 시스템에서 자동화된 능동적 모의 해킹을 실행하여 구체적인 익스플로잇 증거와 함께 취약점을 찾고 검증할 수 있습니다.

SOURCES

6. SearXNG 및 Scrapling을 통한 로컬 에이전트용 자체 호스팅 웹 액세스

한 개발자가 유료 검색 및 스크래핑 API를 우회하는 로컬 우선 AI 에이전트용 자체 호스팅 웹 액세스 파이프라인을 설계했습니다. 이 아키텍처는 Docker에서 SearXNG를 배포하여 JSON을 통해 검색 결과를 제공하고, Scrapling을 사용하여 페이지 콘텐츠를 추출합니다. 브라우저 없는 빠른 경로와 까다로운 사이트를 위한 스텔스 헤드리스 브라우저 경로를 모두 갖추고 있으며, Trafilatura를 통해 최종 HTML을 마크다운으로 변환하여 토큰 소비를 최소화합니다. 또한 이 파이프라인에는 에이전트가 내부 네트워크 범위를 스캔하지 못하도록 차단하는 SSRF 가드가 포함되어 있습니다.

  • 자체 호스팅 설정은 Docker에 배포된 SearXNG를 사용하여 JSON 엔드포인트를 통해 검색 결과를 제공합니다.
  • 페이지 추출은 브라우저 없는 빠른 경로와 차단된 페이지를 위한 헤드리스 브라우저가 포함된 스텔스 경로를 활용합니다.
  • Trafilatura는 추출된 HTML을 깔끔한 마크다운으로 변환하여 로컬 LLM의 가독성과 토큰 사용량을 최적화합니다.
  • 이 시스템은 PDF 처리를 위한 pypdf와 에이전트가 내부 네트워크 범위에 액세스하는 것을 방지하는 SSRF 가드를 통합합니다.
  • 이 설정은 유료 API 키와 벤더별 검색 서비스를 피하지만, 검색 품질은 상위 엔진에 따라 달라집니다.

개발자는 비싸고 벤더에 종속된 검색 또는 스크래핑 API에 의존하지 않고도 완전히 로컬이며 개인 정보를 보호하는 웹 브라우징 에이전트를 구축할 수 있습니다.

SOURCES

7. Hugging Face를 통한 GLM-5.2 기반 Claude Code 실행

새로운 통합 가이드는 Anthropic의 Claude Code CLI를 GLM-5.2 모델과 함께 실행하도록 구성하는 방법을 자세히 설명합니다. Hugging Face Inference Providers를 통해 요청을 라우팅함으로써 개발자는 에이전트 터미널 워크플로우 내에서 오픈 가중치 모델을 활용할 수 있습니다. 이 설정을 위해서는 추론 제공자 권한이 있는 세분화된 Hugging Face 토큰을 생성하고 연결을 설정하기 위해 특정 환경 변수를 구성해야 합니다.

  • Claude Code는 Hugging Face Inference Providers를 사용하여 GLM-5.2와 통합할 수 있습니다.
  • 구성을 위해서는 'Make calls to Inference Providers' 권한이 있는 세분화된 Hugging Face 토큰이 필요합니다.
  • Claude Code의 API 호출을 라우팅하기 위해 특정 환경 변수를 구성하여 설정을 완료합니다.

이를 통해 개발자는 GLM-5.2와 같은 대체 오픈 가중치 모델로 Claude Code의 에이전트 기능을 활용할 수 있습니다.

SOURCES

8. TimeCopilot, 파운데이션 모델을 통한 예측 파이프라인 간소화

새로운 튜토리얼은 예측 워크플로우를 간소화하도록 설계된 도구인 TimeCopilot을 사용하여 엔드투엔드 예측 파이프라인을 구축하는 방법을 설명합니다. 이 파이프라인은 롤링 교차 검증을 사용하여 통계, 파운데이션 및 GPU 기반 예측 모델을 평가하고 MAE, RMSE 및 MAPE 지표에 따라 순위를 매깁니다. 또한 TimeCopilot은 OpenAI 또는 Anthropic API 키를 사용하여 가장 성능이 좋은 모델을 자동으로 선택하고 분석적 해석을 생성할 수 있는 선택적 LLM 에이전트를 통합합니다.

  • TimeCopilot은 데이터 준비 및 이상 탐지를 포함하여 엔드투엔드 예측 워크플로우를 구축하도록 설계된 도구입니다.
  • 파이프라인은 롤링 교차 검증을 사용하여 통계, 파운데이션 및 GPU 기반 예측 모델을 평가합니다.
  • 80% 및 95% 예측 구간을 포함하는 12개월 확률적 예측을 생성합니다.
  • TimeCopilot은 OpenAI 또는 Anthropic API를 사용하여 모델을 선택하고 분석적 해석을 제공할 수 있는 선택적 LLM 에이전트를 특징으로 합니다.

개발자는 전통적인 통계 모델과 LLM 기반 분석을 결합한 복잡한 예측 파이프라인을 신속하게 구축하고 평가할 수 있습니다.

SOURCES

9. Yandex, YaFF 제로 카피 직렬화 라이브러리 오픈소스화

Yandex는 Apache 2.0 라이선스로 출시된 고성능 C++ 직렬화 라이브러리인 YaFF(Yet another Flat Format)를 오픈소스로 공개했습니다. YaFF는 Protobuf 생태계를 위한 제로 카피 와이어 형식을 도입하여 개발자가 기존 `.proto` 파일을 단일 진실 공급원으로 유지할 수 있도록 합니다. AMD EPYC 7713에서의 벤치마크에 따르면 YaFF의 Flat Layout은 핫 데이터를 FlatBuffers보다 3.8배, 표준 Protobuf보다 22배 빠르게 읽으며, 추천 엔진의 프로덕션 규모에서 배포 시 10~20%의 CPU 절감 효과를 제공합니다.

  • YaFF(Yet another Flat Format)는 Apache 2.0 라이선스로 오픈소스화되었습니다.
  • 이 라이브러리는 .proto 파일을 단일 진실 공급원으로 유지하면서 Protobuf 생태계를 위한 제로 카피 와이어 형식을 제공합니다.
  • AMD EPYC 7713 벤치마크에서 YaFF의 Flat Layout은 핫 데이터를 FlatBuffers보다 3.8배, Protobuf보다 22배 빠르게 읽었습니다.
  • Yandex의 광고 추천 시스템에 YaFF를 구현하여 프로덕션 규모에서 10~20%의 CPU 절감 효과를 얻었습니다.
  • YaFF는 시스템 에지에서 Protobuf와 YaFF 간의 양방향 변환을 통해 점진적인 도입을 지원합니다.

고처리량 서버 측 런타임을 구축하는 개발자는 추천 엔진 및 메모리 매핑 인덱스에 대해 상당한 CPU 절감과 더 빠른 읽기 속도를 달성할 수 있습니다.

SOURCES

10. Noema Atlas, P2P 로컬 LLM 가중치 배포 네트워크 출시

Noema Atlas는 로컬 LLM 가중치를 공유하기 위해 설계된 오픈소스 Rust 기반 P2P 네트워크 소프트웨어를 도입했습니다. Apache-2.0 라이선스로 출시된 Noema Atlas는 P2P 전송을 위해 Iroh 프로토콜을 활용하고 BLAKE3 콘텐츠 해싱을 통해 파일 무결성을 검증합니다. 이 시스템은 리플링크(relink)나 하드링크를 사용하여 모델 변형 간에 동일한 파일을 중복 제거함으로써 로컬 스토리지를 최적화하며, Hugging Face와 같은 중앙 집중식 플랫폼에서 제거된 모델을 개발자가 공유하고 복구할 수 있도록 합니다.

  • Noema Atlas는 Rust로 구축되었으며 Apache-2.0 오픈소스 라이선스로 출시되었습니다.
  • 이 소프트웨어는 P2P 전송을 위해 Iroh를 사용하며 BLAKE3 콘텐츠 해싱을 사용하여 파일 무결성을 검증합니다.
  • 리플링크나 하드링크를 사용하여 모델 변형 또는 미러 간에 동일한 파일을 중복 제거합니다.
  • 사용자는 제목과 라이선스를 제공하여 Hugging Face와 같은 플랫폼에서 제거된 모델을 복구하고 공유할 수 있습니다.
  • 이 프로젝트에는 macOS, Windows 및 Linux용 네이티브 데스크톱 앱, CLI 및 Noema Atlas Studio라는 동반 앱이 포함되어 있습니다.

개발자는 중앙 집중식 대역폭 병목 현상이나 모델 삭제를 우회하여 동료로부터 직접 대규모 모델 가중치를 안전하게 공유, 미러링 및 다운로드할 수 있습니다.

SOURCES

11. Apple Silicon Mac에서 EXL3 양자화 지원 시작

오픈소스 PonyExl3 프로젝트는 64GB 이상의 RAM을 탑재한 Apple Silicon Mac에 EXL3 양자화 지원을 제공합니다. 이전에는 CUDA 지원 RTX 하드웨어로 제한되었던 EXL3 모델을 이제 macOS에서 실행, 추론 및 변환할 수 있습니다. MiniCPM5 및 Qwen3.6-27B 모델에 대한 초기 테스트 결과, macOS에서 변환된 모델은 NVIDIA RTX 카드에서 변환된 모델과 동등한 평균 KL 발산(KLD)을 달성하면서도 MLX 양자화 대비 품질 대 가중치 성능에서 가중치당 약 0.5비트 개선을 제공합니다.

  • 이전에는 CUDA 및 고가의 RTX 하드웨어로 제한되었던 EXL3 모델을 이제 64GB 이상의 RAM을 탑재한 Apple Silicon Mac에서 실행 및 변환할 수 있습니다.
  • 오픈소스 PonyExl3 프로젝트는 Apache 2.0 라이선스로 GitHub에서 이용할 수 있습니다.
  • macOS에서 MiniCPM5 및 Qwen3.6-27B 모델을 테스트한 결과, RTX 카드에서 수행된 변환과 동등한 평균 KLD를 보였습니다.
  • EXL3 양자화는 MLX와 비교하여 품질 대 가중치 성능에서 가중치당 약 0.5비트 개선을 제공합니다.

이는 macOS에서 고성능 EXL3 양자화를 가능하게 하여 MLX 양자화보다 더 나은 품질 대 가중치 성능을 제공합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.