Inference Brew

GPT-5.5 Codex, 추론 토큰 클러스터링 이상 현상 발생

00:00 / --:--

← 메인으로

GPT-5.5 Codex, 추론 토큰 클러스터링 이상 현상 발생

1. GPT-5.5 Codex, 추론 토큰 클러스터링 이상 현상 발생

GPT-5.5 Codex의 텔레메트리 데이터에서 중요한 추론 토큰 클러스터링 이상 현상이 발견되었습니다. 분석에 따르면 GPT-5.5 응답의 82%가 정확히 516개의 추론 토큰(또는 그 배수)에서 종료되는 것으로 나타났습니다. 이러한 클러스터링은 추론 강도 저하 및 정확히 516개 토큰에서 종료되는 실행이 잘못된 최종 답변을 반환하는 알려진 버그와 상관관계가 있습니다. 복잡한 추론 작업을 위해 GPT-5.5 Codex를 사용하는 개발자는 토큰 사용량을 모니터링하고, 이러한 스케줄러 또는 절단 임계값과 관련된 잠재적인 성능 저하에 유의해야 합니다.

  • GPT-5.5 Codex 응답은 추론 토큰 수가 정확히 516개에서 멈추는 클러스터링 이상 현상을 보이며, 1034개와 1552개에서도 소규모 급증이 나타납니다.
  • GPT-5.5는 전체 텔레메트리 응답의 19.3%를 차지함에도 불구하고, 이러한 516개 토큰 종료 이벤트의 82.0%를 차지합니다.
  • GPT-5.5의 516개 토큰 종료 비율은 다른 모델의 기준치보다 33.6배 높습니다.
  • 이러한 클러스터링은 복잡한 작업에서 추론 강도 감소 및 잘못된 최종 답변과 일치합니다.

추론 예산이 특정 임계값에 도달할 때 잘못된 답변을 유발하는 GPT-5.5 Codex의 잠재적인 플랫폼 수준 버그를 개발자에게 경고합니다.

SOURCES

2. ByteDance의 Seedance 비디오 생성기, 할리우드에서 주목

ByteDance의 Seedance AI 비디오 생성기가 미국 창작 시장에 진출하며 멀티모달 개발자와 영화 제작자들에게 매우 경쟁력 있는 가격 모델을 제공하고 있습니다. 비디오 및 오디오 생성 비용이 분당 9달러인 Seedance는 분당 24달러인 Google의 Veo보다 훨씬 저렴합니다. 이 모델은 타임라인 기반 프롬프팅과 고급 물리, 조명, 카메라 연출 기능을 갖추고 있으나, 주요 스튜디오에서의 채택은 지정학적 문제와 지적 재산권 우려로 인해 제한적인 상태입니다.

  • ByteDance의 Seedance AI 비디오 생성기가 미국 독립 영화 제작자들 사이에서 채택되고 있습니다.
  • Seedance는 오디오가 포함된 비디오 생성 비용이 분당 9달러로, Google의 Veo 모델(분당 24달러)보다 저렴합니다.
  • 이 모델은 타임라인 기반 프롬프팅과 향상된 물리, 조명, 카메라 연출 이해도를 특징으로 합니다.
  • 지정학적 및 지적 재산권 위험으로 인해 전통적인 주요 할리우드 스튜디오의 채택이 제한될 수 있습니다.

Google Veo의 분당 24달러 대비 분당 9달러라는 매우 비용 효율적인 비디오 생성 대안을 개발자와 창작자에게 제공합니다.

SOURCES

3. Anthropic의 최신 모델, Pi 편집 도구 호출 오류 발생

Anthropic의 최신 모델(Opus 4.8 및 Sonnet 5)로 에이전트 워크플로우를 구축하는 개발자는 Pi 편집 도구 호출 실패를 겪을 수 있습니다. 이 모델들은 edits[] 배열에 승인되지 않은 필드를 삽입하여 스키마 유효성 검사 거부를 유발하는 것으로 관찰되었습니다. 이는 더 관대한 Claude Code 하네스에 대한 사후 학습의 부작용일 가능성이 높으며, 상황에 따라 다르게 나타나고 긴 에이전트 기록에서 더 악화됩니다. 개발자는 기록에서 사고 블록(thinking blocks)을 제거하거나(실패율 50% 감소), 엄격한 도구 호출(strict tool invocation)을 활성화하여 이 문제를 해결할 수 있습니다.

  • Anthropic의 Opus 4.8 및 Sonnet 5 모델은 edits[] 배열에 승인되지 않은 필드를 삽입하여 Pi 편집 도구를 잘못 호출하고 있습니다.
  • 이러한 실패는 새로운 단일 턴 프롬프트보다 긴 에이전트 기록에서 더 자주 발생합니다.
  • 대화 기록에서 사고 블록을 제거하면 실패율이 50% 감소했습니다.
  • 엄격한 도구 호출을 활성화하면 스키마 위반 문제가 완전히 해결되었습니다.

엄격한 도구 호출을 적용하거나 사고 블록을 제거함으로써 에이전트 워크플로우의 조용한 실패를 디버깅하고 방지하는 데 도움을 줍니다.

SOURCES

4. Fable, 3D 가우시안 스플래팅을 위한 .splat4d 형식 도입

Fable은 동적 시계열 3D 가우시안 스플래팅의 전달을 최적화하기 위해 설계된 .splat4d 파일 형식을 도입했습니다. 이 형식은 HTTP Range 요청에 최적화되어 있어, 웹 클라이언트가 사용자 지정 백엔드 서버 없이도 S3, GCS, R2와 같은 정적 객체 스토리지에서 3D 시퀀스의 특정 세그먼트를 직접 스트리밍할 수 있습니다. Rust와 JavaScript 간의 결정론적 디코딩을 위한 오류 제한 양자화를 지원하며, 프레임 디렉토리를 단일 탐색 가능 파일로 컴파일하는 Python 유틸리티(splats4d)가 함께 제공됩니다.

  • Fable은 시계열 3D 가우시안 스플래팅을 위해 .splat4d 파일 형식을 개발했습니다.
  • 이 형식은 HTTP Range 요청에 최적화되어 있어 클라이언트가 S3, GCS, R2와 같은 정적 호스트에서 특정 세그먼트를 가져올 수 있습니다.
  • SZ/ZFP 스타일의 오류 제한 양자화를 사용하여 Rust와 JavaScript 간의 결정론적이고 비트 단위로 동일한 디코딩을 보장합니다.
  • 프레임별 .splat 파일 디렉토리를 단일 .splat4d 파일로 인코딩하는 splats4d라는 Python 패키지가 제공됩니다.

개발자가 사용자 지정 서버 측 로직 없이 HTTP Range 요청을 사용하여 표준 클라우드 스토리지에서 동적 3D 장면을 효율적으로 스트리밍하고 렌더링할 수 있게 합니다.

SOURCES

5. 로컬 Qwen3.6 및 Claude Code를 활용한 자율 게임 개발

로컬 '바이브코딩(vibecoding)'의 실용적인 시연으로, 한 개발자가 로컬 Qwen3.6 27B 모델과 Claude Code를 결합하여 Java 게임을 위한 복잡한 A* 경로 탐색 시스템을 성공적으로 구축했습니다. 이 설정은 모델이 실시간 로그를 모니터링하고, 코드를 리팩토링하며, 점진적 업데이트 후 게임을 자동으로 재시작할 수 있게 하는 자율 테스트 제품군에 의존했습니다. 이 워크플로우는 지속적이고 자동화된 디버깅을 위해 로컬 오픈 가중치 모델과 에이전트 코딩 도구를 결합하는 것의 실행 가능성을 보여줍니다.

  • 한 개발자가 로컬에서 Claude Code와 Qwen3.6-27b-mtp-q8 모델을 사용하여 Java로 NPC A* 경로 탐색 시스템을 처음부터 구축했습니다.
  • 이 워크플로우는 모델이 실시간으로 로그를 모니터링하고, 코드를 리팩토링하며, 게임을 재시작하는 자율 테스트 제품군을 활용했습니다.
  • 개발자는 NPC의 내비게이션 기능을 개선하기 위해 12시간 동안 자동 테스트 마라톤을 진행했습니다.
  • 결과적으로 NPC는 복잡한 장애물을 탐색하고, 오르고, 내리고, 틈을 피하는 데 성공했습니다.

자율 테스트 제품군과 로컬 LLM이 실시간 디버깅 및 리팩토링을 처리하는 실용적이고 완전히 로컬인 '바이브코딩' 워크플로우를 보여줍니다.

SOURCES

6. llama.cpp, DeepSeek V4를 위한 양자화된 KV 캐시 지원 병합

DeepSeek V4 지원의 초기 구현과 다양한 GGUF 양자화 릴리스에 이어, llama.cpp 프로젝트가 양자화된 KV 캐시 지원을 통합했습니다. 이 업데이트를 통해 개발자는 단일 RTX PRO 6000 GPU에서 1M 컨텍스트 윈도우로 모델을 실행할 수 있게 되었으며, 이전 반복 대비 VRAM 사용량을 크게 줄였습니다.

  • llama.cpp는 양자화된 KV 캐시를 지원하기 위해 풀 리퀘스트 #25247, #25303, #25202를 병합했습니다.
  • 이 업데이트는 q8_0 KV 캐시를 사용하여 단일 RTX PRO 6000 GPU에서 1M 컨텍스트 실행을 가능하게 합니다.
  • 퍼플렉서티(Perplexity) 테스트 결과, Q8_0 또는 Q4_0 캐시 유형을 사용할 때 f16 대비 성능 저하가 최소화됨을 보여줍니다.
  • 벤치마크를 통해 2,048개에서 100만 개 이상의 토큰까지의 컨텍스트 길이를 검증했습니다.

이전의 메모리 제약을 극복하고 소비자용 하드웨어에서 DeepSeek V4를 위한 극도로 긴 컨텍스트의 로컬 추론을 가능하게 합니다.

SOURCES

7. 에이전트 워크플로우를 위한 RTX 5090에서의 Qwen3.6 27B 튜닝

로컬 에이전트 워크플로우를 최적화하는 개발자들은 NVIDIA RTX 5090에서 실행되는 Qwen3.6 27B 모델에 대한 새로운 커뮤니티 벤치마크를 참고할 수 있습니다. MTP 드래프트를 10으로 설정하고 192k 컨텍스트와 함께 q8 KV 캐시를 사용하는 등 llama.cpp 매개변수를 튜닝한 결과, 20시간의 코딩 및 디버깅 작업 동안 초당 평균 140.7 토큰의 속도를 달성했습니다. 다만, 하이브리드 어텐션과 SWA 캐시 처리가 아직 완전히 최적화되지 않아 프롬프트 재처리 경고가 발생할 수 있다는 점에 유의해야 합니다.

  • RTX 5090, 9800X3D, 64GB RAM 시스템에서 Qwen3.6 27B를 위해 llama.cpp를 튜닝한 결과 초당 평균 140.7 토큰의 속도를 기록했습니다.
  • 구성은 q8 KV 캐시, 192k 컨텍스트, MTP 드래프트=10, spec-draft-p-min=0.5, 배치/u배치 크기 512를 사용했습니다.
  • 성능 지표는 20시간 동안의 실제 에이전트 코딩, 디버깅 및 문서화 작업을 통해 수집되었습니다.
  • 작성자는 llama.cpp의 하이브리드 어텐션 및 SWA 캐시 처리가 아직 이 모델에 완전히 최적화되지 않아 가끔 프롬프트 재처리 경고가 발생한다고 언급했습니다.

빠른 에이전트 코딩 및 디버깅을 위해 최신 Qwen 모델을 로컬에서 실행하기 위한 구체적인 성능 기준과 구성 매개변수를 제공합니다.

SOURCES

8. RTX 5090에서 Gemma 4 31B 컨텍스트를 80K로 확장

커뮤니티에서 테스트된 구성을 통해 RTX 5090 GPU에서 Gemma 4 31B 모델의 컨텍스트 윈도우를 80,000 토큰으로 확장하는 방법이 입증되었습니다. Docker를 통해 배포하고 GGML_CUDA_NO_PINNED를 1로 설정하고 백엔드 샘플링을 활성화하는 등 특정 플래그로 llama.cpp를 구성함으로써, 개발자는 로컬 Gemma 4 배포 시 기존의 컨텍스트 제한을 우회할 수 있습니다.

  • Gemma 4 31B 모델(gemma-4-31B-it-Q6_K.gguf)은 RTX 5090에서 80,000 토큰의 확장된 컨텍스트 크기를 지원할 수 있습니다.
  • 이 설정은 환경 변수 GGML_CUDA_NO_PINNED를 1로 설정해야 합니다.
  • 구성은 llama.cpp에서 --backend-sampling 및 --parallel 1 플래그를 활용합니다.
  • llama.cpp 웹 인터페이스 사용자는 이 구성을 지원하기 위해 'Backend sampling' 체크박스를 활성화해야 합니다.

특정 환경 변수와 백엔드 샘플링 플래그를 적용하여 로컬 Gemma 4 배포를 위한 훨씬 더 큰 컨텍스트 윈도우를 제공합니다.

SOURCES

9. 단일 RTX 3090에서 200K 컨텍스트로 Qwen 27B 실행

대규모 컨텍스트 윈도우로 로컬 추론을 실행하려는 개발자는 GitHub의 'club 3090' 구성을 활용할 수 있습니다. 이 설정을 통해 단일 소비자용 NVIDIA RTX 3090 GPU에서 200K 컨텍스트 윈도우로 Qwen 27B 모델을 실행할 수 있어, 고컨텍스트 로컬 테스트에 대한 접근성이 향상되었습니다.

  • 이 설정은 단일 NVIDIA RTX 3090 그래픽 카드에서 200K 컨텍스트 윈도우로 Qwen 27B 모델을 실행합니다.
  • 이 구성은 GitHub에서 제공되는 커뮤니티 개발 'club 3090' 설정을 기반으로 합니다.

개발자가 값비싼 클라우드 인프라에 의존하지 않고도 소비자용 하드웨어에서 고컨텍스트 오픈 가중치 모델을 로컬로 실행할 수 있게 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.