Inference Brew

WebGPU 기반으로 브라우저에서 25 FPS로 구동되는 증류된 LivePortrait 모델

00:00 / --:--

← 메인으로

WebGPU 기반으로 브라우저에서 25 FPS로 구동되는 증류된 LivePortrait 모델

1. WebGPU 기반으로 브라우저에서 25 FPS로 구동되는 증류된 LivePortrait 모델

한 개발자가 WebGPU를 사용하여 브라우저 내에서 완전히 구동되는 LivePortrait 모델의 증류 버전을 공개했습니다. 기존 ONNX 모델은 프레임당 30초가 소요되었으나, 이 증류 버전은 실시간 성능인 초당 25프레임(Nvidia 5090 기준 프레임당 30ms 미만)을 달성합니다. 현재는 소규모 데이터셋으로 짧게 학습되어 출력 품질에 제한이 있지만, 클라이언트 측 하드웨어 가속 인물 애니메이션의 가능성을 입증했습니다.

  • 개발자가 WebGPU를 통해 Chrome에 최적화된 LivePortrait 모델의 증류 버전을 제작했습니다.
  • 기존 ONNX 버전의 LivePortrait는 브라우저에서 단일 프레임을 생성하는 데 30초가 걸렸습니다.
  • 증류된 모델은 Nvidia 5090 GPU에서 30ms 미만으로 프레임을 생성하며 브라우저 내에서 완전히 작동합니다.
  • 현재 모델은 소규모 데이터셋으로 몇 시간 동안만 학습되어 출력 품질이 제한적입니다.

값비싼 서버 측 GPU 렌더링 없이도 웹 애플리케이션 내에서 고성능, 저지연 로컬 비디오 및 인물 애니메이션 기능을 구현할 수 있습니다.

SOURCES

2. SupraLabs, 에이전트 사고 과정을 요약하는 800M 모델 출시

SupraLabs는 원시 에이전트 추론 및 도구 호출을 구조화된 JSON 요약으로 파싱하도록 특별히 학습된 800M 파라미터 모델을 출시했습니다. 이를 통해 개발자는 원시 모델 로그 대신 최종 사용자에게 깔끔하고 읽기 쉬운 진행 상황 업데이트를 제공할 수 있습니다. SupraLabs는 모델과 함께 에이전트 추적 요약 분야의 추가 개발을 지원하기 위해 61,000개의 항목으로 구성된 데이터셋을 Hugging Face에 오픈소스로 공개했습니다.

  • SupraLabs는 에이전트 사고 과정을 요약하기 위해 SupraLabs/reasoning-summarizer-800m-pre-gguf 모델을 출시했습니다.
  • 이 모델은 원시 추론 및 도구 호출을 처리하여 제목, 부제목, 요약, 현재 작업이 포함된 구조화된 JSON 객체를 출력합니다.
  • 모델과 함께 61,000개의 추론 요약이 포함된 오픈소스 데이터셋('reasoning-summaries-61k')이 Hugging Face에 공개되었습니다.
  • 현재 모델은 요약을 시작하는 어휘가 제한적이며, 에이전트 코딩을 위한 특화 버전이 개발 중입니다.

개발자가 원시적이고 복잡한 에이전트 사고 과정을 노출하는 대신 깔끔하고 구조화된 사용자 친화적인 추론 요약을 제공할 수 있게 합니다.

SOURCES

3. SupraLabs, 51M 파라미터 프롬프트 라우팅 모델 출시

SupraLabs는 동적 프롬프트 라우팅을 위해 설계된 5,100만 파라미터의 초소형 모델인 Supra-Router-51M을 오픈소스로 공개했습니다. 이 모델은 들어오는 사용자 프롬프트를 평가하여 요청을 작고 빠른 모델로 보낼지, 아니면 더 크고 유능한 모델로 보낼지 결정합니다. 이 저지연 오케스트레이터는 학습 데이터셋과 함께 Hugging Face에서 이용할 수 있습니다.

  • SupraLabs는 5,100만 개의 파라미터를 가진 프롬프트 라우팅 모델인 Supra-Router-51M을 출시했습니다.
  • 이 모델은 저지연 환경에 최적화되어 사용자 요청을 더 작거나 큰 모델로 동적으로 라우팅합니다.
  • 모델 가중치와 학습 데이터셋 모두 Hugging Face Hub에서 이용 가능합니다.

개발자가 간단한 쿼리는 작은 모델로, 복잡한 쿼리는 큰 모델로 동적으로 라우팅하여 추론 비용과 지연 시간을 줄일 수 있도록 돕습니다.

SOURCES

4. shadcn/ui, 기본 컴포넌트 라이브러리를 Radix에서 Base UI로 변경

주요 아키텍처 변경의 일환으로, shadcn/ui는 Radix에서 벗어나 Base UI를 기본 컴포넌트 라이브러리로 채택했습니다. Radix는 여전히 완전히 지원되며 CLI 플래그를 통해 사용할 수 있지만, 이번 전환은 개발자들의 강력한 선호를 반영한 것으로, 신규 프로젝트에서 Base UI를 선택하는 비율이 2대 1로 더 높았습니다. 전환을 용이하게 하기 위해 shadcn은 Cursor 및 Claude Code와 같은 AI 코딩 어시스턴트와 호환되는 마이그레이션 스킬을 도입하여 컴포넌트별 리팩토링을 자동화했습니다.

  • 2026년 7월 기준으로 Base UI가 shadcn/ui의 기본 컴포넌트 라이브러리가 되었으며, 출시 이후 기본값이었던 Radix를 대체합니다.
  • Base UI는 현재 버전 1.6.0이며 주간 다운로드 수가 600만 건을 넘습니다.
  • shadcn/create를 통해 생성된 신규 프로젝트에서 Base UI를 Radix보다 2대 1 비율로 더 많이 선택합니다.
  • Radix는 지원이 중단되지 않았으며 계속해서 업데이트와 새로운 컴포넌트 릴리스를 받을 예정입니다.
  • 개발자는 shadcn init 과정에서 -b radix 플래그를 사용하여 Radix로 새 프로젝트를 초기화할 수 있습니다.
  • Claude Code 및 Cursor와 호환되는 새로운 마이그레이션 스킬을 통해 Radix에서 Base UI로 컴포넌트를 전환할 수 있습니다.

새로운 shadcn/ui 프로젝트를 시작하는 개발자는 기본적으로 Base UI를 기반으로 구축하게 되며, 기존 컴포넌트를 전환하기 위해 자동화된 마이그레이션 도구를 사용할 수 있습니다.

SOURCES

5. Qualcomm, Windows 노트북용 로컬 LLM 실행 SDK 'GenieX' 출시

Qualcomm은 Windows 노트북에서 LLM을 로컬로 실행하기 위해 설계된 소프트웨어 개발 키트인 GenieX를 출시했습니다. 이 SDK는 llama.cpp와 통합되어 개발자가 Qualcomm의 CPU, GPU 및 NPU 하드웨어 전반에서 모든 Q4_0 GGUF 모델을 실행할 수 있도록 합니다. 초기 사용자 벤치마크에 따르면 하드웨어 가속을 사용하여 Gemma 4 26B 모델에서 초당 20토큰의 성능을 보이는 등 유망한 결과를 보여주고 있습니다.

  • Qualcomm은 Windows 노트북에서 로컬 LLM 실행을 가능하게 하기 위해 GenieX를 출시했습니다.
  • 이 SDK를 사용하면 llama.cpp를 통해 Qualcomm 하드웨어(CPU, GPU, NPU)에서 모든 Q4_0 GGUF 모델을 실행할 수 있습니다.
  • 한 사용자는 Qualcomm GPU 또는 NPU에서 Gemma 4 26B A4B 모델을 실행하여 초당 20토큰을 달성했다고 보고했습니다.
  • 같은 사용자는 Qualcomm GPU에서 Qwen 3.6 27B MTP 모델을 실행하여 초당 10토큰을 달성했습니다.

개발자가 하드웨어 가속을 활용하여 Snapdragon 기반 Windows 노트북에서 로컬 AI 애플리케이션을 구축하고 실행할 수 있게 합니다.

SOURCES

6. 일반적인 AI 미학 방지를 위한 Claude Design 시스템 프롬프트 공개

Claude Design은 LLM의 디자인 출력을 개선하기 위해 설계된 오픈소스 MIT 라이선스 시스템 프롬프트 및 스킬 라이브러리를 출시했습니다. 이 시스템은 모델이 깔끔하고 접근 가능하며 전문적인 인터페이스를 생성하도록 돕기 위해 20개의 디자인 철학 챕터와 14개의 절차적 스킬을 제공합니다. 과도한 이모지나 강한 그라데이션과 같은 일반적인 AI 디자인 클리셰를 명시적으로 금지함으로써, 이 프롬프트는 개발자가 프로덕션 수준의 UI 코드를 생성하도록 돕습니다.

  • Claude Design은 UI 디자인 협업을 위한 오픈소스 MIT 라이선스 시스템 프롬프트 및 스킬 라이브러리입니다.
  • 이 시스템에는 프로덕션, 추출 및 검토를 위한 20개의 디자인 철학 챕터와 14개의 호출 가능한 절차적 스킬이 포함되어 있습니다.
  • 이 프롬프트는 LLM에게 강한 그라데이션, 이모지 장식, 일반적인 SaaS 템플릿과 같은 흔한 AI 디자인 요소를 거부하도록 명시적으로 지시합니다.
  • Claude, GPT, Gemini 및 로컬 모델과 호환되며, OpenAI의 Codex를 위한 특정 변형도 제공됩니다.
  • 이 프롬프트는 Fable 5 및 Opus 4.7/4.8 계보를 포함한 Anthropic의 프론티어 모델에 최적화되어 있습니다.

개발자가 LLM이 일반적인 SaaS 템플릿이나 과도한 그라데이션을 사용하지 않도록 유도하여 더 깔끔하고 접근 가능한 UI 코드를 보장할 수 있습니다.

SOURCES

7. 로컬 에이전트 워크로드를 위한 장기 컨텍스트 벤치마크, 주요 병목 현상 식별

llama.cpp에서 실행되는 13개 로컬 LLM에 대한 포괄적인 벤치마크는 장기 컨텍스트 에이전트 워크로드에 대한 중요한 아키텍처 요소를 강조합니다. 연구에 따르면 프리필 속도가 전체 실행 시간을 지배하며, 표준 토큰 생성 지표는 부차적인 것으로 나타났습니다. 로컬 에이전트를 구축하는 개발자는 4 KV 헤드 아키텍처의 우수한 확장성이나 양자화된 KV 캐시의 성능 저하와 같은 연구 결과를 활용하여 하드웨어 구성을 최적화할 수 있습니다.

  • 이 벤치마크는 RX 7900 XT 20GB GPU와 llama.cpp 빌드 9860을 사용하여 65K-128K 컨텍스트 길이에서 13개 로컬 LLM을 평가했습니다.
  • 65K 컨텍스트에서 짧은 에이전트 출력의 경우 프리필 속도가 전체 실행 시간의 94%~99%를 차지하여 토큰 생성 속도는 거의 무의미합니다.
  • 4 KV 헤드를 가진 모델이 8 KV 헤드를 가진 모델보다 장기 컨텍스트 프리필 속도에서 훨씬 더 잘 확장되었습니다.
  • Granite-4.0-H-Small과 같은 Mamba2 하이브리드 모델은 131K 컨텍스트까지 거의 평탄한 프리필 확장성을 보이며 4K 컨텍스트 속도의 69%를 유지했습니다.
  • F16 KV 캐시를 사용하는 것이 역양자화 오버헤드로 인해 MoE 및 소형 밀집 모델의 경우 양자화된 Q8 또는 Q4 KV 캐시보다 20%~53% 더 빠를 수 있습니다.
  • GLM-4.7-Flash와 같은 MLA(Multi-head Latent Attention) 아키텍처는 Vulkan에서 프리필 확장성이 낮아 16K에서 속도의 80%를 잃고 65K에서 충돌했습니다.

개발자가 VRAM이나 컴퓨팅 자원을 낭비하지 않고 장기 컨텍스트 에이전트 작업을 위해 로컬 모델 선택 및 구성을 최적화할 수 있습니다.

SOURCES

8. oMLX 최적화, Apple Silicon에서 DeepSeek V4 추론 성능 대폭 향상

SSD 스트리밍 및 기본 벤치마크를 통해 Apple Silicon에서 DeepSeek V4를 실행하는 것에 대한 이전 보고에 이어, 성능을 크게 향상시키는 oMLX 최적화가 공개되었습니다. 네이티브 DeepSeek 아핀 MoE 커널과 8비트 아핀 Metal 커널 인스턴스화를 구현함으로써, 이 패치는 Mac Studio M3 Ultra에서 프리필 1.6배(533 tok/s) 및 디코드 3배(최대 22 tok/s)의 속도 향상을 달성했습니다.

  • 새로운 oMLX 패치는 네이티브 DeepSeek 아핀 MoE 커널과 8비트 아핀 Metal 커널 인스턴스화를 가능하게 합니다.
  • Mac Studio M3 Ultra에서의 성능이 프리필 533 tok/s, 디코드 최대 22 tok/s로 향상되었습니다.
  • 이러한 최적화는 SSD 스트리밍과 같이 Apple Silicon에서 DeepSeek V4를 실행하는 기존 방법을 기반으로 합니다.
  • 작성자는 현재 잠재적인 정확도 저하에 대한 커뮤니티 피드백을 요청하고 있습니다.

이러한 최적화는 이전에 보고된 기본 성능을 넘어 대규모 MoE 모델을 로컬에서 실행하는 개발자에게 큰 성능 향상을 제공합니다.

SOURCES

9. ByteDance와 Alibaba, 중국 내 신규 규정 준수를 위해 맞춤형 AI 에이전트 기능 비활성화

ByteDance와 Alibaba는 중국 내 각각의 Doubao 및 Qwen 플랫폼에서 맞춤형 AI 에이전트 기능을 비활성화하고 있습니다. 이번 조치는 7월 15일부터 시행되는 '인공지능 의인화 상호작용 서비스 관리 잠정 조치'에 대한 직접적인 대응입니다. 이 규정은 인간의 성격을 모방하거나 지속적인 감정적 상호작용을 유도하는 AI 시스템을 대상으로 하지만, 일반적인 업무 보조원이나 고객 서비스 봇은 제외됩니다.

  • ByteDance의 Doubao와 Alibaba의 Qwen은 다가오는 규정에 대응하여 맞춤형 AI 에이전트 기능을 비활성화하고 있습니다.
  • '인공지능 의인화 상호작용 서비스 관리 잠정 조치'가 7월 15일부터 시행됩니다.
  • 이 규정은 지속적인 감정적 상호작용을 위해 인간의 성격, 사고 패턴, 의사소통 방식을 모방하는 AI 서비스를 대상으로 합니다.
  • 이 규칙은 극단주의 사상, 개인정보 유출, 정신 건강 피해, AI 중독과 같은 위험을 완화하는 것을 목표로 합니다.
  • 고객 서비스 봇, 업무 보조원, 과학 연구 도구는 지속적인 감정적 상호작용을 피하는 경우 규칙에서 제외됩니다.

중국에서 대화형 또는 감정적 AI 에이전트를 출시하는 개발자는 엄격한 새로운 규정 준수 규칙에 적응해야 하며, 그렇지 않으면 서비스 중단 위험이 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.