Inference Brew

Alibaba, 오픈 웨이트 7B 모델 'Qwen-Image-2.1' 출시

00:00 / --:--

← 메인으로

Alibaba, 오픈 웨이트 7B 모델 'Qwen-Image-2.1' 출시

1. Alibaba, 오픈 웨이트 7B 모델 'Qwen-Image-2.1' 출시

Alibaba의 Qwen 팀은 고급 이미지 생성 및 편집을 위해 설계된 7B 파라미터 모델인 Qwen-Image-2.1을 오픈 소스로 공개했습니다. 빠른 추론을 위해 구축된 이 모델은 투명도를 위한 RGBA 레이어를 기본적으로 지원하며, 개발자가 최대 10개의 참조 이미지를 사용하여 편집을 가이드할 수 있다는 점이 특징입니다. 가상 착용, 인포그래픽, 파노라마와 같은 복잡한 작업을 사실적인 질감과 타이포그래피로 처리할 수 있어 활용도가 매우 높습니다. 이 모델은 Hugging Face, GitHub, Model Scope에서 즉시 이용 가능합니다.

  • • Alibaba는 GitHub, Model Scope, Hugging Face를 통해 오픈 웨이트 모델인 Qwen-Image-2.1을 출시했습니다.
  • • 이 모델은 빠른 추론과 다중 이미지 입력에 최적화된 경량 7B 아키텍처를 사용합니다.
  • • 투명도를 구현하기 위해 RGBA 레이어의 기본 생성 및 편집을 지원합니다.
  • • 개발자는 최대 10개의 참조 이미지를 사용하여 고충실도 편집을 수행할 수 있습니다.
  • • 이 모델은 파노라마, 인포그래픽, 가상 착용 생성 및 인물 사진에 대한 정밀한 로컬 제어를 지원합니다.

개발자는 정밀한 로컬 편집, 투명한 RGBA 레이어 생성, 다중 이미지 참조 작업이 가능한 경량의 고충실도 이미지 모델을 직접 호스팅할 수 있습니다.

2. Alibaba, 실시간 통역 모델 'Qwen3.8-LiveTranslate' 출시

Alibaba의 Qwen 팀은 저지연 번역 워크플로우를 지원하기 위해 설계된 실시간 동시통역 모델 Qwen3.8-LiveTranslate를 선보였습니다. 새로운 Interleave 아키텍처를 활용하여 평균 지연 시간을 2.3초로 단축했으며, 화자 분리(speaker diarization) 및 동기화된 이중 언어 디스플레이와 같은 고급 기능을 지원합니다. 오디오와 선택적인 이미지를 입력으로 받아 텍스트와 오디오 출력을 모두 생성합니다. 이 모델은 Alibaba Cloud Model Studio 및 QwenCloud의 호스팅 API를 통해 이용할 수 있습니다.

  • • Qwen3.8-LiveTranslate는 새로운 Interleave 아키텍처를 활용하는 실시간 동시통역 모델입니다.
  • • 평균 지연 시간(LAAL)을 2.8초에서 2.3초로 단축했습니다.
  • • 실시간 화자 분리, 동기화된 이중 언어 디스플레이, 긴 문맥의 모호성 해결을 지원합니다.
  • • 60개 언어를 이해하며 그중 29개 언어로 음성 출력이 가능합니다.
  • • 53,248 토큰의 컨텍스트 윈도우를 제공하며, 입력에 49,152 토큰, 출력에 4,096 토큰이 할당됩니다.
  • • Alibaba Cloud Model Studio 및 QwenCloud에서 호스팅 API로 제공되며 기본 속도 제한은 10 RPM 및 100k TPM입니다.

개발자는 호스팅 API를 통해 저지연 실시간 이중 언어 번역 및 화자 분리 기능을 음성 및 영상 애플리케이션에 통합할 수 있습니다.

SOURCES

3. Vercel 및 Cloudflare, AI 에이전트 라우팅을 위해 TypeSafe의 Jev 통합

주요 클라우드 플랫폼인 Vercel과 Cloudflare가 빠르고 구조화된 의사결정을 위해 설계된 'System One' 모델 프레임워크인 TypeSafe의 Jev를 통합했습니다. 이번 채택은 TypeSafe의 최근 얼리 액세스 출시 및 API 가격 발표에 따른 것으로, 개발자들은 이 플랫폼에서 Jev를 활용하여 라우팅, 안전 검사, 도구 선택을 수행할 수 있게 되었습니다. 이러한 작업을 Jev로 오프로딩함으로써 플랫폼들은 에이전트 루프에 프론티어 모델을 사용할 때 발생하는 비용과 지연 시간을 줄이는 것을 목표로 합니다.

  • • Vercel과 Cloudflare가 자사 플랫폼에 Jev 프레임워크를 통합했습니다.
  • • 이번 통합은 TypeSafe의 최근 얼리 액세스 출시 및 API 가격 발표 이후 이루어졌습니다.
  • • Jev는 라우팅, 안전성, 도구 선택을 처리하는 데 사용되며, 에이전트 루프에서 더 비싼 프론티어 모델을 대체합니다.
  • • 이 프레임워크는 GPT-5.6 및 Claude Sonnet 5와 같은 모델의 워크플로우 평가 성능과 일치하도록 설계되었습니다.

주요 클라우드 플랫폼에 통합됨으로써 Jev의 효율적이고 구조화된 의사결정 기능을 더 많은 개발자가 사용할 수 있게 되어, 더 빠르고 저렴한 AI 에이전트 워크플로우 구현이 가능해졌습니다.

SOURCES

4. Python 전용 멀티플랫폼 앱 개발을 위한 Flet 1.0 출시

출시 4년 만에 Flet 팀은 개발자가 Python을 사용하여 멀티플랫폼 애플리케이션을 구축할 수 있는 오픈 소스 Python 프레임워크인 Flet 1.0을 출시했습니다. Flet은 Flutter의 Material 및 Cupertino 위젯을 렌더링하며 iOS, Android, 웹, 데스크톱을 포함한 8개의 대상 플랫폼을 지원합니다. 이번 릴리스에서는 Python과 Dart 간의 소켓 없는 프로세스 내 통신을 위한 새로운 dart-bridge가 도입되었으며, 제어 디핑(control diffing) 성능이 6.7배 향상되었습니다. Apache 2.0 라이선스로 제공되며 Python 3.10 이상이 필요합니다.

  • • Flet 1.0.0은 Apache 2.0 라이선스 하에 PyPI에서 제공되며 Python 3.10 이상이 필요합니다.
  • • 이 프레임워크는 iOS, Android, Windows, macOS, Linux, 웹 등 8개 플랫폼에서 Flutter를 사용하여 Material 및 Cupertino 위젯을 렌더링합니다.
  • • 웹 빌드는 Pyodide를 활용하며, 프레임워크는 애플리케이션과 함께 Python 3.12, 3.13 또는 3.14를 번들로 제공합니다.
  • • Flet 패키지 인덱스는 NumPy, pandas, Pillow, SciPy를 포함한 100개 이상의 패키지를 지원합니다.
  • • Flet 1.0은 제어 디핑 성능이 최대 6.7배 향상되었으며 프로세스 내 통신을 위한 새로운 dart-bridge를 포함합니다.

Python 개발자는 단일 코드베이스를 사용하여 AI 애플리케이션을 위한 프로덕션 수준의 웹, 데스크톱 및 모바일 UI를 구축하고 배포할 수 있습니다.

SOURCES

5. Imprint, 에이전트 워크플로우를 위한 소프트웨어 팩토리 패턴 채택

핀테크 기업 Imprint는 개발 작업을 자동화하는 에이전트 워크플로우인 '소프트웨어 팩토리 패턴'의 도입 사례를 상세히 공개했습니다. Claude Code와 함께 독립적인 오케스트레이션 하네스를 사용하여, 이 시스템은 Notion RFC 및 Datadog 또는 Snowflake의 실시간 지표와 프로젝트 목표를 대조하는 `/linear-project-loop` 스킬을 실행합니다. 에이전트는 자동으로 이슈를 생성하고, Linear의 상태를 업데이트하며, 풀 리퀘스트를 작성하고, 릴리스 후 오류율을 모니터링합니다. 이 패턴을 구현하려면 Datadog MCP, Snowflake, Linear 통합이 필요합니다.

  • • Imprint는 Claude Code, 로컬 워크스페이스 관리, 독립적인 오케스트레이션 하네스를 사용하여 '소프트웨어 팩토리 패턴'을 채택했습니다.
  • • 이 패턴은 `/linear-project-loop`라는 에이전트 스킬을 사용하여 Notion RFC 및 Datadog 또는 Snowflake 지표와 프로젝트 목표를 감사합니다.
  • • 에이전트는 프로젝트 상태에 따라 자동으로 이슈를 추가하고, Linear의 상태를 업데이트하며, 풀 리퀘스트를 작성합니다.
  • • 이 패턴은 채택률 및 오류율에 대한 릴리스 후 모니터링에도 사용됩니다.
  • • 구현을 위해서는 Datadog MCP, Snowflake 액세스, Linear 및 오케스트레이션 하네스가 필요합니다.

개발자는 구조화된 에이전트 오케스트레이션 패턴을 채택하여 이슈 생성부터 릴리스 후 모니터링까지 엔드 투 엔드 개발 작업을 자동화할 수 있습니다.

SOURCES

6. Laya CoreML 포트, Mac M4에서 오프라인 Jev 추론 가능

Jev의 오프라인 구현체인 오픈 소스 Laya 프로젝트가 Apple Silicon용 CoreML로 포팅되었습니다. GitHub의 `mizorewww/laya-coreml` 저장소에서 제공되는 이 프로젝트를 통해 Mac M4 시스템은 완전히 오프라인 상태에서 초당 최대 45회의 의사결정을 처리할 수 있습니다. 약 560MB의 가벼운 물리적 메모리 점유율을 가진 이 프로젝트는 개발자가 쿼리 분류 및 도구 라우팅과 같은 빠르고 구조화된 의사결정 작업을 실행하는 데 사용할 수 있는 로컬 API 엔드포인트를 제공합니다.

  • • 'Laya on Mac m4 CoreML Offline' 프로젝트는 GitHub의 mizorewww/laya-coreml 저장소에서 제공됩니다.
  • • 이 구현은 Mac M4 하드웨어에서 오프라인으로 초당 45회의 의사결정을 수행합니다.
  • • 시스템 분석 결과 물리적 메모리 점유율은 560.4MB이며 최대 778.0MB를 기록했습니다.
  • • 이 프로젝트는 쿼리 긴급도 평가와 같은 추론 작업을 실행하기 위한 로컬 API 엔드포인트를 제공합니다.

데스크톱 또는 오프라인 우선 AI 에이전트를 구축하는 개발자는 Apple Silicon에서 고속, 저메모리 도구 라우팅 의사결정을 로컬로 실행할 수 있습니다.

SOURCES

7. 빠른 의사결정을 위한 커스텀 CUDA 커널이 포함된 Laya.cpp 출시

개발자 lkarlslund는 Laya 모델을 위한 독립형 C++ 추론 구현체인 laya.cpp를 출시했습니다. ggml 기반으로 구축되고 커스텀 CUDA 커널을 포함하는 이 MIT 라이선스 프로젝트는 Python 및 PyTorch 의존성을 완전히 제거했습니다. 네이티브 토큰화, 모델 실행 및 Jev 호환 HTTP 서버를 특징으로 합니다. 융합 연산(fused operations) 및 개선된 어텐션 메모리 액세스와 같은 성능 최적화는 NVIDIA 하드웨어에서 높은 처리량을 제공하여 저지연 프로덕션 라우팅에 탁월한 선택이 됩니다.

  • • laya.cpp는 ggml 기반으로 구축되고 커스텀 CUDA 커널을 포함하는 Laya 모델용 독립형 C++ 추론 구현체입니다.
  • • 이 구현은 MIT 라이선스를 따르며 Python이나 PyTorch가 필요하지 않습니다.
  • • 네이티브 토큰화 및 출력 형식을 갖춘 영어, 다국어 및 유형화된 의사결정 체크포인트를 지원합니다.
  • • 최적화에는 융합 연산, 개선된 어텐션 메모리 액세스, 불필요한 복사 제거가 포함됩니다.
  • • BF16 지원에는 CUDA 13.0 및 cuBLAS 13.1.0이 필요하며, RTX PRO 6000 Blackwell에서 높은 초당 질문 처리 성능을 보여줍니다.

개발자는 Python이나 PyTorch 없이도 NVIDIA GPU에서 고성능의 의존성 없는 Jev 의사결정 파이프라인을 실행할 수 있습니다.

SOURCES

8. DIY Jev 구현, Llama.cpp를 통한 로컬 도구 선택 가능

새로운 오픈 소스 프로젝트인 DIY Jev는 Jev 스타일의 도구 선택 및 의사결정 워크플로우를 로컬에서 실행하는 경량 방법을 제공합니다. 상태, 질문 및 옵션 접두사를 한 번 평가하고 llama.cpp를 통해 후보 분기를 배치 처리하여 참/거짓 로짓을 읽음으로써, 이 시스템은 특수 분류기 헤드가 필요하지 않습니다. 이 저장소에는 Jev 호환 API를 노출하는 Rust 웹 서버가 포함되어 있어 개발자가 소비자용 하드웨어에서 Hugging Face의 로컬 GGUF 모델을 실행할 수 있습니다.

  • • DIY Jev 설정은 NLI 미세 조정이나 분류기 헤드 없이 오픈 웨이트 LLM을 사용하여 상태와 질문을 평가합니다.
  • • 이 방법은 llama.cpp를 통해 후보 분기를 배치 처리하여 참/거짓 로짓을 읽습니다.
  • • Qwen3-4B는 RTX 5090 노트북에서 초당 27개 요청으로 65.0%의 정확도를 달성했습니다.
  • • Qwen3.6 35B-A3B는 초당 5.3개 요청으로 75.5%의 정확도를 달성했습니다.
  • • 이 프로젝트에는 로컬 GGUF 모델을 위한 Jev 호환 API를 제공하는 Rust 웹 서버가 포함되어 있습니다.

개발자는 특수 NLI 미세 조정 없이도 소비자용 하드웨어에서 빠르고 로컬인 Jev 호환 도구 선택 API를 실행할 수 있습니다.

SOURCES

9. Qwen3.5 4B 기반으로 미세 조정된 Jev 스타일 모델 출시

한 개발자가 Qwen3.5 4B를 기반으로 미세 조정된 특수 Jev 스타일 모델을 출시했습니다. DeepSeek V4.1 Flash가 생성한 2,500만 토큰의 합성 데이터셋으로 LoRA를 사용하여 학습된 이 모델은 유형화된 의사결정 점수를 0.596에서 0.709로 향상시켰습니다. 제작자는 모델 가중치, 합성 학습 데이터셋, Jev 호환 API 엔드포인트를 GitHub와 Hugging Face에 오픈 소스로 공개하여 구조화된 로컬 의사결정을 위한 경량 옵션을 제공합니다.

  • • 작성자는 공개 데이터셋과 합성 데이터셋을 혼합하여 LoRA로 Qwen3.5 4B 모델을 미세 조정했습니다.
  • • 합성 데이터셋은 DeepSeek V4.1 Flash가 생성한 2,500만 개의 토큰을 포함합니다.
  • • 미세 조정된 모델은 유형화된 의사결정 점수를 0.596에서 0.709로 향상시켰습니다.
  • • 합성 데이터셋, 모델 가중치 및 Jev 호환 API 엔드포인트가 GitHub와 Hugging Face에 오픈 소스로 공개되었습니다.

개발자는 빠르고 구조화된 의사결정 작업에 특별히 최적화된 작고 효율적인 로컬 모델을 배포할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.