Inference Brew

Meta, 소비자용 AI 에이전트 플랫폼으로 Muse 생태계 확장

00:00 / --:--

← 메인으로

Meta, 소비자용 AI 에이전트 플랫폼으로 Muse 생태계 확장

1. Meta, 소비자용 AI 에이전트 플랫폼으로 Muse 생태계 확장

Meta는 Muse Spark 1.3 모델과 Muse Code 터미널 에이전트 출시에 이어, 개인 AI 에이전트 플랫폼인 'Muse'를 선보였습니다. iOS, Android 및 웹에서 사용할 수 있는 이 플랫폼은 Muse Spark 1.3을 활용하여 이메일 관리, 여행 예약 등 개인적인 업무를 자동화합니다. 보안을 위해 각 사용자에게는 전용 Muse Secure VM이 할당되며, Sentinel 에이전트가 네트워크 송신 및 커넥터 작업을 감독합니다.

  • • Meta가 iOS, Android 및 웹용 개인 AI 에이전트 플랫폼 Muse를 출시했습니다.
  • • 이 플랫폼은 이전에 개발자용으로 공개된 Muse Spark 1.3 모델을 기반으로 합니다.
  • • 각 사용자에게는 브라우저 및 자격 증명 데이터를 격리하기 위한 전용 Muse Secure VM이 제공됩니다.
  • • 보안 에이전트인 Sentinel이 서로게이트 토큰을 사용하여 네트워크 송신 및 커넥터 작업을 관리합니다.
  • • 이 플랫폼은 이메일, 여행 예약, 청구서 협상 등 개인적인 업무를 자동화합니다.

이번 출시는 개발자 중심의 Muse Code 터미널 에이전트와 원시 모델 API를 넘어, Meta의 에이전트 기능을 소비자 기기로 확장했다는 점에서 의미가 있습니다.

SOURCES

2. Mercury 2.5 가격 상세 공개: 80% 할인 적용

9월 8일에 발표된 Mercury 2.5 출시를 바탕으로, Inception Labs는 해당 모델의 가격 구조를 상세히 공개했습니다. 이 모델은 입력 토큰 100만 개당 0.04달러, 출력 토큰 100만 개당 0.15달러로 제공되며, 이는 기존 표준 요금에서 80% 할인된 가격입니다. Mercury 2.5는 260K 토큰의 컨텍스트 윈도우와 초당 1,107 토큰의 생성 속도를 계속 유지합니다.

  • • Mercury 2.5는 입력 토큰 100만 개당 0.04달러, 출력 토큰 100만 개당 0.15달러에 이용 가능합니다.
  • • 이 가격은 모델의 표준 요금에서 80% 할인된 금액입니다.
  • • 모델은 260K 토큰의 컨텍스트 윈도우와 초당 1,107 토큰의 생성 속도를 유지합니다.

개발자들은 이제 새로운 260K 컨텍스트 모델을 프로덕션 워크플로우에 통합할 때 구체적인 비용 절감 효과를 계산할 수 있게 되었습니다.

SOURCES

3. Suno, 라이선스 데이터로 학습된 v6 AI 음악 모델 출시

Suno는 법적 분쟁 합의 이후 Warner Music Group, BMG, Believe 등 주요 업계 파트너들과 협력하여 개발한 v6 AI 음악 모델 제품군을 출시했습니다. 이번 출시에는 플래그십 모델인 v6, 실험적인 v6-wild, 무료 티어인 v6-mini 등 세 가지 모델이 포함됩니다. 새로운 모델들은 특정 노래 부분에 대한 자연어 편집, 트랙 요소 분리, 이미지/비디오/오디오를 참조 프롬프트로 사용하는 기능 등 고급 기능을 도입했습니다.

  • • Suno는 플래그십 v6, 실험적 v6-wild, 무료 v6-mini로 구성된 v6 AI 음악 모델 제품군을 출시했습니다.
  • • 이 모델들은 Warner Music Group, BMG, Believe의 라이선스 콘텐츠를 포함한 새로운 데이터셋으로 처음부터 학습되었습니다.
  • • 새로운 기능으로는 특정 노래 부분의 자연어 편집, 사용자 라이브러리의 요소 결합, 텍스트/오디오/이미지/비디오를 통한 프롬프팅이 있습니다.
  • • 플래그십 v6 및 v6-wild 모델에 액세스하려면 Pro(월 8달러) 또는 Premier(월 24달러) 구독이 필요합니다.
  • • 모델들은 장르 이해도는 향상되었으나, 자연스러운 불완전함을 생성하지 못하고 일관되게 조화롭고 리듬감 있는 완벽한 결과물을 출력합니다.

오디오 및 창작 애플리케이션을 개발하는 개발자들은 Suno의 새로운 v6 모델을 활용하여 자연어 편집, 트랙 결합, 멀티모달 참조 프롬프트 기능을 구현할 수 있습니다.

4. Desert Ant Labs, 18종의 온디바이스 인텔리전스 모델 출시

유럽 스타트업 Desert Ant Labs는 5년 된 구형 휴대폰에서도 로컬로 실행되도록 설계된 18종의 특화된 온디바이스 인텔리전스 모델 제품군을 출시했습니다. Swift, Kotlin, JavaScript용 통합 SDK를 통해 액세스할 수 있는 이 제품군에는 Voz(Whisper보다 4.7배 빠른 전사 모델), Clear(9MB 오디오 향상 도구), Redact(실시간 PII 마스킹 도구), Clips(284MB 비디오 클립 생성기)가 포함됩니다. 이 모델들은 월간 활성 기기 10만 대까지 무료로 배포할 수 있어 클라우드 API를 대체할 토큰 비용 제로의 대안을 제공합니다.

  • • Desert Ant Labs는 구형 휴대폰을 포함한 기기에서 로컬로 실행되도록 설계된 18종의 특화된 온디바이스 모델(안정 버전 12개, 베타 버전 6개)을 출시했습니다.
  • • 모델들은 Swift, Kotlin, JavaScript를 지원하는 SDK를 통해 액세스할 수 있습니다.
  • • 주요 모델로는 Voz(Whisper보다 4.7배 빠른 전사), Clear(9MB 스튜디오급 오디오 향상), Redact(27개 언어 실시간 PII 마스킹)가 있습니다.
  • • Clips는 Claude Sonnet보다 10배 빠르고 470배 적은 에너지를 사용하여 비디오 클립을 생성하는 284MB 모델입니다.
  • • 모델들은 월간 활성 기기 10만 대까지 무료로 사용할 수 있습니다.

개발자들은 클라우드 API 비용이나 지연 시간 없이 모바일 및 웹 앱에 빠르고 로컬에서 작동하는 오디오, 비디오 및 텍스트 처리 기능을 통합할 수 있습니다.

SOURCES

5. Tencent, AuK 음성 생성 및 편집 모델 출시

Tencent는 자연어 인터페이스를 통해 작동하는 통합 음성 생성 및 편집 모델인 AuK를 출시했습니다. AuK는 제로샷 텍스트 음성 변환(TTS), 오디오 향상, 분리, 그리고 콘텐츠/음향/준언어적 요소에 대한 지시 기반 편집을 지원합니다. 지연 시간에 민감한 애플리케이션을 위해 Tencent는 표준 모델보다 4.5배 빠르게 실행되는 증류 버전인 AuK-Flash도 함께 출시했습니다.

  • • Tencent는 음성 생성 및 편집을 위한 통합 모델인 AuK를 출시했습니다.
  • • 이 모델은 제로샷 텍스트 음성 변환(TTS), 콘텐츠/음향/준언어적 요소의 지시 기반 편집, 오디오 향상을 지원합니다.
  • • AuK는 모든 작업에 자연어 인터페이스를 사용합니다.
  • • AuK-Flash라는 증류 버전은 표준 버전보다 4.5배 빠르게 작동합니다.

개발자들은 자연어 인터페이스를 사용하여 기존 음성을 편집하고, 오디오를 향상하며, 제로샷 TTS를 수행하는 고급 음성 애플리케이션을 구축할 수 있습니다.

SOURCES

6. Gradium, 합성 음성 생성을 위한 Voice Design API 출시

Gradium은 참조 오디오 없이 서면 설명만으로 새로운 합성 음성을 생성하는 도구인 Voice Design을 API 및 스튜디오를 통해 출시했습니다. 영어, 프랑스어, 스페인어, 포르투갈어, 독일어를 지원하며, 1~500자 길이의 프롬프트를 처리하여 3~5초 이내에 최대 5개의 비결정론적 음성 후보를 반환합니다. 이 도구는 Gradium의 무료 티어에서 사용할 수 있으며, 변환되지 않은 후보는 30일 후 자동으로 삭제됩니다.

  • • Gradium의 Voice Design은 참조 오디오 없이 1~500자의 서면 설명으로 새로운 합성 음성을 생성합니다.
  • • 이 도구는 Gradium API 및 스튜디오에서 무료 티어를 포함하여 제공되며 영어, 프랑스어, 스페인어, 포르투갈어, 독일어를 지원합니다.
  • • 시스템은 3~5초 이내에 1~5개의 비결정론적 음성 후보를 반환합니다.
  • • 변환되지 않은 음성 후보는 30일 후 삭제되며 기능이 제한됩니다.
  • • Gradium은 다른 5개 음성 디자인 시스템과의 블라인드 쌍대 비교 청취 테스트에서 72.6%의 승률을 기록했습니다.

개발자들은 참조 오디오 대신 간단한 텍스트 프롬프트를 사용하여 몇 초 만에 맞춤형 비결정론적 합성 음성을 프로그래밍 방식으로 생성할 수 있습니다.

SOURCES

7. Google, Mantis 보안 툴킷 오픈소스화

Google은 7월에 도입된 Mantis Skills 프레임워크를 기반으로 Mantis 보안 툴킷을 Apache 2.0 라이선스 하에 공식적으로 오픈소스화했습니다. 이 툴킷은 Gemini CLI 및 Google ADK와 같은 프레임워크와 호환되는 모듈식 슬래시 명령 및 규칙을 제공하여, 에이전트가 탐지부터 샌드박스 재현, 패치 및 재공격 검증에 이르는 전체 취약점 수명 주기를 관리할 수 있도록 합니다.

  • • Google은 Mantis 보안 툴킷을 Apache 2.0 라이선스로 오픈소스화했습니다.
  • • 이번 출시는 2026년 7월 Mantis Skills 프레임워크의 초기 도입에 따른 것입니다.
  • • 이 툴킷은 샌드박스 재현 및 패치 재공격을 포함한 엔드투엔드 취약점 관리를 지원합니다.
  • • Gemini CLI, Antigravity CLI 및 Google ADK와 호환됩니다.
  • • 토큰 오버헤드를 85% 이상 줄이기 위한 계층적 요약 트리를 특징으로 합니다.

개발자들은 이제 이전에 발표된 Mantis 프레임워크를 프로덕션 파이프라인에 통합하여 샌드박스 재현 및 패치 검증을 통해 보안 검토를 자동화할 수 있습니다.

SOURCES

8. OtoDock 1.6.0, 샌드박스 커널을 갖춘 셀프 호스팅 에이전트 OS 출시

OtoDock 1.6.0은 안전한 환경에서 지속적인 AI 에이전트를 실행하도록 설계된 셀프 호스팅 기업용 OS로 출시되었습니다. 이 플랫폼은 Claude Code와 유사한 기능을 통합하며 Anthropic, OpenAI 또는 로컬 모델을 지원합니다. 보안을 보장하기 위해 에이전트는 bubblewrap을 사용하는 커널 샌드박스 내에서 실행되며 pasta를 통한 네트워크 격리가 이루어집니다. 또한 인바운드 포트나 VPN 없이도 아웃바운드 WebSocket을 통해 원격 기기에 연결할 수 있습니다. OtoDock은 GitHub에서 Fair Source 라이선스로 제공되며 5명까지 무료로 사용할 수 있습니다.

  • • OtoDock은 비즈니스 관리 및 멀티 테넌트 협업을 위한 셀프 호스팅 기업용 OS입니다.
  • • Claude Code, Cowork 및 클라우드 세션과 유사한 기능을 단일 애플리케이션으로 통합합니다.
  • • 에이전트는 bubblewrap을 사용하는 커널 샌드박스 내에서 지속적인 프로세스로 실행되며 pasta를 통해 네트워크가 격리됩니다.
  • • 에이전트는 아웃바운드 WebSocket을 사용하여 원격 컴퓨터에서 실행될 수 있으므로 인바운드 포트나 VPN이 필요하지 않습니다.
  • • OtoDock은 Fair Source 라이선스를 따르며 5명까지 무료이고 Docker Compose를 통해 설치됩니다.

개발자들은 인바운드 포트를 노출하지 않고도 로컬 또는 원격으로 지속적인 멀티 테넌트 코딩 및 비즈니스 에이전트를 배포하고 관리할 수 있습니다.

SOURCES

9. Apple, 사진 인증을 위한 참조 이미지(Reference Image) API 도입

Apple은 iPhone 18 Pro 라인업과 함께 제공되는 Apple Reference Image라는 하드웨어 기반 사진 인증 도구를 발표했습니다. 참조 모드로 설정하면 새로운 카메라 센서가 캡처된 모든 픽셀에 서명하며, Apple의 Private Cloud Compute가 이를 처리하여 변경 불가능한 참조 이미지를 생성합니다. 개발자들이 이 검증 기능을 통합할 수 있도록 Apple은 iOS, iPadOS 및 macOS 전반에 걸쳐 Reference Image API를 출시하여, 타사 애플리케이션이 서명된 사진을 검사하고 편집된 버전과 비교하여 AI 조작을 감지할 수 있도록 합니다.

  • • Apple의 Reference Image 기능은 새로운 카메라 센서를 사용하여 참조 모드에서 캡처된 모든 픽셀에 서명합니다.
  • • Apple의 Private Cloud Compute는 서명된 센서 데이터를 처리하여 사진 앱에서 볼 수 있는 변경 불가능한 참조 이미지를 생성합니다.
  • • Reference Image API를 통해 개발자들은 iOS, iPadOS 및 macOS 전반의 타사 앱에서 서명된 사진을 검사할 수 있습니다.
  • • 이 기능은 하드웨어에 직접 내장되어 있어 SynthID, C2PA, Meta의 Content Seal과 같은 표준과 차별화됩니다.
  • • 이 기능은 이번 달 말 iPhone 18 Pro 라인업과 함께 출시될 예정이며, EU 사용자는 iOS 27에서 개발 및 보기 지원을 받게 됩니다.

개발자들은 새로운 Reference Image API를 사용하여 iOS, iPadOS 및 macOS 앱에서 서명된 변경 불가능한 사진을 프로그래밍 방식으로 검사하여 AI 편집 여부를 감지할 수 있습니다.

SOURCES

10. 새로운 Megakernel 서빙 엔진, North Mini Code 가속화

6월 North Mini Code 모델 출시에 이어, 배포를 최적화하기 위한 새로운 서빙 엔진이 개발되었습니다. 디코드 메가커널(decode megakernel)을 활용하여 이 엔진은 모든 배치 크기에서 vLLM보다 1.58배 빠른 성능을 달성합니다. 연속 배치 처리, 페이징된 어텐션, 최대 256K의 컨텍스트 길이를 지원하며 도구 호출을 지원하는 OpenAI 호환 엔드포인트를 제공합니다.

  • • 새로운 엔진은 6월에 출시된 30B MoE 모델인 North Mini Code에 특별히 최적화되었습니다.
  • • 성능은 다양한 배치 크기에서 vLLM보다 1.58배 빠릅니다.
  • • 배치 크기 1에서 초당 292 토큰을 달성합니다.
  • • 연속 배치 처리, 페이징된 어텐션, 256K 컨텍스트 길이를 지원합니다.
  • • 도구 호출을 지원하는 OpenAI 호환 엔드포인트를 포함합니다.

개발자들은 이제 표준 vLLM 구현 대비 지연 시간을 크게 줄이고 처리량을 향상시켜 North Mini Code 모델을 배포할 수 있습니다.

SOURCES

11. Artificial Analysis, 노력 수준별 모델 릴리스 페이지 출시

Artificial Analysis는 개발자들이 프론티어 모델의 복잡한 성능 및 비용 프로필을 탐색할 수 있도록 돕는 모델 릴리스 페이지를 출시했습니다. GPT-6 Astra 및 Claude Fable 5.1과 같은 모델들이 이제 최대 6개의 서로 다른 노력 수준을 제공함에 따라, 이 페이지들은 작업당 비용, 출력 속도, 지연 시간 및 도메인별 Capability Index 점수를 나란히 비교하여 제공합니다. 이 도구를 통해 개발자들은 특정 애플리케이션 워크로드에 대한 노력 수준을 구성할 때 데이터 기반의 결정을 내릴 수 있습니다.

  • • Artificial Analysis는 다양한 모델 노력 수준에 걸쳐 지능, 비용 및 속도를 비교하는 모델 릴리스 페이지를 출시했습니다.
  • • 프론티어 모델은 이제 성능과 비용 프로필을 크게 변경하는 최대 6개의 서로 다른 노력 수준을 제공합니다.
  • • 이 페이지들은 작업당 비용, 출력 속도 및 지연 시간을 포함한 노력 수준의 나란한 비교를 제공합니다.
  • • 엔지니어링, 금융, 법률 및 의료를 포함한 도메인에 대한 Capability Index 점수가 제공됩니다.
  • • GPT-6 Astra는 Intelligence Index에서 46~53점, Claude Fable 5.1은 47~53점 범위입니다.

개발자들은 GPT-6 Astra 및 Claude Fable 5.1과 같은 모델에 대해 비용, 지연 시간 및 정확성 간의 균형을 평가하고 최적화할 수 있습니다.

SOURCES

12. 소비자용 GPU에서 DeepSeek-V4-Flash-Vision-Exp 로컬 실행

새로운 오픈소스 프로젝트를 통해 10~12개의 RTX 3090 GPU를 사용하는 소비자용 하드웨어에서 285B DeepSeek-V4-Flash-Vision-Exp MoE 모델을 로컬로 실행할 수 있게 되었습니다. FP4 전문가와 FP8 어텐션을 활용하여, 이 설정은 추측 디코딩을 통해 12개의 GPU에서 초당 120 토큰 이상의 디코딩 속도를 달성합니다. 이 프로젝트는 메모리 및 스케줄링 문제를 해결하는 런타임 패치와 함께 사전 빌드된 Docker 이미지를 제공하며, GPU 메모리 내에서 최대 100만 토큰의 컨텍스트 윈도우를 지원합니다.

  • • DeepSeek-V4-Flash-Vision-Exp는 157GB의 가중치를 가진 FP4 전문가와 FP8 어텐션을 사용하는 285B MoE 모델입니다.
  • • 이 모델은 SM86 호환 vLLM 빌드를 사용하여 10~12개의 RTX 3090 GPU를 갖춘 소비자용 하드웨어에서 실행될 수 있습니다.
  • • 성능은 추측 디코딩을 사용하여 10개 GPU에서 초당 60 토큰 이상, 12개 GPU에서 초당 120 토큰 이상에 도달합니다.
  • • 이 시스템은 오프로드 없이 100만 토큰 컨텍스트 윈도우를 지원하며, RAM 오프로드 시 최대 400만 토큰까지 지원합니다.
  • • 이 프로젝트는 GitHub에서 사전 빌드된 Docker 이미지, 빌드 가이드, 시작 스크립트 및 런타임 패치를 제공합니다.

개발자들은 10~12개의 소비자용 GPU에서 거대한 285B 비전 지원 MoE 모델을 셀프 호스팅하여 초당 최대 120 토큰의 디코딩 속도를 달성할 수 있습니다.

SOURCES

13. Qwen3.8-Flash-Next, 1M 컨텍스트와 함께 MLX-serve에서 출시

MLX-serve의 Qwen3.8-Flash-Next 엔진 지원 공동 개발자가 해당 엔진의 출시를 발표하여 Apple Silicon에 100만 토큰 컨텍스트 기능을 제공하게 되었습니다. M5 Max 128GB 시스템에서 테스트된 이 엔진은 8비트 KV 캐시, 8비트 밀집 레이어 양자화, 4비트 전문가 레이어 양자화를 활용하여 높은 출력 품질을 유지합니다. 전체 100만 컨텍스트를 실행하려면 GPU 유선 제한을 120,000MB로 설정해야 하며, 코딩 시 초당 최대 75 토큰의 생성 속도를 제공합니다.

  • • MLX-serve의 Qwen3.8-Flash-Next 엔진 지원은 최대 100만 토큰의 컨텍스트 길이를 지원합니다.
  • • 이 엔진은 8비트 KV 캐시를 활용하며 M5 Max 128GB 시스템에서 약 117GB의 최대 메모리가 필요합니다.
  • • 모델은 품질을 보존하기 위해 밀집 레이어에는 8비트 양자화를, 전문가 레이어에는 4비트 양자화를 사용합니다.
  • • 생성 속도는 100만 컨텍스트에서 산문은 초당 40 토큰, 코딩은 초당 75 토큰에 도달합니다.
  • • 소스 코드와 모델 가중치는 MLX Serve Monitor 플러그인을 포함하여 GitHub 및 Hugging Face에서 사용할 수 있습니다.

개발자들은 Apple Silicon Mac에서 100만 토큰 컨텍스트 윈도우로 로컬 추론을 실행하여 코딩 작업 시 초당 최대 75 토큰을 달성할 수 있습니다.

SOURCES

14. Mentria.ai, 브라우저에서 1비트 27B 모델 추론 구현

Mentria.ai는 대규모 모델을 클라이언트 측에서 완전히 실행하는 WebGPU 및 WGSL 기반의 브라우저 추론 엔진을 도입했습니다. 1비트 행렬-벡터 커널을 최적화하여 스크래치 메모리 뱅크 충돌을 제거함으로써, 이 엔진은 RTX 3060 노트북 GPU에서 Prism ML의 1비트 Bonsai-27B 모델을 초당 25~30 토큰으로 실행할 수 있습니다. 이 플랫폼은 설치나 서버 측 처리가 필요 없으며, 핫스왑 가능한 LoRA 어댑터, 비전 타워 및 더 작은 Qwen3.5 모델을 지원합니다.

  • • Mentria.ai는 WebGPU와 WGSL을 사용하여 구축된 브라우저 기반 추론 엔진입니다.
  • • 이 엔진은 RTX 3060 노트북에서 1비트 Bonsai-27B 모델(3.8GB GPU 메모리 필요)을 초당 25~30 토큰으로 실행합니다.
  • • 성능 향상은 스크래치 메모리의 뱅크 충돌을 해결하기 위해 1비트 행렬-벡터 커널을 최적화하여 달성되었습니다.
  • • 이 엔진은 설치나 서버 측 처리 없이 브라우저 내에서 완전히 작동합니다.
  • • 이 플랫폼은 핫스왑 가능한 LoRA 어댑터, 이미지 입력을 위한 비전 타워 및 더 작은 Qwen3.5 모델을 지원합니다.

개발자들은 서버 측 비용이나 설치 없이 대규모의 고도로 양자화된 모델을 클라이언트 브라우저에 직접 배포할 수 있습니다.

SOURCES

15. Cosmos3 (64B) INT4 양자화, CUDA 및 MLX용으로 구현

640억 개의 파라미터를 가진 Cosmos3 모델의 오픈소스 구현은 로컬 하드웨어에 INT4 텍스트-이미지 및 이미지-비디오 기능을 제공합니다. CUDA 및 Apple Silicon MLX 런타임 모두와 호환되는 이 프로젝트는 Hugging Face에 양자화된 가중치를, GitHub에 코드를 호스팅합니다. M4 Max 128GB Mac에서 단일 비디오 클립을 생성하는 데 약 5분이 소요됩니다.

  • • 64B Cosmos3 모델이 INT4 텍스트-이미지 및 이미지-비디오 작업을 위해 구현되었습니다.
  • • 코드는 GitHub에서 사용할 수 있으며 모델 가중치는 Hugging Face에 호스팅되어 있습니다.
  • • M4 Max 128GB Mac에서 단일 비디오 클립을 생성하는 데 약 5분이 소요됩니다.
  • • 이 구현은 CUDA 및 Apple Silicon MLX 런타임을 모두 지원합니다.

개발자들은 최적화된 INT4 가중치를 사용하여 Apple Silicon 및 Nvidia 하드웨어에서 고충실도 로컬 이미지 및 비디오 생성 작업을 실행할 수 있습니다.

SOURCES

16. Foundation-1 오디오 모델, 음색 고정 키베드(Timbre-Locked Keybeds) 구현

한 독립 연구자가 무한한 원샷을 생성하고 텍스트 프롬프트를 재생 가능한 신디사이저로 변환하도록 설계된 맞춤형 오디오 모델 Foundation-1을 출시했습니다. 악기에서 음색 제어를 분리함으로써, 이 모델은 여러 확산 호출(diffusion calls) 전반에 걸쳐 일관성을 유지하는 음색 고정 키베드를 달성합니다. 모델 가중치는 Hugging Face에 호스팅되어 있으며, 전체 추론 파이프라인과 도구는 RC-stable-audio-tools 저장소 하에 GitHub에서 오픈소스화되었습니다.

  • • Foundation-1은 음색을 악기와 별도의 요소로 제어하는 맞춤형 AI 모델입니다.
  • • 이 모델은 여러 확산 호출 전반에 걸쳐 일관성을 유지하는 음색 고정 키베드를 달성합니다.
  • • 모델은 Hugging Face에서 사용할 수 있으며 추론 파이프라인은 RC-stable-audio-tools 하에 GitHub에서 오픈소스화되었습니다.
  • • 이 시스템은 음악 제작을 위한 무한한 원샷을 생성하고 텍스트 프롬프트를 완전히 재생 가능한 신디사이저로 변환할 수 있습니다.

음악 제작 도구를 구축하는 개발자들은 오픈 가중치 모델을 활용하여 텍스트 프롬프트에서 일관되고 재생 가능한 신디사이저를 생성할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.