Inference Brew

UkisAI, Qwen 3.8 27B 모델 최적화로 과도한 사고(Overthinking) 58% 감소

00:00 / --:--

← 메인으로

UkisAI, Qwen 3.8 27B 모델 최적화로 과도한 사고(Overthinking) 58% 감소

1. UkisAI, Qwen 3.8 27B 모델 최적화로 과도한 사고(Overthinking) 58% 감소

UkisAI는 추론 모델의 효율성 병목 현상을 해결하기 위해 Qwen 3.8 27B 모델의 최적화 버전을 출시했습니다. On-Policy Distillation을 통해 과도한 사고와 관련된 토큰을 식별하고 페널티를 부여하는 방식으로 사후 학습을 진행하여, 사고 토큰을 58.3% 줄이고 속도를 1.95배 높였습니다. 이번 최적화는 모델의 높은 정확도를 유지하면서도 추론 지연 시간과 컴퓨팅 비용을 크게 낮췄습니다.

  • • UkisAI는 Qwen 3.8 27B 모델을 사후 학습시켜 과도한 사고와 관련된 토큰에 페널티를 부여했습니다.
  • • 팀은 On-Policy Distillation을 사용하여 모델 정확도를 유지하면서 사고 토큰을 줄였습니다.
  • • 최적화된 모델은 사고 토큰 58.3% 감소와 1.95배의 속도 향상을 달성했습니다.
  • • 현재 사고 토큰을 30% 줄인 Swift 3.8 Flash Next를 개발 중입니다.

로컬 추론 모델을 운영하는 개발자들은 정확도 저하 없이 훨씬 빠르고 비용 효율적인 Qwen 3.8 27B 버전을 배포할 수 있게 되었습니다.

SOURCES

2. Nari Labs, 최적화된 Qwen3-TTS 추론 엔진 오픈소스 공개

Nari Labs는 이전에 최적화된 구현으로 소개되었던 Qwen3-TTS의 고성능 추론 엔진을 오픈소스로 공개했습니다. 이 엔진은 초당 10회 요청 시 50ms 미만의 지연 시간을 유지하며, Coval 음성 AI 벤치마크에서 정확도 1위, 지연 시간 2위를 기록했습니다. 또한 이번 릴리스에 포함된 Qwen3-ASR 엔드포인트는 동일한 평가에서 알리바바의 공식 엔드포인트를 능가하며 최저 지연 시간과 정확도 2위를 달성했습니다.

  • • Nari Labs는 이전에 최적화된 구현으로 보고된 Qwen3-TTS 추론 엔진을 오픈소스로 공개했습니다.
  • • 이 엔진은 초당 10회 요청 시 50ms 미만의 지연 시간을 유지합니다.
  • • Coval 음성 AI 벤치마크에서 정확도 1위, 지연 시간 2위를 기록했습니다.
  • • 오픈소스 릴리스에는 Coval 벤치마크에서 최저 지연 시간과 정확도 2위를 기록한 Qwen3-ASR 엔드포인트가 포함되어 있습니다.
  • • 이 스택은 알리바바의 공식 엔드포인트보다 더 정확하고 지연 시간이 짧은 대안으로 자리매김했습니다.

개발자들은 이제 공식 엔드포인트에 대한 검증된 고성능 및 비용 효율적 대안인, 이전에 독점적으로 최적화되었던 Qwen3-TTS 스택에 접근하고 배포할 수 있습니다.

SOURCES

3. K2 Horizon 모델 평가: 성능 벤치마크 및 메모리 요구 사항

9월 3일 K2 Horizon 모델 제품군이 처음 출시된 후, Artificial Analysis는 해당 라인업에 대한 성능 평가를 발표했습니다. 3.7B 및 7B 모델은 해당 크기에서 최첨단 성능을 보여주었으며, 36B A4B 모델은 저대역폭 하드웨어에서의 효율성으로 주목받았습니다. 그러나 평가 결과, 모델의 KV 캐시 설계로 인해 상당한 RAM 요구 사항이 확인되었습니다. 예를 들어, 7B 모델은 128k 컨텍스트의 Q4_K_M 양자화 환경에서 가중치 5.2 GiB와 컨텍스트 5 GiB가 필요합니다.

  • • Artificial Analysis는 K2 Horizon 제품군을 벤치마크하여 3.7B 및 7B 모델의 최첨단 성능을 확인했습니다.
  • • 36B A4B 모델은 메모리 대역폭이 제한된 하드웨어에 최적인 것으로 확인되었습니다.
  • • 평가 결과 높은 RAM 오버헤드가 강조되었으며, 7B 모델은 128k 컨텍스트의 Q4_K_M 환경에서 총 10.2 GiB(가중치+컨텍스트)가 필요합니다.
  • • 0.9B 및 375B 모델은 이번 평가에서 낮은 성능 등급을 받았습니다.

개발자들은 이제 K2 Horizon 모델의 배포 결정을 내리는 데 필요한 실증적인 성능 데이터와 구체적인 메모리 사용 프로필을 확보하게 되었습니다.

4. 최적화를 통해 로컬 Qwen3.8-Flash-Next 성능을 12GB VRAM에서 20 TPS로 향상

개발자들은 125B-A6B Qwen3.8-Flash-Next Mixture of Experts(MoE) 모델을 소비자용 하드웨어에서 효율적으로 실행하여, RTX 4070 12GB GPU에서 초당 6토큰이었던 성능을 약 20토큰으로 최적화했습니다. 64GB 시스템 RAM과 Gen4 NVMe 스토리지를 활용하는 이 설정은 AtomicChat의 4.27 bpw 양자화, Ngram SSD 오프로딩(lazy-mode), 그리고 `--fit-target 512` 매개변수를 통해 이러한 속도를 달성했습니다. 1.78GB 공유 컴팩트 헤드를 사용하는 MTP 변형 모델은 초당 20.65토큰의 성능을 기록했습니다.

  • • Qwen3.8-Flash-Next는 51B n-gram 테이블을 포함하는 125B-A6B MoE 모델입니다.
  • • RTX 4070 12GB GPU(64GB RAM 및 Gen4 NVMe 포함)에서의 추론 성능이 초당 6토큰에서 약 20토큰으로 최적화되었습니다.
  • • 주요 최적화 기술로는 AtomicChat의 4.27 bpw 양자화, Ngram SSD 오프로딩(lazy-mode), `--fit-target 512` 매개변수가 있습니다.
  • • 1.78GB 공유 Q4_K_M 컴팩트 헤드를 사용한 MTP 변형 모델은 초당 20.65토큰을 달성했습니다.
  • • 프롬프트 처리 속도는 초당 300~350토큰으로 측정되었습니다.

개발자들은 특정 양자화 및 SSD 오프로딩 기술을 활용하여 RTX 4070과 같은 소비자용 하드웨어에서 거대한 125B MoE 모델을 실행할 수 있습니다.

SOURCES

5. Cursor, 대규모 코드베이스 관리를 위한 'Projects' 출시

Cursor는 개발자가 수개월 동안 컨텍스트를 유지함으로써 대규모 코드베이스를 관리할 수 있도록 돕는 새로운 기능인 'Cursor Projects'를 도입했습니다. 이 도구를 통해 개발자는 더 높은 수준의 추상화 단계에서 작업하며, 수천 개의 에이전트에 복잡한 작업을 위임하고 수동 프롬프트 없이 반복적인 작업을 자동화할 수 있습니다. Cursor에 따르면, Projects를 조기에 도입한 신규 사용자의 병합된 풀 리퀘스트(PR)가 30% 증가했습니다.

  • • Cursor는 수개월 동안 컨텍스트를 유지하여 더 큰 규모의 작업을 관리하도록 설계된 'Projects'를 출시했습니다.
  • • 이 도구를 통해 개발자는 수천 개의 에이전트에 작업을 위임하고 더 높은 수준의 추상화에서 작업을 지시할 수 있습니다.
  • • 수동 프롬프트 없이 반복적인 작업을 자동으로 수행합니다.
  • • Cursor는 이 도구를 사용하는 신규 사용자가 30% 더 많은 풀 리퀘스트를 병합한다고 보고했습니다.

개발자들은 더 높은 수준의 추상화에서 더 큰 규모의 작업을 관리할 수 있으며, Cursor는 신규 사용자의 병합된 풀 리퀘스트가 30% 증가했다고 보고했습니다.

SOURCES

6. Guru, 에이전트 토큰 사용량을 줄이기 위한 MCP 서비스 출시

Guru는 Model Context Protocol(MCP)을 통해 AI 에이전트가 지식 베이스에 접근하는 방식을 최적화하기 위해 설계된 새로운 서비스를 출시했습니다. 지식을 한 번 큐레이션하고 검증한 후 제공함으로써, 이 서비스는 에이전트가 원시 데이터 소스에 직접 연결하는 것보다 토큰 사용량을 약 4배 줄여줍니다. 이러한 접근 방식은 여러 에이전트가 원시 비정형 데이터로부터 독립적으로 답변을 재구성할 때 발생하는 중복 비용과 지연 시간을 방지합니다.

  • • Guru는 Model Context Protocol(MCP)을 통해 AI 에이전트에 지식을 제공하기 전에 한 번 큐레이션하고 검증합니다.
  • • 이 방법은 에이전트가 원시 소스에 직접 연결하는 것보다 토큰 사용량을 약 4배 줄여줍니다.
  • • 여러 에이전트가 원시 데이터로부터 동일한 답변을 독립적으로 재구성할 때 발생하는 중복 비용을 방지합니다.

MCP를 사용하여 개발하는 개발자들은 여러 에이전트가 원시 소스를 독립적으로 쿼리하게 하는 대신 사전 검증된 지식을 제공함으로써 중복 비용과 컨텍스트 비대화를 방지할 수 있습니다.

SOURCES

7. NVIDIA, 물리 AI 워크플로우 오케스트레이션을 위한 OSMO 오픈소스 공개

NVIDIA는 학습, 시뮬레이션 및 엣지 배포 전반에 걸쳐 물리 AI 파이프라인을 관리하도록 설계된 Kubernetes 네이티브 워크플로우 오케스트레이터인 OSMO를 오픈소스로 공개했습니다. Apache-2.0 라이선스를 따르는 OSMO를 통해 개발자는 단일 YAML 파일로 전체 멀티 GPU 워크플로우를 정의하고, NVLink 토폴로지 인식 배치를 지원하는 NVIDIA KAI 스케줄러를 사용하여 Kubernetes 클러스터로 작업을 라우팅할 수 있습니다. 이 플랫폼은 원격 VS Code 및 Jupyter 세션과 같은 대화형 개발 기능을 제공하며, Claude Code 및 Cursor와 같은 코딩 에이전트와 통합되고, 스토리지 요구 사항을 줄이는 콘텐츠 주소 지정 데이터셋 시스템을 포함합니다.

  • • NVIDIA는 Apache-2.0 라이선스의 Kubernetes 네이티브 워크플로우 오케스트레이터인 OSMO를 오픈소스로 공개했습니다.
  • • OSMO를 통해 개발자는 전체 물리 AI 파이프라인(학습, 시뮬레이션, 테스트)을 단일 YAML 파일로 정의할 수 있습니다.
  • • 이 플랫폼은 NGC를 통해 Helm 차트와 컨테이너를 제공하며, NVIDIA KAI 스케줄러를 사용하고 NVLink 토폴로지 인식 배치를 지원합니다.
  • • 버전 6.3.1에는 TLS 종료, 클라우드 워크로드 ID 지원, 대화형 개발 세션(원격 VS Code/Jupyter)이 포함되어 있습니다.
  • • Claude Code 및 Cursor와 같은 코딩 에이전트와 통합되며, 스토리지를 10배에서 100배까지 줄여준다고 주장하는 콘텐츠 주소 지정 데이터셋 시스템을 갖추고 있습니다.

물리 AI나 로봇 공학 애플리케이션을 구축하는 개발자들은 Claude Code 및 Cursor와 같은 코딩 에이전트를 기본 지원하는 단일 YAML 파일로 전체 멀티 GPU 파이프라인을 정의할 수 있습니다.

SOURCES

8. dbt Labs, AI 감사 가능한 대시보드를 위한 dbt Charts 오픈소스 공개

dbt Labs는 구조화된 YAML 및 SQL 언어를 사용하여 대화형 대시보드를 정의하는 Apache 2.0 라이선스의 1.0 이전 버전 도구인 dbt Charts를 오픈소스로 공개했습니다. 대시보드 생성을 UI 기반 BI 도구에서 코드로 옮김으로써, dbt Charts는 AI 에이전트가 시각화를 생성, 수정 및 감사하기 훨씬 쉽게 만듭니다. 이 도구는 16가지 차트 유형, Markdown, Jinja를 지원하며, 대시보드를 SVG, HTML, PDF 등의 형식으로 렌더링하는 CLI를 포함하여 통합 버전 관리를 위해 Git 리포지토리와 직접 통합됩니다.

  • • dbt Labs는 Apache 2.0 라이선스 하에 1.0 이전 단계인 dbt Charts를 오픈소스로 공개했습니다.
  • • 이 도구는 데이터 선택을 위해 SQL을, 시각화 정의를 위해 YAML을 사용하며 16가지 차트 유형, Markdown, Jinja를 지원합니다.
  • • 차트 생성을 UI 기반 BI 도구에서 코드로 옮겨 AI 에이전트가 생성하고 감사하기 쉽게 설계되었습니다.
  • • dbt Charts CLI를 사용하면 사용자가 대시보드를 SVG, HTML, PNG, PDF 및 터미널 출력 등의 형식으로 렌더링할 수 있습니다.
  • • dbt Labs는 호스팅, 액세스 제어 및 대화형 분석을 위해 dbtCharts.com을 퍼블릭 베타로 출시했습니다.

개발자들은 시각화를 구조화된 YAML 및 SQL로 선언함으로써 AI 에이전트를 사용하여 대화형 대시보드를 쉽게 생성, 버전 관리 및 감사할 수 있습니다.

SOURCES

9. 에이전트 검증을 위한 읽기 전용 IDE, px0 출시

px0이라는 새로운 도구가 출시되었으며, 이는 AI 워크플로우를 위해 특별히 설계된 읽기 전용 통합 개발 환경을 제공합니다. 웹 브라우저 내에서 직접 작동하는 px0은 즉각적인 검증 콘솔 역할을 하여, 개발자가 자율 AI 에이전트가 생성한 코드나 콘텐츠를 통합하기 전에 검사하고 유효성을 검사할 수 있도록 합니다.

  • • px0이 읽기 전용 통합 개발 환경(IDE)으로 출시되었습니다.
  • • 이 도구는 AI 에이전트가 생성한 콘텐츠를 위한 즉각적인 검증 콘솔 기능을 합니다.
  • • 웹 브라우저 내에서 직접 실행됩니다.

개발자들은 안전한 읽기 전용 브라우저 콘솔에서 AI 에이전트가 생성한 코드나 콘텐츠를 빠르게 검사하고 검증할 수 있습니다.

SOURCES

10. Lambda 프레임워크, Blackwell에서 모델 FLOPS 활용률 60% 돌파

Lambda 엔지니어들은 NVIDIA Blackwell GPU에서 Llama 3.1 모델을 실행할 때 모델 FLOPS 활용률(MFU)을 60% 이상으로 높이는 재현 가능한 프레임워크를 출시했습니다. 8B에서 405B 매개변수에 이르는 모델을 벤치마킹하여 효율성 저하를 유발하는 주요 병목 현상을 식별했습니다. 그 결과로 나온 프레임워크는 기본 모델 아키텍처를 수정할 필요 없이 표준 산업 벤치마크 대비 25% 이상의 개선을 제공합니다.

  • • Lambda 엔지니어들은 NVIDIA Blackwell GPU에서 Llama 3.1 모델(8B~405B 매개변수)을 벤치마킹했습니다.
  • • 팀은 효율성 저하의 근본 원인을 파악하고 이를 해결하기 위한 재현 가능한 프레임워크를 개발했습니다.
  • • 이 프레임워크는 모델 FLOPS 활용률(MFU)을 60% 이상으로 높여 산업 벤치마크 대비 25% 이상의 개선을 나타냅니다.
  • • 이러한 효율성 향상은 기본 모델 아키텍처를 수정하지 않고도 달성됩니다.

Llama 3.1 모델을 학습하거나 파인튜닝하는 개발자들은 25% 이상의 효율성 개선을 달성하여 컴퓨팅 비용과 학습 시간을 줄일 수 있습니다.

SOURCES

11. 대규모 프리프롬프트를 로컬 Ollama로 마이그레이션할 때의 주의사항 공유

한 개발자의 상세 마이그레이션 보고서는 복잡한 에이전트를 프론티어 API에서 Ollama를 사용하는 로컬 27B 매개변수 모델로 옮길 때의 주요 과제를 강조합니다. 마이그레이션 결과, 프론티어 모델에 최적화된 35kb 프리프롬프트가 더 작은 컨텍스트 윈도우를 가진 로컬 모델에서 과부하를 일으키고 실패하게 만든다는 사실이 밝혀졌습니다. 작성자는 동일한 연속 도구 호출 및 반복적인 파일 읽기와 같은 컨텍스트 고갈에 대한 구체적인 실패 신호를 식별했으며, 단일 목적 프롬프팅, 선언적 에이전트 정의, 세션 상태를 디스크에 로깅하는 등의 완화 전략을 권장했습니다.

  • • 한 개발자가 128GB RAM 시스템에서 Ollama를 사용하여 에이전트를 프론티어 API에서 로컬 27B 매개변수 모델로 옮기는 실험을 했습니다.
  • • 프론티어 모델용으로 설계된 대규모 프리프롬프트(35kb)는 더 작은 컨텍스트 윈도우로 인해 로컬 모델에서 과부하와 실패를 유발했습니다.
  • • 컨텍스트 고갈에 대한 구체적인 실패 신호로는 동일한 연속 도구 호출과 반복적인 파일 읽기가 포함되었습니다.
  • • 권장되는 완화 전략으로는 단일 목적 프롬프팅, 선언적 에이전트 정의, 세션 상태를 디스크에 로깅하는 것이 있습니다.
  • • 이번 마이그레이션은 프론티어 제공업체가 세션 데이터를 학습에 사용하고 안전 필터가 보안 연구를 차단하는 것에 대한 우려 때문에 동기가 부여되었습니다.

에이전트를 프론티어 API에서 로컬 모델로 마이그레이션하는 개발자들은 단일 목적 프롬프팅과 선언적 에이전트 정의를 채택함으로써 컨텍스트 고갈 실패를 방지할 수 있습니다.

SOURCES

12. 자동화된 코드 리뷰를 위한 GPT-5.6 Luna와 GPT-6 Astra 벤치마크 비교

50개의 공개 풀 리퀘스트를 평가한 새로운 벤치마크는 자동화된 코드 리뷰를 위해 저비용 GPT-5.6 Luna(입력 100만 토큰당 $0.20, 출력 $1.20)와 프론티어 GPT-6 Astra(입력 100만 토큰당 $10, 출력 $50) 간의 비용 및 정확도 트레이드오프를 강조합니다. Luna는 훨씬 저렴한 비용(리뷰당 $0.0041)으로 69개의 검증된 버그를 식별했지만, 24개의 검증되지 않은 결과를 포함하여 높은 노이즈 수준을 보였습니다. 반면, Astra는 4개의 오탐지만으로 92개의 검증된 버그를 잡아냈으며, 보안에 민감한 코드에서 Luna보다 월등히 뛰어난 성능을 보여 Luna가 9개를 찾은 것에 비해 24개 중 19개의 검증된 보안 버그를 식별했습니다.

  • • 벤치마크는 50개의 공개 풀 리퀘스트에 걸쳐 GPT-5.6 Luna(100만 토큰당 $0.20/$1.20)와 GPT-6 Astra(100만 토큰당 $10/$50)를 비교했습니다.
  • • GPT-5.6 Luna는 리뷰당 $0.0041의 비용으로 69개의 검증된 버그를 식별했지만, 더 높은 노이즈 수준(93개 결과 중 24개 검증 실패)을 보였습니다.
  • • GPT-6 Astra는 리뷰당 $0.113의 비용으로 92개의 검증된 버그를 식별했으며, 96개 결과 중 4개만 검증에 실패했습니다.
  • • 보안에 민감한 버그의 경우, Astra는 24개 중 19개를 찾았지만 Luna는 9개만 찾았습니다.
  • • 모든 풀 리퀘스트에 두 모델을 모두 실행하면 총 $5.86의 비용으로 143개의 검증된 버그 중 117개를 포착할 수 있었습니다.

개발자들은 Luna의 저비용(출력 100만 토큰당 $1.20)과 Astra의 우수한 정확도 및 낮은 노이즈 간의 트레이드오프를 이해함으로써 자동화된 코드 리뷰 파이프라인을 최적화할 수 있습니다.

SOURCES

13. Nvidia, 84GB GDDR7 메모리를 탑재한 RTX 5500 Pro Blackwell GPU 공개

Nvidia는 전문 AI 워크로드 및 로컬 모델 실행을 위해 맞춤화된 GPU인 RTX 5500 Pro Blackwell 워크스테이션 에디션을 도입했습니다. GeForce RTX 5090과 동일한 GB202 실리콘 다이를 기반으로 하는 이 워크스테이션 카드는 21,760개의 CUDA 코어와 5090 용량의 2.6배인 84GB GDDR7 메모리를 특징으로 합니다. 메모리는 448비트 인터페이스에서 최대 1,400 GB/s의 대역폭을 제공하지만, Nvidia는 GDDR7 칩을 25 Gb/s로 다운클럭했습니다.

  • • Nvidia는 GB202 실리콘 다이를 사용하는 RTX 5500 Pro Blackwell 워크스테이션 에디션을 출시했습니다.
  • • 이 카드는 GeForce RTX 5090 용량의 2.6배인 84GB GDDR7 메모리를 특징으로 합니다.
  • • 170개의 활성화된 스트리밍 멀티프로세서에 걸쳐 21,760개의 CUDA 코어가 탑재되어 있습니다.
  • • 메모리 서브시스템은 448비트 인터페이스에서 작동하며 최대 1,400 GB/s의 대역폭을 제공합니다.
  • • 이 GPU는 72GB RTX Pro 5000과 96GB RTX Pro 6000 사이에 위치하며, 공식 가격은 아직 발표되지 않았습니다.

로컬 LLM을 실행하거나 파인튜닝 작업을 수행하는 개발자들은 소비자용 RTX 5090보다 2.6배 많은 VRAM을 갖춘 고용량 워크스테이션 GPU 옵션을 얻게 되었습니다.

14. 프론티어 제공업체, 고급 모델 접근을 위한 신원 확인 구현

Mythos, Flash Cyber, Astra와 같은 플래그십 모델의 이전 릴리스를 기반으로, Anthropic, Google, OpenAI는 이제 이중 계층 접근 전략을 구현했습니다. 이러한 모델에 대한 고급 경로를 찾는 개발자는 이제 정부 또는 조직 ID 제출이나 신뢰할 수 있는 방어자(trusted-defender) 상태 획득과 같은 신원 확인을 완료해야 합니다. 이는 이전에 개발자에게 제공되었던 모델에 새로운 수준의 액세스 제어를 추가하는 것입니다.

  • • Anthropic, Google, OpenAI는 자사 플래그십 모델에 대해 신원 인증 계층을 도입했습니다.
  • • Mythos, Flash Cyber, Astra와 같은 모델의 고급 경로에 접근하려면 이제 정부 또는 조직 ID 확인이 필요합니다.
  • • 이번 업데이트는 이전에 출시된 모델 시리즈에 새로운 심사 요구 사항을 추가합니다.
  • • 표준 계층에 대한 공개 가격은 변경되지 않았습니다.

이번 변경으로 고급 모델에 대한 접근 경로가 공식화되었으며, 개발자가 고급 기능을 활용하려면 심사를 거쳐야 하지만 표준 계층에 대한 기존 공개 가격은 유지됩니다.

SOURCES

15. Bolt Forge, GLM, DeepSeek 및 Kimi 모델에 대한 무료 액세스 출시

Bolt Forge라는 새로운 서비스가 출시되어 개발자들에게 10월 14일까지 사용료 없이 GLM, DeepSeek 및 Kimi 모델에 대한 무료 액세스를 제공합니다. 이 서비스는 표준 계층보다 최대 50배 더 많은 사용 용량을 제공하며 Bolt 웹사이트의 모델 선택기에서 직접 액세스할 수 있어, 개발자가 무료로 대용량 테스트 및 개발 워크로드를 실행할 수 있습니다.

  • • Bolt Forge는 사용자에게 최대 50배 더 많은 사용량을 제공하는 새로운 서비스입니다.
  • • 이 서비스에는 GLM, DeepSeek 및 Kimi 모델에 대한 액세스가 포함됩니다.
  • • 10월 14일까지 사용료 없이 무료로 사용할 수 있습니다.
  • • 이 서비스는 Bolt 웹사이트의 모델 선택기에 직접 통합되어 있습니다.

개발자들은 프로모션 기간 동안 사용료 없이 최대 50배 더 많은 용량으로 인기 있는 오픈 웨이트 모델에서 워크로드를 테스트하고 실행할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.