1. DeepSeek-V4 API, 프로덕션 릴리스로 전환
DeepSeek-V4 시리즈의 초기 오픈 웨이트 공개 및 프리뷰 제공에 이어, 프로덕션 준비가 완료된 버전이 DeepSeek API에 적용되었습니다. 이번 업데이트는 기존에 오픈 웨이트 및 초기 API 액세스를 통해 제공되던 모델의 프리뷰 단계가 종료되었음을 의미합니다.
- • DeepSeek-V4가 공식 API에서 프리뷰에서 프로덕션 준비 상태로 전환되었습니다.
- • 이번 릴리스는 V4 Pro 및 V4 Flash 모델의 초기 오픈 웨이트 공개 이후 진행되었습니다.
- • 프로덕션 버전은 모델의 최적화된 파라미터 풋프린트와 고성능 아키텍처를 그대로 유지합니다.
개발자들은 이제 모델의 검증된 오픈 웨이트 아키텍처를 기반으로, 고성능 통합을 위해 프로덕션 안정성이 확보된 DeepSeek-V4 API를 신뢰하고 사용할 수 있습니다.
2. Alibaba, 호스팅형 텍스트 음성 변환 모델 Qwen-Audio-3.0-TTS 출시
Alibaba Cloud Model Studio를 통해서만 제공되는 Qwen-Audio-3.0-TTS는 12.5Hz 저프레임 속도 음성 토크나이저와 5단계 점진적 학습 패러다임을 활용합니다. 이 아키텍처는 높은 콘텐츠 일관성과 운율의 자연스러움을 보장하여 실시간 음성 에이전트를 위한 강력한 옵션이 됩니다.
- • Qwen-Audio-3.0-TTS는 Flash(실시간 최적화, 약 300ms 지연 시간) 및 Plus(고품질, Artificial Analysis 리더보드 상위권) 티어로 제공됩니다.
- • 서비스 가격은 100만 자당 27.59달러로, ElevenLabs나 MiniMax 비용의 약 3분의 1 수준입니다.
- • 개발자는 자연어 지침이나 웃음, 숨소리 등 비언어적 효과를 위한 86개의 세밀한 인라인 태그를 사용하여 출력을 제어할 수 있습니다.
- • 이 모델은 16개 언어와 20개 중국어 방언을 지원하며, 양방향 WebSocket 스트리밍 프로토콜을 통해 액세스합니다.
- • API는 최대 48kHz 샘플링 속도의 PCM, WAV, MP3 및 Opus 형식을 지원합니다.
개발자들은 주요 경쟁사 대비 약 3분의 1 비용으로 고품질의 저지연 음성 합성 기능을 앱에 통합할 수 있습니다.
3. 개발자, MiniCPM5를 파인튜닝하여 657MB 로컬 사고 모델 생성
개발자 GnLOLot이 만든 이 소형 모델은 MiniCPM5의 도구 호출 형식과 131,072 토큰의 컨텍스트 길이를 유지합니다. 학습에 Claude 생성 출력을 사용했기 때문에 라이선스 상태는 불확실하지만, 매우 제한적인 로컬 하드웨어에서 추론 모델을 실행할 수 있는 실험적인 경로를 제공합니다.
- • MiniCPM5-1B-Claude-Opus-Fable5-Thinking 모델은 로컬에서 실행되며 OpenBMB의 MiniCPM5-1B를 기반으로 합니다.
- • 이 모델은 Claude Fable 5 추론 흔적에 대한 지도 미세 조정(SFT)을 통해 학습되었습니다.
- • Think 및 No Think 모드를 전환할 수 있는 네이티브 사고 템플릿을 지원합니다.
- • 657MB(Q4_K_M)에서 2.1GB(F16) 범위의 GGUF 양자화 버전을 사용할 수 있습니다.
- • 이 모델은 llama.cpp, Ollama, LM Studio, jan 및 KoboldCpp와 호환됩니다.
개발자들은 657MB에 불과한 메모리 점유율로 소비자용 하드웨어에서 로컬로 추론 능력을 갖춘 소형 모델을 실행할 수 있습니다.
4. Ternary-Bonsai-27B, 8GB VRAM에서 Terminal-Bench 2.0 평가 완료
이번 평가는 극단적인 양자화의 실질적인 한계를 보여줍니다. 2비트 모델은 도구 호출 구문 오류를 성공적으로 피하고 노트북 GPU에 탑재되었지만, 전체적인 작업 정확도는 더 작은 9B 밀집 모델보다 낮았으며, 1비트 변형 모델은 에이전트 워크플로우에서 전혀 사용할 수 없는 것으로 판명되었습니다.
- • Ternary-Bonsai-27B(2비트)는 8GB VRAM GPU를 사용하여 89개 작업이 포함된 terminal-bench 2.0 하네스에서 평가되었습니다.
- • 2비트 Bonsai 모델은 GPU에 완전히 탑재되었으며 도구 호출 중 구문 오류가 전혀 발생하지 않았습니다.
- • Ternary-Bonsai-27B는 7.9%의 점수를 기록했으며, 이는 Qwen3.5-9B의 9.2% 및 Qwen3.6-35B-A3B의 24.3%와 비교됩니다.
- • 1비트 Bonsai 모델은 에이전트 하네스에서 작동하지 않았으며, 컨텍스트 창을 소진하는 비종료형 완성을 생성했습니다.
개발자들은 매우 제한적인 소비자용 하드웨어에서도 더 큰 27B 파라미터 모델을 실행할 수 있지만, 벤치마크 정확도가 크게 떨어질 수 있음을 감안해야 합니다.
5. 연구원들, Cursor, Codex 및 Gemini CLI의 샌드박스 우회 성공
이 취약점은 코딩 에이전트가 로컬 파일과 상호 작용하는 방식을 악용하여 기존 경계를 우회할 수 있게 했습니다. 이러한 에이전트는 종종 호스트 시스템과 깊게 통합되어 있기 때문에, 다른 신뢰할 수 있는 도구가 나중에 소비하는 파일을 작성하는 방식이 실행 가능한 탈출 경로임이 입증되었습니다.
- • 보안 연구원들이 널리 사용되는 4개의 AI 코딩 에이전트 샌드박스를 성공적으로 탈출했습니다.
- • 영향을 받는 도구에는 Cursor, OpenAI의 Codex, Gemini CLI 및 Antigravity가 포함됩니다.
- • 탈출은 신뢰할 수 있는 도구가 나중에 실행하거나 사용하는 파일을 작성함으로써 이루어졌습니다.
- • 확인된 대부분의 샌드박스 탈출 및 경계 우회 문제는 패치되었습니다.
AI 코딩 보조 도구를 사용하는 개발자는 샌드박스 탈출을 유발할 수 있는 신뢰할 수 없는 파일 쓰기로부터 로컬 환경을 보호해야 합니다.
6. OpenCode에서 발견된 심각한 보안 및 성능 결함
GitHub에서 엄청난 인기를 얻고 있음에도 불구하고, 상세 분석 결과 OpenCode는 근본적인 아키텍처 결함을 겪고 있는 것으로 나타났습니다. 쉽게 우회되는 명령 제한, 높은 메모리 소비, 과거의 원격 실행 취약점 등이 결합되어 이 도구는 로컬 개발 환경에 상당한 위험 요소가 되고 있습니다.
- • GitHub에서 161,000개의 별을 받은 OpenCode는 사용자 머신에 대한 사소한 악용을 용이하게 한다는 비판을 받고 있습니다.
- • 이전 CVE는 OpenCode가 허용적인 CORS 헤더를 가진 HTTP 서버를 노출하여 원격 코드 실행 위험을 초래하도록 허용했습니다.
- • tree-sitter AST 파싱을 통해 구현된 도구의 bash 명령 제한은 쉽게 우회됩니다.
- • OpenCode는 프롬프트 캐시 미스가 자주 발생하여 토큰 생성 지연이 심각합니다.
- • UI가 손상된 것으로 보고되었으며, 메시지 상자가 최대 1GB의 RAM을 소비합니다.
개발자는 원격 코드 실행 및 리소스 고갈로부터 로컬 머신을 보호하기 위해 OpenCode 사용을 즉시 검토하거나 중단해야 합니다.
7. Unsloth, AMD 하드웨어 공식 지원 추가
AMD와의 협력을 통해 개발된 이번 릴리스는 Unsloth의 고유한 메모리 최적화 기능을 Windows, Linux, WSL 및 macOS 전반의 다양한 AMD 실리콘으로 확장합니다. 또한 GGUF 및 LoRA 어댑터 내보내기 기능과 실시간 RAM 및 VRAM 추적 기능이 포함되어 있습니다.
- • Unsloth는 이제 로컬 추론, 파인튜닝, 강화 학습 및 배포를 위해 AMD 하드웨어를 공식 지원합니다.
- • 지원되는 하드웨어에는 Radeon RX 9000/7000, Instinct MI350/MI300, Strix Halo, Ryzen AI Max 및 AMD CPU가 포함됩니다.
- • Unsloth를 사용하면 VRAM을 최대 70% 적게 사용하여 모델을 학습하고, 강화 학습 시 VRAM을 최대 80%까지 절감할 수 있습니다.
- • 이 플랫폼은 ROCm, Triton, bitsandbytes, PyTorch 및 llama.cpp를 위한 최적화된 빌드를 제공합니다.
- • 지원되는 모델에는 Qwen, Gemma, DeepSeek, GLM, Kimi, MiniMax 및 DiffusionGemma가 포함됩니다.
개발자들은 이제 AMD 하드웨어를 활용하여 대규모 VRAM 절감 효과를 누리며 로컬에서 모델을 파인튜닝하고 실행할 수 있게 되어, Nvidia 독점 구조에서 벗어날 수 있습니다.
8. NInfer 엔진, RTX 5090에서 초당 542 토큰 달성
NInfer는 특정 하드웨어 및 모델 체크포인트에 최적화되어 있으며 텍스트, 이미지 및 비디오 입력을 지원합니다. 현재 연속 배치(continuous batching) 기능이 부족하고 일부 Qwen 모델로 제한되어 있지만, 차세대 소비자용 GPU에서 로컬 추론의 극한 성능 한계를 보여줍니다.
- • NInfer는 단일 RTX 5090을 사용하여 65,536 토큰 완성에서 초당 542 토큰의 지속적인 생성 속도를 달성했습니다.
- • 이 엔진은 처음부터 새로 구축된 오픈 소스 C++/CUDA 추론 엔진이며 Qwen3.6 체크포인트에 특화되어 있습니다.
- • 지원되는 모델에는 Qwen3.6-27B 및 Qwen3.6-35B-A3B가 포함되며, 아티팩트는 Hugging Face에서 사용할 수 있습니다.
- • NInfer는 RTX 5090에서 INT8 KV 캐시를 활용하여 262,144 토큰의 전체 네이티브 컨텍스트 길이를 구현합니다.
- • 이 엔진은 OpenAI 및 Anthropic 호환 HTTP 엔드포인트를 제공합니다.
로컬 추론을 실행하는 개발자는 소비자용 플래그십 하드웨어에서 거의 즉각적인 생성 속도와 방대한 컨텍스트 길이를 달성할 수 있습니다.
9. Nativ 앱, Mac에서 최첨단 오픈 모델 로컬 실행
Nativ은 초당 토큰 수, 메모리 압력, 열 상태를 포함한 실시간 성능 지표를 제공합니다. Apple의 MLX 프레임워크를 활용하여 개발자가 로컬 모델을 일상적인 개발 워크플로우에 직접 통합할 수 있는 원활하고 개인적인 방법을 제공합니다.
- • Nativ은 Google, Cohere 및 Liquid AI의 오픈 소스 모델을 Apple Silicon(M1 이상)에서 로컬로 실행합니다.
- • 이 애플리케이션은 MLX-VLM을 기반으로 구축되었으며 M 시리즈 통합 메모리 및 Metal 아키텍처에 최적화되어 있습니다.
- • 기존 코딩 에이전트를 로컬 모델에 연결하기 위한 로컬 엔드포인트를 제공합니다.
- • 지원되는 기능에는 LLM 채팅, 이미지 캡션, 비디오 요약, 코드 자동 완성 및 음성 전사가 포함됩니다.
- • 이 앱은 MIT 라이선스를 따르며 완전히 오프라인으로 작동하고 계정이나 구독이 필요하지 않습니다.
개발자는 Mac에서 오픈 모델을 로컬로 쉽게 실행 및 테스트하고, 로컬 엔드포인트를 통해 기존 코딩 에이전트를 연결할 수 있습니다.
10. Anthropic, Claude Code를 위한 Lean Harness 전략 상세 설명
제품 책임자인 Cat Wu가 이끄는 Claude Code 팀은 도구의 하네스를 의도적으로 가볍게 유지하고 있습니다. 이러한 접근 방식은 코드베이스 주변에 더 구조화된 기본 컨텍스트를 구축하려는 OpenAI의 Codex, Google의 Antigravity 및 스타트업 제품과 같은 다른 코딩 하네스와 대조됩니다.
- • Claude Code는 AI 모델과 개발자의 코드베이스 사이에서 간결한 관리 계층 역할을 합니다.
- • 팀은 모델이 빠르게 개선되고 있기 때문에 독단적이거나 제한적인 기능을 구축하지 않습니다.
- • Claude Code는 기본적으로 코드베이스 주변에 구조화된 컨텍스트를 구축하지 않습니다.
- • Anthropic의 전략은 개발자가 원하는 대로 자신의 도구를 통합할 수 있도록 합니다.
개발자들은 Claude Code가 매우 유연하게 유지될 것으로 기대할 수 있으며, 엄격한 프레임워크에 갇히지 않고 자신의 도구를 통합할 수 있습니다.
11. Writer의 에이전트 하네스, 토큰 비용 38% 절감
이 논문은 효율적인 워크플로우 대신 방대한 컨텍스트 창에 의존하는 업계 트렌드인 '토큰맥싱(tokenmaxxing)'을 비판하며 엔터프라이즈 AI ROI 역설을 다룹니다. Writer 에이전트 하네스를 사용하여 연구원들은 81%의 작업 성공률을 유지하면서 비용을 대폭 절감했으며, 스마트 오케스트레이션이 프로덕션 생존 가능성의 핵심임을 입증했습니다.
- • 오케스트레이션 계층을 최적화하여 모델 파인튜닝 없이 작업당 성공 비용을 최대 61%, 토큰 소비를 38% 줄였습니다.
- • 프롬프트 캐싱과 비효율적인 추론 루프 제거로 인해 엔드투엔드 작업 지연 시간이 44%(48초에서 27초로) 감소했습니다.
- • 이 연구는 프롬프트 캐싱을 트리거하기 위한 'Two-Zone Prompting'과 기록을 검색 가능한 저장소로 이동하는 'Context Offloading'을 권장합니다.
- • 하위 에이전트 위임은 Claude Sonnet 4.6 및 Palmyra X6와 같은 더 강력한 모델에서만 신뢰할 수 있는 것으로 나타났습니다.
- • 연구원들은 에이전트 루프가 폭주하는 것을 방지하기 위해 작업당 토큰 예산과 같은 엄격한 가드레일을 코드에 구현할 것을 조언합니다.
개발자들은 무차별적인 컨텍스트 창에 의존하는 대신 효율적인 오케스트레이션 패턴을 구현하여 API 비용을 크게 낮추고 지연 시간을 줄일 수 있습니다.
12. 에이전트 스웜 및 플래너-워커 경제성으로 비용 대폭 절감
고수준 계획과 저수준 실행을 분리함으로써 이 아키텍처는 모든 작업에 최첨단 모델을 실행하는 높은 비용을 피합니다. 또한 이 시스템은 에이전트가 지식을 큐레이팅하고 제도화하기 위해 소유하는 공유 컨텍스트 폴더인 'Field Guide'를 도입하여 장기적인 작업 일관성과 효율성을 보장합니다.
- • 스웜 시스템은 플래너 에이전트(스마트 모델)와 워커 에이전트(빠르고 저렴한 모델)를 사용한 트리형 분해를 사용합니다.
- • Rust로 SQLite를 처음부터 구축하는 실험에서 스웜은 sqllogictest 제품군에서 100%를 달성했습니다.
- • 하이브리드 스웜은 이전 시스템의 64,305줄에 비해 9,908줄을 사용하여 훨씬 더 간결한 코드를 생성했습니다.
- • 조정 메커니즘에는 병합 충돌을 위한 중립적인 제3자 에이전트와 품질 관리를 위한 스택형 검토 렌즈가 포함됩니다.
- • 이 시스템은 초당 1,000개의 커밋을 처리할 수 있는 사용자 지정 버전 제어 시스템을 갖추고 있습니다.
개발자들은 복잡한 계획은 비싼 최첨단 모델에 라우팅하고 실행은 저렴한 모델에 위임하는 멀티 에이전트 시스템을 설계하여 운영 비용을 대폭 절감할 수 있습니다.
13. 업계 리더들, 코호트 기반 AI 에이전트 평가로 전환
패널은 확장 가능하지만 근거가 없는 자동 판단과 인간 검토의 확장성 부족 사이의 긴장을 강조했습니다. 신뢰와 시스템 학습을 위해 인간 개입 프로세스가 여전히 필수적이지만, 개발자는 기본 가드레일에 간단한 정규식을 사용하고 오류 감지를 위해 더 작은 모델을 파인튜닝함으로써 비용을 크게 줄일 수 있습니다.
- • 기업들은 개별 AI 에이전트 추적 점수를 매기는 것에서 사용자 코호트를 기준선과 비교하는 것으로 전환하고 있습니다.
- • LangChain은 사용자 오류를 감지하기 위해 오픈 소스 Qwen 모델을 파인튜닝하여 Claude Sonnet 성능을 10배에서 100배 낮은 비용으로 구현했습니다.
- • 업계는 점점 더 저렴하고 좁은 범위의 판단 모델을 채택하고 있지만, LLM-as-judge가 여전히 기본값으로 남아 있습니다.
- • 평가 기준은 일회성 테스트 제품군이 아닌 살아있는 제품 사양(새로운 PRD)으로 취급되고 있습니다.
- • 광범위한 상시 모니터링이 철저한 출시 전 테스트 제품군보다 실제 실패를 포착하는 데 더 효과적인 것으로 강조됩니다.
개발자는 단일 상호 작용 추적을 평가할 때 보이지 않는 시스템적 실패를 포착하기 위해 대조적 코호트 분석과 상시 모니터링을 채택해야 합니다.
14. 정리 함정: RAG가 나쁜 데이터 파이프라인을 고칠 수 없는 이유
많은 엔터프라이즈 생성 AI 이니셔티브가 모델 제약이 아닌 데이터 신뢰성 부족으로 인해 프로덕션에 도달하지 못합니다. 프로덕션급 시스템을 구축하려면 개발자는 데이터 엔지니어링을 기본 토대로 취급하고, 데이터가 벡터 데이터베이스에 도달하기 전에 엄격한 검증과 제로 트러스트 수집을 강제해야 합니다.
- • '정리 함정'은 레거시 데이터 문제가 RAG 아키텍처의 검색 계층에서 해결될 수 있다는 잘못된 믿음입니다.
- • 스키마 드리프트나 누락된 필드와 같은 데이터 파이프라인의 결함은 벡터 저장소 및 다운스트림 AI 성능을 직접적으로 저하시킵니다.
- • 기술 리더십은 종종 프로젝트 실패의 원인을 지연 시간이나 컨텍스트 창과 같은 모델 제한 탓으로 잘못 돌립니다.
- • 데이터 팀은 인라인 스키마 검증과 다단계 알고리즘 검증을 구현할 것을 권장합니다.
- • 보안, 액세스 제어 및 이상 탐지는 모델이 아닌 데이터 인프라 내에서 관리되어야 합니다.
개발자는 벡터 데이터베이스나 LLM이 나쁜 데이터를 정리해 줄 것이라고 기대하는 대신 제로 트러스트 데이터 수집 및 파이프라인 검증에 집중해야 합니다.
15. Claude Code와 Codex가 세션 범위 목표 옵션을 처리하는 방법
AI 코딩 보조 도구의 목표 추적 기능 구현은 플랫폼마다 크게 다릅니다. Claude Code는 조기 종료를 감지하기 위해 간결한 관리 계층에 의존하는 반면, Codex는 더 통합된 스레드 상태를 사용하여 자체 평가를 수행하며, 이는 에이전트 자율성과 제어 사이의 절충안을 강조합니다.
- • Claude Code는 /goal 옵션을 조기 종료를 감지하는 세션 범위 Stop 훅으로 구현합니다.
- • Claude Code의 구현은 추가적인 솔버 반복이 유익할지 여부를 결정할 수 없습니다.
- • Codex는 /goal 옵션을 모델이 사용 가능한 파일과 도구를 사용하여 자신의 작업을 평가하는 지속 스레드 상태로 취급합니다.
- • /goal 옵션을 사용하면 좋은 결정만큼이나 잘못된 의사 결정을 증폭시킬 가능성이 있습니다.
개발자는 자동화된 루프가 잘못된 의사 결정을 증폭시키는 것을 방지하기 위해 다양한 코딩 에이전트가 자신의 작업을 평가하는 방식을 이해해야 합니다.
16. LoRA Speedrun 리더보드, 파인튜닝 효율성 추적
학습을 GSM8K 학습 분할 및 단일 GPU로 제한함으로써 LoRA Speedrun 리더보드는 특정 최적화 기술의 영향을 분리합니다. 이 프로젝트는 시퀀스 패킹이나 공격적인 학습률 일정과 같은 어떤 방법이 실제로 벽시계 학습 속도 향상으로 이어지는지에 대한 검증된 공개 기록을 구축하는 것을 목표로 합니다.
- • 이 대회는 참가자들에게 단일 L40S GPU를 사용하여 GSM8K에서 Qwen2.5-1.5B를 57% 정확도로 파인튜닝하도록 도전합니다.
- • 공식 타이밍 실행은 Modal L40S 샌드박스에서 수행되며 3개의 새로운 시드에 걸쳐 검증됩니다.
- • Track 1의 현재 기록은 1분 44초이며, Track 2는 11분 08초입니다.
- • 참가자는 교사 모델, 합성 데이터 또는 다중 GPU를 사용하는 것이 금지됩니다.
개발자들은 검증되고 매우 효율적인 파인튜닝 기술을 채택하여 단일 GPU 설정에서 학습 시간과 비용을 대폭 줄일 수 있습니다.
17. 2026년 단일 24GB GPU를 위한 최고의 로컬 LLM
로컬 모델을 실행하려면 모델 가중치, KV 캐시 및 런타임 오버헤드의 균형을 맞춰야 합니다. Mistral Small 3.2 24B와 같은 밀집 모델은 저지연 보조 작업에 탁월하지만, Gemma 4 및 Qwen3.6-35B-A3B와 같은 전문가 혼합(MoE) 모델은 빠른 디코딩을 제공하지만 활성 파라미터가 아닌 총 파라미터 수에 맞춰 VRAM 크기를 조정해야 합니다.
- • 24GB VRAM GPU는 2026년 진지한 로컬 AI 추론을 위한 실질적인 최소 사양입니다.
- • Alibaba의 Qwen3.6-27B(Apache 2.0)가 24GB GPU를 위한 최고의 올라운드 모델로 권장됩니다.
- • DeepSeek-R1-Distill-Qwen-32B(MIT 라이선스)는 18~20GB의 VRAM을 차지하는 밀집 추론 모델로 강조됩니다.
- • Q4_K_M은 모델 품질과 메모리 점유율의 균형을 맞추기 위해 권장되는 표준 양자화 수준입니다.
- • GLM-5.2, Kimi K2.7, DeepSeek V4 및 Mistral Large 3와 같은 서버급 모델은 단일 24GB GPU에서 실행할 수 없습니다.
개발자들은 VRAM 제약 조건과 특정 작업 요구 사항에 따라 로컬 개발 및 테스트를 위한 최적의 오픈 웨이트 모델을 선택할 수 있습니다.
18. 13M 파라미터 ASR Conformer, ESP32 마이크로컨트롤러로 포팅
ESP32-S3의 8비트 수학 하드웨어 가속을 활용함으로써, 이 포팅은 저렴한 저전력 마이크로컨트롤러에서 복잡한 음성-텍스트 변환 모델을 실행할 수 있는 가능성을 입증했습니다. 이는 IoT 및 하드웨어 제품에서 엣지 기반의 오프라인 음성 인터페이스를 위한 새로운 가능성을 열어줍니다.
- • Nvidia의 소형 conformer를 기반으로 한 1,310만 파라미터 컨볼루션 트랜스포머 모델이 ESP32-S3로 포팅되었습니다.
- • 이 모델은 14MB 플래시, 256KB SRAM 및 4MB PSRAM에 맞게 증류 및 양자화되었습니다.
- • 이 모델은 마이크로컨트롤러에서 로컬로 8초 분량의 오디오를 전사할 수 있습니다.
- • 증류 및 양자화 프로세스로 인해 ASR 벤치마크에서 단어 오류율이 3%만 증가했습니다.
- • 로컬 conformer 모델은 동일한 하드웨어에서 5초 분량의 오디오를 전사하는 데 50분이 걸린 Whisper tiny보다 훨씬 빠릅니다.
개발자들은 클라우드 API에 의존하지 않고 실시간 음성 전사가 가능한 저전력 오프라인 하드웨어 장치를 구축할 수 있습니다.