Inference Brew

Google, Gemini 3.5 Transcribe 정식 출시 및 Gemini 3.8 Live 공개

00:00 / --:--

← 메인으로

Google, Gemini 3.5 Transcribe 정식 출시 및 Gemini 3.8 Live 공개

1. Google, Gemini 3.5 Transcribe 정식 출시 및 Gemini 3.8 Live 공개

Google은 음성 및 오디오 기능을 확장하여 Gemini 3.5 Transcribe를 공개 프리뷰에서 정식 서비스로 전환하고, 새로운 Gemini 3.8 Live 모델을 도입했습니다. 이번 업데이트는 지난 8월 발표된 Transcribe 모델 프리뷰와 7월의 Gemini Live API 출시에 이어, 개발자들에게 실시간 음성 애플리케이션을 위한 더욱 안정적이고 프로덕션 수준의 도구를 제공합니다.

  • • Gemini 3.5 Transcribe는 2026년 8월 26일 공개 프리뷰 이후 정식 출시되었습니다.
  • • Google은 실시간 음성 상호작용에 최적화된 새로운 모델인 Gemini 3.8 Live를 도입했습니다.
  • • 이번 출시를 통해 개발자들은 저지연 음성 인식 및 실시간 대화형 에이전트를 위한 프로덕션 준비 도구를 확보하게 되었습니다.

개발자들은 이제 정식 출시된 Gemini 3.5 Transcribe와 새롭게 공개된 Gemini 3.8 Live 모델을 사용하여 프로덕션급 실시간 음성 애플리케이션을 배포할 수 있습니다.

SOURCES

2. Prior Labs, TabPFN-3.5 정형 데이터 파운데이션 모델 출시

Prior Labs는 파라미터 수를 2억 2천만 개로 확장한 정형 데이터 파운데이션 모델의 주요 업그레이드 버전인 TabPFN-3.5를 출시했습니다. 기본 설정으로 원시 데이터에서 실행되도록 설계된 이 모델은 데이터셋별 학습 없이 즉시 분류 및 회귀 작업을 수행합니다. 이번 출시에는 더 빠른 84M 파라미터 버전, 기본 텍스트 처리가 가능한 엔터프라이즈 전용 Plus 버전, 추가 추론 연산을 활용하는 Thinking 버전이 포함되어 있습니다.

  • • Prior Labs는 단일 순방향 패스로 예측을 수행하는 2억 2천만 파라미터 규모의 정형 데이터 파운데이션 모델 TabPFN-3.5를 출시했습니다.
  • • 이 모델은 Otto Group 제품 분류 챌린지에서 0.375점을 기록하며 기존 Kaggle 우승 솔루션을 능가했습니다.
  • • TabPFN-3.5는 TabArena 및 ScoringBench를 포함한 7개의 정형 데이터 벤치마크에서 1위를 차지했습니다.
  • • 최대 100만 개의 행과 2만 개의 피처(6,000개 권장)를 지원합니다.
  • • 연구, 평가 및 Kaggle용 오픈 웨이트가 제공되며, 프로덕션 배포에는 상업용 라이선스나 Prior Labs API가 필요합니다.

개발자는 데이터셋별로 모델을 학습하거나 튜닝할 필요 없이 단일 순방향 패스만으로 매우 정확한 정형 데이터 분류 및 회귀 작업을 수행할 수 있습니다.

SOURCES

3. Nums AI, Causilo 정형 데이터 파운데이션 모델 출시

Nums AI는 전적으로 합성 데이터로 사전 학습된 정형 데이터 파운데이션 모델 Causilo를 선보였습니다. Causilo는 표준 scikit-learn 인터페이스를 통해 기존 Python 워크플로우에 직접 통합되며, 코드는 Apache-2.0 라이선스를 따릅니다. 교차 어텐션(cross-attention)을 사용하여 피처 수에 비례하는 선형적 계산 복잡도를 유지함으로써 대규모 정형 데이터셋에서 매우 효율적입니다.

  • • Nums AI는 분류 및 회귀 작업을 위한 사전 학습된 정형 데이터 파운데이션 모델 Causilo를 출시했습니다.
  • • 이 모델은 scikit-learn 인터페이스를 제공하며, Apache-2.0 코드와 사전 학습된 웨이트가 Hugging Face에 공개되어 있습니다.
  • • Causilo는 TabArena 벤치마크의 분류 및 회귀 부문 단일 모델 중 가장 높은 Elo 점수를 기록했습니다.
  • • 이 아키텍처는 3단계 프로세스(정제, 압축, 문맥 내 학습)와 교차 어텐션을 사용하여 계산 비용을 피처 수에 대해 선형적으로 유지합니다.
  • • Python 3.10~3.12 및 PyTorch 2.13 이상이 필요하며, 연구 및 평가 목적으로는 무료입니다.

개발자는 익숙한 scikit-learn 인터페이스를 사용하여 고성능 오픈 소스 정형 데이터 모델을 Python 파이프라인에 통합할 수 있습니다.

SOURCES

4. Knowledgator, GLiFormer 스키마 조건부 인코더 출시

Knowledgator Engineering은 텍스트 토큰을 생성하지 않고도 여러 추출 작업을 처리하도록 설계된 오픈 소스 인코더 프레임워크 GLiFormer를 출시했습니다. 제공된 스키마와 앵커에 대한 호환성을 직접 점수화함으로써, 이 모델은 기존 생성형 LLM의 지연 시간을 방지합니다. Apache 2.0 라이선스가 적용된 체크포인트는 Base(264M) 및 Large(575M) 크기로 제공되어 구조화된 데이터 추출을 위한 빠르고 비용 효율적인 대안을 제시합니다.

  • • Knowledgator Engineering은 정보 추출을 위한 스키마 조건부 인코더 프레임워크 GLiFormer를 출시했습니다.
  • • 이 모델은 단일 인코더를 사용하여 개체명 인식, 텍스트 분류, 관계 추출, 중첩 JSON 구조화 및 텍스트 임베딩을 수행합니다.
  • • GLiFormer Large(5억 7,560만 파라미터)는 중첩 JSON 추출 벤치마크에서 F1 점수 91.10을 달성했습니다.
  • • 모델 체크포인트는 Apache 2.0 라이선스로 출시되었으며 CPU 및 GPU 하드웨어와 모두 호환됩니다.
  • • GLiFormer-base(2억 6,420만 파라미터)는 NVIDIA RTX PRO 6000 Blackwell GPU에서 69ms의 중앙값 지연 시간을 기록했습니다.

개발자는 생성형 LLM 토큰의 지연 시간과 비용 없이 고정밀 스키마 조건부 정보 추출 및 중첩 JSON 구조화를 수행할 수 있습니다.

SOURCES

5. Ant Group, Ling-3.0-flash-Fin 오픈 웨이트 모델 출시

Ant Group은 Ling-3.0-flash 아키텍처를 기반으로 구축된 특수 금융 모델 Ling-3.0-flash-Fin을 출시했습니다. 이 모델은 소스 확인, 보고서 작성, 스프레드시트 생성과 같은 도메인별 작업을 지원하도록 설계되었습니다. 비즈니스 지식 정확도는 높지만, 평가 결과 동일 아키텍처의 비전-언어 변형 모델보다 환각(hallucination) 발생률이 다소 높은 것으로 나타났습니다.

  • • Ant Group은 MIT 라이선스 하에 금융 특화 오픈 웨이트 모델 Ling-3.0-flash-Fin을 출시했습니다.
  • • 이 모델은 총 1,240억 파라미터와 토큰당 51억 개의 활성 파라미터를 가진 Mixture-of-Experts 아키텍처를 특징으로 합니다.
  • • 256K 토큰 컨텍스트 윈도우를 지원하며 텍스트 전용 입출력으로 제한됩니다.
  • • OpenRouter에서 이용 가능하며, 속도 제한이 있는 무료 엔드포인트를 포함합니다.
  • • Ling-3.0-flash-Fin은 Artificial Analysis Intelligence Index에서 23점을 기록하여, 절반의 활성 파라미터를 사용하면서도 MiniMax-M2.7과 대등한 성능을 보였습니다.

금융 애플리케이션을 구축하는 개발자는 보고서 작성 및 가치 평가 작업을 위해 256K 컨텍스트 윈도우를 갖춘 특화된 MIT 라이선스 오픈 웨이트 모델을 활용할 수 있습니다.

SOURCES

6. TypeSafe AI, 빠른 의사결정을 위한 Jev System One 모델 출시

TypeSafe AI는 소프트웨어 워크플로우에 직접 통합되도록 구축된 특수 'System One' 모델인 Jev의 얼리 액세스를 시작했습니다. 자유 형식 텍스트를 생성하는 기존 LLM과 달리, Jev는 구조화된 출력과 선택지 선정만을 위해 설계되었습니다. 이 아키텍처는 기존 모델보다 최대 2배 빠른 속도로 작동하면서 환각을 완전히 제거하도록 최적화되었습니다.

  • • TypeSafe AI는 소프트웨어 내 빠른 구조화 의사결정을 위해 설계된 새로운 클래스의 System One 모델 Jev를 도입했습니다.
  • • 이 모델은 구조화된 출력에 최적화되어 있으며 환각이 불가능하다고 명시되어 있습니다.
  • • Jev는 기존 대규모 언어 모델과 유사한 지능을 유지하면서도 두 자릿수 더 빠르고 효율적이라고 주장합니다.
  • • 현재 얼리 액세스를 통해 이용 가능합니다.

개발자는 소프트웨어 내에서 빠르고 구조화된 의사결정을 위해 최적화된, 환각이 없는 고효율 모델 클래스에 접근할 수 있습니다.

SOURCES

7. Google, Google Home Model Context Protocol 서버 출시

Google은 개발자가 구축한 AI 에이전트가 스마트 홈 생태계를 활용할 수 있도록 얼리 액세스 Model Context Protocol(MCP) 서버를 출시했습니다. 이 통합을 통해 Claude 및 ChatGPT를 포함한 외부 에이전트는 자연어를 사용하여 기기 상태를 조회하고, 카메라 피드를 검토하며, 스마트 홈 하드웨어를 제어할 수 있습니다. 시작하려면 개발자는 Google Cloud 프로젝트를 구성하여 Home MCP 서버와 인터페이스해야 합니다.

  • • Google은 Google Home을 위한 Model Context Protocol(MCP) 서버의 얼리 액세스를 시작했습니다.
  • • 이 통합을 통해 Claude 및 ChatGPT와 같은 타사 AI 에이전트가 연결된 스마트 홈 기기를 제어하고 카메라 요약 정보에 접근할 수 있습니다.
  • • 설정을 위해서는 개발자가 Home MCP를 위한 Google Cloud 프로젝트를 생성하고 구성해야 합니다.
  • • 이 기능은 현재 미국 내 Google Home Premium Advanced 사용자에게 월 20달러 또는 연 200달러로 제공됩니다.
  • • Google은 속도 제한 및 에이전트의 문 잠금 해제 방지 등 안전 보호 조치를 구현했습니다.

개발자는 이제 Model Context Protocol을 사용하여 Google Home 스마트 기기와 직접 상호작용하고 모니터링하며 제어하는 AI 에이전트를 구축할 수 있습니다.

8. Stanford 연구진, Paper2Agent 파이프라인 공개

Stanford 연구진은 과학 논문과 해당 코드 저장소를 Model Context Protocol(MCP) 서버로 변환하는 과정을 자동화하는 오픈 소스 파이프라인 Paper2Agent를 도입했습니다. 이 시스템은 환경을 관리하고, 도구를 추출하며, 생성된 에이전트의 출력이 원본 논문의 수치 및 결과와 일치하는지 확인하기 위해 엄격한 검증 게이트를 실행합니다. MIT 라이선스가 적용된 이 도구를 통해 개발자는 고도로 전문화된 과학 에이전트를 신속하게 구축할 수 있습니다.

  • • Stanford 연구진은 연구 논문과 코드베이스를 실행 가능한 MCP 서버로 변환하는 시스템인 Paper2Agent를 출시했습니다.
  • • 이 파이프라인은 수치 결과가 3% 이내로 일치하고 그림이 지각 해시(perceptual hash)로 일치해야 하는 엄격한 검증 게이트를 갖추고 있습니다.
  • • 100개의 bioRxiv 논문을 대상으로 한 규모 테스트에서 74개의 논문이 성공적으로 변환되었으며, 599개의 도구 중 593개가 검증을 통과했습니다.
  • • 소프트웨어는 MIT 라이선스이며, 사전 구축된 서버는 Hugging Face Spaces에 호스팅됩니다.
  • • AlphaGenome 에이전트를 생성하는 데 45분이 소요되었으며 비용은 14달러였고, 22개의 도구 모두 검증을 통과했습니다.

개발자는 과학 논문과 관련 코드베이스를 AI 에이전트가 실행할 수 있는 완전히 검증된 Model Context Protocol 서버로 자동 변환할 수 있습니다.

SOURCES

9. Ory Agent Security, AI 에이전트를 위한 Harness-Layer 거버넌스 출시

Ory Agent Security는 AI 코딩 에이전트를 관리하기 위해 특별히 설계된 벤더 중립적 보안 솔루션을 도입했습니다. 하니스(harness) 계층에서 작동하는 이 도구는 외부 게이트웨이에 도달하기 전에 작업을 가로채고 평가합니다. 이 시스템은 11개의 주요 AI 코딩 에이전트 하니스와 호환되며, 개발자에게 자율 에이전트를 위한 ID 및 액세스 관리를 구현할 수 있는 구체적인 방법을 제공합니다.

  • • Ory Agent Security는 하니스 계층에서 AI 에이전트 실행을 관리하기 위해 출시되었습니다.
  • • 이 도구는 벤더 중립적이며 모든 게이트웨이 호출이 이루어지기 전에 작동합니다.
  • • Ory Agent Security는 11개의 주요 AI 코딩 에이전트 하니스와 호환됩니다.
  • • 이 솔루션은 AI 에이전트가 인간 사용자 수를 능가함에 따라 발생하는 보안 문제를 해결하기 위해 설계되었습니다.

개발자는 외부 게이트웨이 호출을 수행하기 전에 하니스 계층에서 보안 정책을 실행하여 AI 코딩 에이전트를 보호하고 관리할 수 있습니다.

SOURCES

10. Cloudflare, 9월 마감 기한에 맞춰 'AI 학습 거부' 설정 배포

Cloudflare는 7월에 설정된 9월 15일 크롤러 분리 마감 기한을 준수하여 'AI 학습 거부' 설정을 구현했습니다. 이 새로운 기능을 통해 사이트 소유자는 혼합형 크롤러가 검색을 위해 콘텐츠를 인덱싱하는 것은 허용하면서도 AI 모델 학습에 사용하는 것은 차단할 수 있습니다. 이번 업데이트는 이전의 봇 관리 도구를 통합된 '봇 환경 설정 동기화(Bot Preference Sync)' 시스템으로 대체하며, Google, Apple, Microsoft와 같은 주요 운영업체들이 새로운 거부 설정을 존중하기로 약속했습니다.

  • • Cloudflare는 9월 15일 크롤러 분리 마감 기한에 맞춰 'AI 학습 거부' 설정을 공식 출시했습니다.
  • • 이 기능을 통해 사이트 소유자는 검색 가시성을 유지하면서 혼합형 크롤러의 AI 학습을 차단할 수 있습니다.
  • • Google, Apple, Microsoft를 포함한 주요 운영업체들이 새로운 거부 설정을 존중하기로 약속했습니다.
  • • 이번 업데이트는 기존 봇 관리 도구를 새로운 '봇 환경 설정 동기화' 시스템으로 대체합니다.
  • • Cloudflare는 내년 초까지 AI 생성 요약에 대한 더 세분화된 제어 기능을 도입할 계획입니다.

이번 출시는 사이트 소유자가 크롤러 분리 정책을 시행할 수 있는 최종 메커니즘을 제공하여, 검색 엔진 순위를 희생하지 않고도 무단 AI 학습으로부터 콘텐츠를 보호할 수 있게 합니다.

SOURCES

11. Openjev 프로젝트, 오픈 소스 단일 패스 선택 모델 제공

Openjev 프로젝트는 TypeSafe의 Jev와 같은 상업용 선택 모델에 대한 오픈 소스 MIT 라이선스 대안을 제공합니다. 옵션 어텐션 헤드를 사용하여 단일 패스로 입력을 점수화함으로써, 이 모델은 표준 토큰 생성의 지연 시간을 방지합니다. 이 저장소는 기본 바이트 인코더 또는 Qwen2.5-0.5B와 같은 Hugging Face의 사전 학습된 인코더를 사용한 학습을 지원하며, 8개의 옵션을 평가할 때 400개의 토큰을 작성해야 하는 소형 디코더보다 약 100배 빠르다고 보고되었습니다.

  • • Openjev 프로젝트는 변경되는 텍스트 옵션 목록 중에서 단일 패스로 선택하도록 설계된 독립적인 MIT 라이선스 스타터 모델을 제공합니다.
  • • 이 모델은 8개의 옵션을 평가할 때 400개의 토큰을 작성해야 하는 소형 디코더보다 약 100배 빠르다고 보고되었습니다.
  • • 옵션 어텐션 헤드를 사용하여 입력을 점수화하며, 옵션을 쿼리 벡터로 변환하여 컨텍스트 토큰에 어텐션 가중치를 할당합니다.
  • • 로컬 실험에서 단일 패스 스코어러는 합성 메뉴에서 약 98%, Wikispeedia 다음 클릭 데이터에서 29%의 정확도를 달성했습니다.

개발자는 느린 토큰 생성 디코더에 의존하지 않고도 애플리케이션에서 초고속 단일 패스 분류 및 옵션 선택을 구현할 수 있습니다.

12. GSQ-RCO 양자화, 로컬 GPU를 위한 Qwen3.8-Flash-Next 최적화

NVIDIA의 NVFP4 및 AtomicChat의 SSD 오프로딩을 포함하여 125B Qwen3.8-Flash-Next 모델에 대한 이전 최적화 릴리스를 기반으로, 새로운 GSQ-RCO 양자화 방식은 로컬 배포를 위한 추가 경로를 제공합니다. Q2_0 및 IQ3_XXS 변형을 최적화함으로써 이 방식은 모델이 12GB VRAM 하드웨어에서 거의 기준 성능을 유지하면서 실행되도록 하여 기존 양자화 및 오프로딩 전략의 대안을 제공합니다.

  • • GSQ-RCO 양자화는 Qwen3.8-Flash-Next 모델 크기를 68~76GB로 줄입니다.
  • • Q2_0 변형은 IQ2_XS보다 6.2배 더 나은 프롬프트 처리량과 1.9배 낮은 지연 시간을 제공합니다.
  • • IQ3_XXS 변형은 12GB RTX 5070에서 초당 15토큰 출력을 달성합니다.
  • • 성능은 AIME25에서 기본 모델과 일치하며 GPQA-Diamond에서 0.51점 이내를 유지합니다.

개발자는 이제 기존 NVFP4 및 SSD 오프로딩 기술을 보완하여 소비자 하드웨어에서 거대한 Qwen3.8-Flash-Next 모델을 실행하기 위한 추가적이고 매우 효율적인 양자화 옵션을 갖게 되었습니다.

SOURCES

13. vLLM 구현, Qwen3.8-Flash-Next KV 캐시를 RAM으로 오프로드

개발자는 이제 KV 캐시를 시스템 RAM으로 오프로드하여 vLLM에서 100만 토큰 컨텍스트 길이로 Qwen3.8-Flash-Next를 실행할 수 있습니다. 이 접근 방식은 12개의 KV 캐시 레이어와 36개의 게이트 델타-넷 레이어를 결합한 모델의 고유한 아키텍처를 활용합니다. QSA 메커니즘을 사용하여 디코드 단계당 최대 2,048개의 위치를 인덱싱하고 읽음으로써, 모델의 양자화가 VRAM에 간신히 들어맞는 경우에도 시스템은 높은 처리량을 유지합니다.

  • • 새로운 구현을 통해 개발자는 Qwen3.8-Flash-Next의 KV 캐시 대부분을 최소한의 디코드 속도 저하로 시스템 RAM에 오프로드할 수 있습니다.
  • • 이 설정은 3개의 NVIDIA 3090 GPU를 사용하여 vLLM에서 100만 토큰 컨텍스트 길이를 달성했습니다.
  • • 모델 아키텍처는 메모리를 관리하기 위해 KV 캐시가 있는 12개의 레이어와 고정 크기 순환 상태가 있는 36개의 게이트 델타-넷 레이어를 사용합니다.
  • • QSA 메커니즘은 최대 2,048개의 위치를 선택하여 각 디코드 단계에서 읽는 KV 캐시 데이터의 양을 제한합니다.

개발자는 제한된 GPU VRAM의 병목 현상 없이 최대 100만 토큰의 매우 긴 컨텍스트 로컬 모델을 실행할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.