Inference Brew

Moonshot AI, 2.8조 파라미터 MoE 모델 'Kimi K3' 발표

00:00 / --:--

이 브리핑에는 아직 오디오가 없습니다.

← 메인으로

Moonshot AI, 2.8조 파라미터 MoE 모델 'Kimi K3' 발표

1. Moonshot AI, 2.8조 파라미터 MoE 모델 'Kimi K3' 발표

Moonshot AI가 2.8조 파라미터의 희소(sparse) Mixture-of-Experts 모델인 Kimi K3를 발표했습니다. Kimi Delta Attention 및 Attention Residuals 아키텍처를 기반으로 구축된 이 모델은 896개의 전문가 중 16개를 활성화하여 디코딩 속도와 확장 효율성을 개선합니다. Kimi K3는 현재 Kimi API를 통해 액세스할 수 있으며, 전체 모델 가중치는 2026년 7월 27일에 공개될 예정입니다.

  • Moonshot AI는 2.8조 파라미터의 희소 Mixture-of-Experts 모델인 Kimi K3를 발표했으며, 가중치는 2026년 7월 27일에 공개될 예정입니다.
  • 이 모델은 네이티브 시각적 이해, 상시 작동하는 '생각 모드(thinking mode)' 추론 기능, 100만 토큰 컨텍스트 윈도우를 특징으로 합니다.
  • Kimi Delta Attention 및 Attention Residuals를 활용하여 디코딩 속도와 확장 효율성을 향상시킵니다.
  • API 가격은 입력 토큰 100만 개당 3달러(캐시 히트 시 0.30달러), 출력 토큰 100만 개당 15달러로 책정되었습니다.
  • 48시간 동안 진행된 시연에서 Kimi K3는 오픈 소스 전자 설계 자동화 도구를 사용하여 4제곱밀리미터 크기의 기능성 칩을 자율적으로 설계했습니다.

개발자들은 네이티브 멀티모달 지원과 긴 컨텍스트 추론 기능을 갖춘 대규모 프런티어급 오픈 가중치 모델을 기반으로 애플리케이션을 구축할 수 있습니다.

2. GPT-5.6 Sol, Web Design Arena 벤치마크 1위 달성

GPT-5.6 모델 제품군의 글로벌 프리뷰를 기반으로, OpenAI의 플래그십 모델인 Sol이 Design Arena의 Web Design Arena에서 1위를 달성했습니다. 이번 성과는 AI 디자인 안티 패턴을 인식하고 압축하는 모델의 능력을 강조하며, 현재 18계단 낮은 순위에 있는 GPT-5.5 모델보다 크게 향상된 성능을 보여줍니다.

  • GPT-5.6 Sol이 Web Design Arena 벤치마크에서 1위를 기록했습니다.
  • 이 모델은 현재 18계단 낮은 순위인 GPT-5.5보다 월등한 성능을 보여줍니다.
  • 벤치마크 결과는 일반적인 AI 디자인 안티 패턴을 효과적으로 식별하고 압축하는 모델의 능력을 검증합니다.

현재 글로벌 프리뷰에서 GPT-5.6 Sol 모델을 테스트하는 개발자들은 개인화된 고품질 웹 디자인 생성을 위해 검증된 최고 수준의 성능을 활용할 수 있습니다.

SOURCES

3. OpenLLM-France, Luciole-23B-Instruct-1.1 출시

LINAGORA와 OpenLLM-France 컨소시엄은 오픈 소스 다국어 모델인 Luciole-23B-Base를 미세 조정하고 정렬한 Luciole-23B-Instruct-1.1을 출시했습니다. 학습은 Jean Zay 슈퍼컴퓨터에서 3단계에 걸쳐 진행되었으며, 사고 흔적(thinking traces) 유무에 따른 지도 미세 조정과 DPO(Direct Preference Optimization)가 포함되었습니다. 이 컬렉션은 Apache 2.0 라이선스를 따르며 23B, 8B, 1B 파라미터 버전이 포함되어 있습니다.

  • Luciole-23B-Instruct-1.1은 오픈 소스 다국어 모델 Luciole-23B-Base를 미세 조정하고 정렬한 버전입니다.
  • 이 모델은 LINAGORA와 OpenLLM-France 컨소시엄이 개발했으며 BPI France의 지원을 받았습니다.
  • 학습은 Jean Zay 슈퍼컴퓨터에서 사고 흔적 유무에 따른 지도 미세 조정과 DPO 정렬을 통해 수행되었습니다.
  • 이 컬렉션은 Apache 2.0 라이선스로 출시되었으며 23B, 8B, 1B 파라미터 버전을 포함합니다.

개발자들은 수학, 과학, 코딩 및 RAG 작업에 미세 조정된 새로운 Apache 2.0 라이선스 다국어 모델을 사용할 수 있습니다.

SOURCES

4. OpenAI, GPT-5.6 파일 삭제 버그의 근본 원인 및 완화 조치 상세 설명

GPT-5.6의 파일 삭제 문제에 대한 초기 보고를 바탕으로, OpenAI는 모델이 임시 경로를 정의하려는 과정에서 실수로 $HOME 디렉토리를 덮어쓰는 환경 변수 오류가 근본 원인임을 확인했습니다. 위험을 완화하기 위해 OpenAI는 개발자 메시지를 업데이트하고 더 안전한 권한 모드에 대한 지침을 제공하는 한편, 전체 사후 분석(post-mortem)을 준비하고 있습니다.

  • 파일 삭제는 모델이 $HOME 환경 변수를 잘못 덮어쓰면서 발생합니다.
  • OpenAI는 개발자 메시지를 업데이트하고 더 안전한 권한 모드를 권장함으로써 문제를 완화하고 있습니다.
  • 사건에 대한 자세한 사후 분석 보고서가 며칠 내로 발표될 예정입니다.

구체적인 기술적 결함을 이해함으로써 개발자는 환경을 더 잘 구성하고 영구적인 수정 사항이 배포될 때까지 데이터 손실을 방지하기 위해 필요한 샌드박싱을 적용할 수 있습니다.

SOURCES

5. LM Studio, 오픈 모델용 Bionic AI 에이전트 출시

LM Studio는 오픈 모델을 위해 설계된 새로운 AI 에이전트 애플리케이션 Bionic을 출시했습니다. 이 플랫폼은 로컬 모델 실행과 '데이터 보존 제로(Zero Data Retention)'를 약속하는 LM Studio Secure Cloud를 통한 클라우드 기반 실행을 모두 지원합니다. 코딩 작업의 경우, Bionic은 로컬 코드베이스를 검사하고 디버깅하며 인라인 diff를 수행할 수 있으며, GLM 5.2 및 Kimi K2.7 Code와 같은 모델을 지원합니다.

  • LM Studio는 로컬 모델 실행과 LM Studio Secure Cloud를 통한 클라우드 실행을 지원하는 별도의 AI 에이전트 애플리케이션 Bionic을 출시했습니다.
  • Bionic은 데이터 보존 제로 정책을 따르며 사용자 데이터를 학습에 사용하지 않습니다.
  • 코딩 시 GLM 5.2 및 Kimi K2.7 Code와 같은 모델을 사용하여 로컬 코드베이스를 검사하고 디버깅하며 인라인 diff를 수행할 수 있습니다.
  • Mistral AI의 Voxtral 모델을 활용하여 로컬 실시간 전사를 지원하는 음성 키보드가 포함되어 있습니다.
  • 버전 관리를 위한 자동 체크포인트가 포함된 문서 작업을 위한 샌드박스 환경을 제공합니다.

개발자들은 전용 에이전트 환경을 사용하여 코딩, 디버깅 및 문서 작업을 위해 로컬 또는 보안 클라우드에서 오픈 모델을 실행할 수 있으며, 데이터는 보존되지 않습니다.

SOURCES

6. Modal, 100만 개의 동시 샌드박스를 지원하도록 플랫폼 재구축

Modal은 수백만 개의 동시 샌드박스와 초당 수만 개의 샌드박스 생성을 지원하기 위해 샌드박스 플랫폼을 재구축했습니다. 새로운 아키텍처는 Redis 스트림을 사용하는 수평적 확장 가능한 비동기 설계로 글로벌 조정을 대체하여 중앙 병목 현상을 제거했습니다. 샌드박스 시작 시간은 중앙값 기준 0.5초 미만으로 단축되었으며, 단 두 번의 네트워크 홉과 한 번의 CPU 작업만 필요합니다.

  • Modal은 수백만 개의 동시 샌드박스와 초당 수만 개의 생성을 지원하도록 샌드박스 플랫폼을 재구축했습니다.
  • 새로운 아키텍처는 Redis 스트림을 사용하는 수평적 확장 가능한 비동기 설계로 글로벌 조정을 대체합니다.
  • 샌드박스 시작 시간은 중앙값 기준 0.5초 미만이며, 두 번의 네트워크 홉과 한 번의 CPU 작업만 필요합니다.
  • Modal은 1분 이내에 100만 개의 샌드박스를 성공적으로 생성하여 플랫폼을 벤치마킹했습니다.
  • 새로운 플랫폼은 현재 사용자가 선택할 수 있는 베타 버전으로 제공됩니다.

에이전트 워크로드를 실행하는 개발자는 1초 미만의 시작 시간으로 수많은 동시 격리 실행 환경으로 확장할 수 있습니다.

SOURCES

7. Perplexity, 에이전트용 SPACE 일회성 샌드박스 플랫폼 출시

Perplexity AI는 민감한 작업을 수행하는 AI 에이전트를 보호하기 위해 설계된 샌드박스 플랫폼 SPACE를 출시했습니다. 이 플랫폼은 작업이 완료되면 자동으로 파괴되는 일회성 샌드박스를 활용합니다. SPACE는 제어 평면(Control Plane)과 노드 수준 서비스를 통해 자격 증명 액세스를 관리 및 보호하며, 자격 증명 격리, 롤링 스냅샷, 암호화된 저장소와 같은 보안 기능을 제공합니다.

  • Perplexity AI는 안전하고 효율적인 AI 에이전트 실행을 위해 설계된 샌드박스 플랫폼 SPACE를 출시했습니다.
  • 이 플랫폼은 작업 완료 시 자동으로 파괴되는 일회성 샌드박스를 사용합니다.
  • 제어 평면과 노드 수준 서비스를 사용하여 자격 증명을 격리하고 보호합니다.
  • 보안 기능에는 자격 증명 격리, 롤링 스냅샷, 암호화된 저장소가 포함됩니다.
  • SPACE는 온프레미스 및 오프라인 운영을 모두 지원합니다.

개발자는 자격 증명 노출 및 데이터 유출을 방지하기 위해 안전하고 격리된, 자동으로 파괴되는 환경에서 민감한 에이전트 작업을 실행할 수 있습니다.

SOURCES

8. 1Password, Claude와 통합하여 안전한 자격 증명 자동 완성 지원

1Password는 Anthropic Claude 챗봇이 저장된 보안 자격 증명을 사용하여 작업을 완료할 수 있도록 하는 브라우저 통합 기능을 출시했습니다. 이 통합은 보안 채널을 통해 자격 증명을 주입하는 제로 노출(zero-exposure) 보안 프레임워크를 활용하여 AI 모델이 실제 비밀번호나 MFA 코드를 볼 수 없도록 합니다. 사용자는 생체 인식 프롬프트를 통해 각 요청을 승인해야 하며, 1Password는 부여된 특정 자격 증명에 대해서만 액세스를 자동으로 잠급니다.

  • 1Password는 Anthropic Claude 챗봇이 저장된 자격 증명을 사용하여 작업을 완료할 수 있도록 하는 브라우저 통합 기능을 출시했습니다.
  • 제로 노출 보안 프레임워크가 보안 채널을 통해 자격 증명을 주입하여 AI 모델이 비밀번호나 MFA 코드를 볼 수 없게 합니다.
  • 사용자는 생체 인식 프롬프트를 통해 각 자격 증명 요청을 승인해야 하며, 1Password는 부여된 특정 자격 증명에만 액세스를 제한합니다.
  • 이 기능은 Mac용 1Password 사용자(비즈니스, 가족, 개인 플랜)에게 제공되며 데스크톱 앱과 브라우저 확장 프로그램이 모두 필요합니다.
  • 향후 업데이트에서는 결제 카드 및 신원 정보에 대한 지원이 추가될 예정입니다.

개발자는 기본 LLM에 원시 비밀번호나 MFA 코드를 노출하지 않고도 Claude 에이전트에게 보안 자격 증명에 대한 액세스 권한을 안전하게 부여할 수 있습니다.

SOURCES

9. ReasonGate, 설명 가능한 프롬프트 인젝션 방어 도구 오픈 소스 공개

ReasonGate는 사용자 프롬프트, 검색된 컨텍스트 및 모델 출력을 검사하여 LLM 애플리케이션을 보호하도록 설계된 설명 가능한 모델 독립적 보안 게이트로 출시되었습니다. 순수 Python으로 작성되었으며 의존성이 전혀 없는 이 핵심 도구는 모든 프롬프트-문자열 함수를 래핑하며 정규화, 인젝션, 간접 인젝션, 다중 턴 위험 및 출력 유출에 대한 탐지기를 포함합니다.

  • ReasonGate는 Apache-2.0 라이선스를 따르는 설명 가능한 모델 독립적 보안 게이트입니다.
  • 핵심 도구는 의존성이 없는 순수 Python으로 작성되었으며 모든 프롬프트-문자열 함수를 래핑합니다.
  • 정규화, 인젝션, 간접 인젝션, 다중 턴 위험 및 출력 유출에 대한 탐지기가 포함되어 있습니다.
  • 정책 엔진이 신호를 융합하여 요청 허용, 플래그 지정 또는 차단 여부를 결정하고 구조화된 기계 판독 가능한 감사 기록을 생성합니다.
  • 선택적 엔터프라이즈 애드온은 임베딩 기반 ML 탐지를 제공하며, 핵심 도구는 규칙 기반으로 유지됩니다.

개발자는 모든 LLM 또는 RAG 파이프라인을 가볍고 독립적인 보안 계층으로 래핑하여 프롬프트를 검사하고 구조화된 감사 기록을 생성할 수 있습니다.

SOURCES

10. Granola, 회의록을 위한 MCP 통합 출시

Granola는 Claude 및 ChatGPT와 같은 AI 도구에 회의록을 직접 노출하는 Model Context Protocol(MCP) 통합을 출시했습니다. 이 통합을 통해 개발자는 CRM 시스템 업데이트나 Linear에서의 작업 정리와 같은 워크플로우를 비동기적으로 자동화할 수 있습니다. MCP를 사용하면 AI 봇이 실시간 통화에 참여할 필요 없이 회의 데이터를 처리할 수 있습니다.

  • Granola는 Claude 및 ChatGPT와 같은 AI 도구에 회의록을 노출하는 MCP 통합을 출시했습니다.
  • 이 통합은 CRM 시스템 업데이트나 Linear에서의 작업 정리와 같은 자동화된 워크플로우를 가능하게 합니다.
  • 회의록을 비동기적으로 처리하므로 AI 봇이 실시간 통화에 참여할 필요가 없습니다.
  • Granola는 코드 TLDR1MO를 사용하여 첫 달 서비스를 무료로 제공합니다.

개발자는 회의록을 AI 워크플로우에 직접 연결하여 봇을 실시간 통화에 초대하지 않고도 CRM 또는 Linear 업데이트와 같은 작업을 자동화할 수 있습니다.

SOURCES

11. Libretto PR 에이전트, 실패한 Playwright 스크립트 자동 수정

Saffron Health는 Playwright 브라우저 자동화를 유지 관리하기 위해 설계된 무료 오픈 소스 TypeScript 라이브러리인 Libretto PR 에이전트를 출시했습니다. 이 도구를 사용하면 에이전트가 Playwright 스크립트 실패 시 자동으로 GitHub 풀 리퀘스트를 열어 수정할 수 있습니다. CDP를 통해 실패한 브라우저 세션에 연결하고 실행 도구를 사용하여 페이지에 Playwright 및 JavaScript를 주입하여 실패 원인을 검사합니다.

  • Saffron Health는 Playwright 브라우저 자동화 유지를 위한 무료 오픈 소스 TypeScript 라이브러리인 Libretto PR 에이전트를 출시했습니다.
  • 이 도구는 Playwright 스크립트 실패 시 자동으로 GitHub 풀 리퀘스트를 열어 수정합니다.
  • 기존 스크립트에 한 줄의 코드로 통합되며 CDP를 통해 실패한 브라우저 세션에 연결됩니다.
  • 이 라이브러리는 사용자가 제공한 LLM API 키를 지원하며 자체 호스팅 옵션을 포함한 모든 브라우저 공급자와 작동합니다.

개발자는 단 한 줄의 코드로 이 라이브러리를 통합하여 AI 에이전트가 중단된 엔드투엔드 테스트를 자율적으로 디버깅하고 복구하도록 할 수 있습니다.

SOURCES

12. Atlassian, Jira에 AI 에이전트 직접 통합

Atlassian은 사용자가 Claude, Cursor, GitHub Copilot을 포함한 AI 에이전트에게 작업을 직접 할당할 수 있는 새로운 기능을 Jira에 도입했습니다. 이 통합은 관련 작업 컨텍스트를 Jira 인터페이스에서 에이전트로 직접 전달합니다. Atlassian은 이러한 새로운 기능이 44% 더 나은 에이전트 출력 결과를 제공한다고 주장합니다.

  • Atlassian은 Claude, Cursor, GitHub Copilot을 포함한 AI 에이전트에게 작업을 직접 할당할 수 있는 기능을 Jira에 추가했습니다.
  • 이 통합은 관련 작업 컨텍스트를 Jira 인터페이스에서 에이전트로 직접 전달합니다.
  • Atlassian은 새로운 기능이 44% 더 나은 에이전트 출력 결과를 제공한다고 주장합니다.

개발자는 전체 컨텍스트를 갖춘 AI 네이티브 코딩 환경 내에서 Jira 작업을 직접 수신하고 실행할 수 있습니다.

SOURCES

13. 개발자, Claude Code로 백로그 관리 자동화

한 개발자가 Claude Code를 사용하여 스스로 개선되는 루프를 설정함으로써 백로그 관리 프로세스를 자동화했습니다. 이 자동화된 시스템은 작업을 분류하고, 큰 작업을 작은 작업으로 분해하며, 코드를 구현하고, 테스트를 실행하고, 풀 리퀘스트를 여는 기능을 수행합니다. 전체 파이프라인은 월 약 110달러의 비용으로 운영되었습니다.

  • 한 개발자가 Claude Code를 사용하여 백로그 관리 프로세스를 자동화했습니다.
  • 이 시스템은 작업을 분류하고, 큰 작업을 작은 작업으로 분해하며, 코드를 구현하고, 테스트를 실행하고, 풀 리퀘스트를 엽니다.
  • 전체 자동 개선 파이프라인은 월 110달러의 비용으로 운영되었습니다.

개발자는 유사한 자동화 루프를 구현하여 작업을 분류하고, 코드를 작성하고, 테스트를 실행하고, 풀 리퀘스트를 자율적으로 열 수 있습니다.

SOURCES

14. Patter SDK, 음성 에이전트의 로컬 프로토타이핑 지원

새로운 튜토리얼은 레스토랑 예약 사례를 위해 Patter SDK를 사용하여 음성 에이전트 워크플로우를 구축하는 방법을 보여줍니다. 이 SDK를 통해 개발자는 독립적인 환경에서 음성 에이전트를 프로토타이핑하고 테스트할 수 있으며, 동적 발신자 변수를 정의하고, 호출 가능한 도구를 등록하며, 출력 가드레일을 적용할 수 있습니다. 또한 이 튜토리얼은 Twilio와 OpenAI Realtime을 사용하여 테스트된 로직을 실제 전화 통신에 배포하기 위한 템플릿을 제공합니다.

  • Patter SDK 튜토리얼은 레스토랑 예약 사례를 위한 음성 에이전트 워크플로우 구축을 설명합니다.
  • 워크플로우는 동적 발신자 변수, 호출 가능한 도구, 출력 가드레일, 시뮬레이션된 음성-텍스트/텍스트-음성 변환을 지원합니다.
  • 시스템은 지연 시간 및 비용 지표를 추적하며 회귀 테스트를 위한 결정론적 평가 하네스를 포함합니다.
  • 프로토타이핑된 로직은 Twilio와 OpenAI Realtime을 사용하여 실제 전화 통신에 배포할 수 있습니다.

개발자는 Twilio 및 OpenAI Realtime과 같은 실제 전화 통신 인프라에 배포하기 전에 독립적인 환경에서 음성 에이전트를 프로토타이핑하고 테스트할 수 있습니다.

SOURCES

15. 코딩 에이전트 평가를 위한 ReactBench v1 출시

ReactBench v1은 코딩 에이전트의 성능을 테스트하기 위해 설계된 평가 프레임워크로 출시되었습니다. 이 프레임워크는 코딩 에이전트가 현실적인 React 개발 작업을 얼마나 잘 처리하는지 구체적으로 평가하며, 개발자에게 프런트엔드 에이전트 기능에 대한 표준화된 벤치마크를 제공합니다.

  • ReactBench v1은 코딩 에이전트를 위해 특별히 설계된 평가 프레임워크입니다.
  • 이 프레임워크는 현실적인 React 개발 작업에 대한 에이전트 성능을 테스트합니다.

개발자는 이 프레임워크를 사용하여 프런트엔드 React 작업에서 다양한 코딩 에이전트의 성능을 벤치마킹하고 비교할 수 있습니다.

SOURCES

16. Open Interpreter, 코딩 에이전트 로컬 실행 지원

Open Interpreter는 코딩 에이전트를 로컬에서 실행하기 위한 오픈 소스 환경을 제공합니다. 이 소프트웨어는 웹 및 네이티브 애플리케이션 인터페이스를 모두 테스트하도록 설계되어 개발자가 로컬 머신에서 직접 UI 상호 작용을 자동화하고 평가할 수 있도록 합니다.

  • Open Interpreter는 사용자의 머신에서 코딩 에이전트를 로컬로 실행합니다.
  • 이 소프트웨어는 웹 및 네이티브 애플리케이션 인터페이스를 모두 테스트하도록 설계되었습니다.

개발자는 클라우드 호스팅 환경에 의존하지 않고 로컬 코딩 에이전트를 실행하여 사용자 인터페이스를 자동화하고 테스트할 수 있습니다.

SOURCES

17. 벤치마크 결과, llama.cpp의 DFlash 추측 디코딩으로 6배 속도 향상

llama.cpp에 DFlash 추측 디코딩 지원이 최근 통합된 것을 바탕으로, NVIDIA RTX PRO 6000 GPU에서 Qwen 3.6 27B 모델을 사용한 새로운 벤치마크에서 상당한 성능 향상이 나타났습니다. DFlash와 n-gram 룩업 드래프터를 결합하여 반복적인 코딩 작업에서 6.01배의 속도 향상을 달성했으며, 코드 유지 관리 중에는 성능이 7.5배까지 도달했습니다. 이러한 결과는 이전에 발표된 DFlash 지원의 실질적인 이점을 정량화하며, 호스트 RAM에 저장된 n-gram 룩업 테이블은 추가적인 VRAM 비용이 발생하지 않는다는 점을 강조합니다.

  • llama.cpp에서 DFlash와 n-gram 룩업 드래프터를 결합한 벤치마크는 18턴 반복 코딩 작업에서 6.01배(321.5 tok/s)의 속도 향상을 달성했습니다.
  • 기존 코드 편집을 포함하는 유지 관리 턴에서는 속도 향상이 7.5배(385 tok/s)에 도달했습니다.
  • n-gram 드래프터는 룩업 테이블을 호스트 RAM에 저장하여 추가 VRAM 비용이 전혀 발생하지 않습니다.
  • 대상 모델이 모든 드래프트 토큰을 검증하기 때문에 그리디 온도(greedy temperature)에서 출력 손실이 없습니다.
  • DFlash는 구조화된 코딩 작업에 권장되며, MTP는 채팅 및 창의적인 글쓰기에 권장됩니다.

이러한 벤치마크는 DFlash 추측 디코딩 통합의 성능 잠재력을 검증하며, 개발자가 VRAM 사용량을 늘리지 않고도 코딩 작업에서 상당한 속도 향상을 달성할 수 있음을 보여줍니다.

SOURCES

18. llama.cpp 업데이트 후 DeepSeek V4 Flash 성능 300% 향상

DeepSeek V4 지원 및 양자화된 KV 캐시 기능이 llama.cpp에 통합된 이후, 버전 b9986과 b10034 사이의 최근 업데이트로 추론 성능이 크게 향상되었습니다. 소비자용 하드웨어(AMD Ryzen 5 9600X 및 NVIDIA RTX 4060 Ti)에서 98GB DeepSeek-V4-Flash-UD-Q2_K_XL 모델을 실행하는 사용자는 생성 속도가 초당 2토큰에서 7토큰으로 증가하는 것을 확인했습니다. 이러한 성과는 131,072의 컨텍스트 크기와 레이어 기반 분할 모드를 사용하여 달성되었습니다.

  • 98GB DeepSeek-V4-Flash-UD-Q2_K_XL 모델의 생성 속도가 초당 2토큰에서 7토큰으로 향상되었습니다.
  • 성능 향상은 llama.cpp 버전 b9986과 b10034 사이의 업데이트 덕분입니다.
  • 테스트는 소비자용 하드웨어(AMD Ryzen 5 9600X, 138GB RAM, NVIDIA RTX 4060 Ti 16GB VRAM)에서 수행되었습니다.
  • 구성은 131,072 컨텍스트 윈도우와 레이어 기반 분할 모드를 활용했습니다.

이러한 성능 향상은 예산 친화적인 소비자용 하드웨어에서 대규모 고파라미터 모델을 로컬로 실행하는 것을 개발자에게 훨씬 더 실용적으로 만들어 줍니다.

SOURCES

19. EU, Google에 Android 및 검색을 경쟁 AI 어시스턴트에게 개방하도록 명령

유럽연합 집행위원회는 디지털 시장법(DMA)에 따라 Google이 Android와 Google 검색을 경쟁 AI 플랫폼에 개방하도록 요구하는 법적 구속력이 있는 조치를 발표했습니다. 이 판결에 따라 Google은 2027년 7월까지 경쟁 AI 어시스턴트가 Android의 시스템 기능, 기기 하드웨어 및 앱 상호 작용에 액세스할 수 있도록 허용해야 합니다. 또한 Google은 2027년 1월부터 경쟁 검색 엔진 및 AI 챗봇과 검색 데이터를 공유해야 합니다.

  • EU는 Google에 2027년 1월까지 검색 데이터를 공유하고 2027년 7월까지 Android 상호 운용성 변경 사항을 구현하도록 명령했습니다.
  • Android 판결은 Google이 경쟁 AI 어시스턴트에게 시스템 기능, 기기 하드웨어 및 앱 상호 작용에 대한 액세스를 허용하도록 의무화합니다.
  • 검색 판결은 Google이 경쟁 검색 엔진 및 AI 챗봇과 검색 데이터를 공유하도록 요구합니다.
  • 규정 미준수 시 유럽연합 집행위원회로부터 연간 전 세계 매출의 최대 10%에 해당하는 벌금이 부과될 수 있습니다.

ChatGPT나 Claude와 같은 대체 AI 어시스턴트 개발자들은 유럽 내 Android 기기에서 심층적인 시스템 수준 통합을 얻게 되어 Gemini의 독점적인 액세스가 종료될 것입니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.