Inference Brew

OpenAI, Sol, Terra, Luna 사이버 보안 모델 정식 출시

00:00 / --:--

← 메인으로

OpenAI, Sol, Terra, Luna 사이버 보안 모델 정식 출시

1. OpenAI, Sol, Terra, Luna 사이버 보안 모델 정식 출시

2026년 6월 26일에 시작된 제한적 프리뷰를 바탕으로, OpenAI는 사이버 보안에 특화된 Sol, Terra, Luna 모델을 공식 출시했습니다. 접근 권한은 미국 정부의 지침에 따라 검증된 기관으로 제한됩니다. 이와 동시에 2026년 6월 9일에 처음 소개된 Anthropic의 Mythos 모델에 대한 새로운 세부 정보가 공개되었습니다. Mythos는 영국 AI 안전 연구소(UK AI Security Institute)의 'The Last One' 사이버 레인지 테스트를 통과한 최초의 모델이 되었습니다. 그러나 이 모델은 여전히 자원 집약적입니다. Anthropic의 레드팀 보고에 따르면, 단 하나의 OpenBSD 취약점을 식별하는 데 약 2만 달러의 비용이 드는 1,000회의 모델 실행이 필요했습니다.

  • OpenAI는 2026년 6월 27일부로 Sol, Terra, Luna 모델을 제한적 프리뷰에서 정식 출시로 전환했습니다.
  • OpenAI의 새 모델과 Anthropic의 Mythos 모두 정부 검증을 받은 기관으로 접근이 제한됩니다.
  • Anthropic의 Mythos는 영국 AI 안전 연구소의 'The Last One' 사이버 레인지 테스트를 통과한 최초의 모델입니다.
  • 레드팀 테스트 결과, Mythos를 사용하여 OpenBSD 취약점을 찾는 데 약 2만 달러의 비용과 1,000회의 모델 실행이 필요한 것으로 나타났습니다.

프리뷰에서 정식 출시로 전환됨에 따라 검증된 개발자들은 OpenAI의 방어 모델에 즉시 접근할 수 있게 되었으며, 새로운 벤치마크를 통해 고성능 자동 취약점 탐색에 필요한 막대한 재정적 및 컴퓨팅 투자가 명확해졌습니다.

SOURCES

2. DeepSeek, DeepSeek-V4용 추측 디코딩(Speculative Decoding)이 포함된 DSpark 체크포인트 출시

DeepSeek는 Hugging Face를 통해 DeepSeek-V4 Flash 및 Pro 모델용 DSpark 체크포인트를 출시했습니다. 이 체크포인트에는 토큰 생성 속도를 가속화하기 위해 설계된 통합 추측 디코딩 모듈이 포함되어 있습니다. DeepSeek에 따르면, Flash 모델은 실시간 트래픽 환경에서 60%에서 85% 더 빠른 생성 속도를 제공하여 개발자들에게 실시간 애플리케이션을 위한 상당한 지연 시간 감소 효과를 제공합니다.

  • DeepSeek는 Hugging Face에 DeepSeek-V4 Flash 및 DeepSeek-V4 Pro용 DSpark 체크포인트를 출시했습니다.
  • DSpark 체크포인트는 토큰 생성을 가속화하는 통합 추측 디코딩 모듈을 특징으로 합니다.
  • DeepSeek-V4 Flash 모델은 실시간 트래픽 환경에서 60%~85% 더 빠른 생성 속도를 달성합니다.
  • DSpark 방법론에 대한 자세한 연구 논문은 DeepSpec GitHub 저장소에서 확인할 수 있습니다.

DeepSeek-V4를 사용하는 개발자들은 핵심 모델 아키텍처를 변경하지 않고도 이 새로운 체크포인트를 배포하여 지연 시간을 크게 줄이고 추론 속도를 높일 수 있습니다.

SOURCES

3. Sakana AI, API 오케스트레이션을 위한 Fugu 및 새로운 중국 보안 모델 출시

미국의 수출 통제가 강화됨에 따라 국제 AI 기업들이 현지화된 대안을 출시하고 있습니다. 도쿄의 Sakana AI는 일본 기업들이 운영 연속성을 유지할 수 있도록 돕기 위해 다른 모델 전반의 API 접근을 오케스트레이션하도록 설계된 프론티어 모델 Fugu를 출시했습니다. 동시에 중국 사이버 보안 기업 360은 소프트웨어 취약점 탐색을 자동화하는 'Tulongfeng'과 자동화된 사이버 방어 및 사고 대응을 위해 설계된 'Yitianzhen'이라는 두 가지 특화 AI 도구를 도입했습니다.

  • Sakana AI는 API를 통해 다른 모델에 대한 접근을 오케스트레이션하도록 설계된 프론티어 모델 Fugu를 출시했습니다.
  • Fugu는 강화되는 미국 수출 통제에 대한 노출을 줄이기 위해 일본 기업 및 정부 기관을 대상으로 합니다.
  • 중국 사이버 보안 기업 360은 자동화된 소프트웨어 취약점 탐색을 위한 Tulongfeng과 자동화된 사이버 방어를 위한 Yitianzhen을 공개했습니다.
  • Sakana AI는 2023년 전 구글 연구원인 Ren Ito, Llion Jones, David Ha가 공동 창립했습니다.
  • Anthropic의 2026년 5월 기준 연간 매출액은 470억 달러에 달하는 것으로 알려졌습니다.

탄력적인 다중 모델 아키텍처를 구축하려는 개발자들은 Sakana의 Fugu를 활용하여 API 호출을 오케스트레이션하고 강화되는 미국 수출 통제로 인한 위험을 완화할 수 있습니다.

4. Spectral Labs, 고충실도 Qwen3.5 양자화를 위한 SpectralQuant 출시

Spectral Labs는 새로운 보정 인식 양자화 기술인 SpectralQuant로 양자화된 Qwen3.5 0.8B의 릴리스 후보 버전을 출시했습니다. 보정 신호를 사용하여 모델 내 행동에 민감한 방향을 식별하고 보호함으로써, SpectralQuant는 양자화 오류를 조정하여 heldout120 평가 제품군에서 표준 Q4와 BF16 간의 성능 격차 중 96.5%를 복구합니다. 결과물인 GGUF 모델은 가중치당 4.52비트로 실행되며, 복잡한 혼합 정밀도 사이드카 없이도 네이티브 llama.cpp 호환성을 유지하면서 유사한 Unsloth 변형보다 뛰어난 성능을 보입니다.

  • Spectral Labs는 새로운 SpectralQuant 방식으로 양자화된 Qwen3.5 0.8B의 릴리스 후보를 출시했습니다.
  • SpectralQuant는 보정 신호를 사용하여 행동에 민감한 방향을 따라 양자화 오류를 조정합니다.
  • 이 모델은 heldout120 평가 제품군에서 표준 Q4와 BF16 간의 성능 격차 중 96.5%를 복구합니다.
  • 양자화된 모델은 표준 llama.cpp와 완전히 호환되며 혼합 정밀도 사이드카가 필요하지 않습니다.
  • 가중치당 4.52비트(BPW)에서 이 모델은 동일한 평가 제품군에서 여러 Unsloth 양자화 변형보다 뛰어난 성능을 보였습니다.

저자원 또는 엣지 장치를 대상으로 하는 개발자들은 4비트 양자화에서 흔히 발생하는 성능 저하 없이 표준 GGUF 런타임을 사용하여 매우 정확하고 초소형인 모델을 배포할 수 있습니다.

SOURCES

5. 가짜 면접 사기, 난독화된 PinpinRAT 멀웨어로 개발자 공격

정교한 가짜 면접 사기가 로컬 머신과 업스트림 패키지 레지스트리를 손상시키기 위해 소프트웨어 개발자들을 적극적으로 노리고 있습니다. 'Lua Ventures'와 같은 가짜 페르소나로 활동하는 공격자들은 개발자들에게 TypeScript 저장소 작업을 제안하는데, 이 저장소에는 patch-package 파일(특히 typescript+5.9.2.patch) 내부에 숨겨진 멀웨어가 포함되어 있습니다. 'PinpinRAT'으로 명명된 이 페이로드는 현재 VirusTotal의 모든 백신 엔진을 우회하는 난독화된 자체 실행 base64 스텁을 사용합니다. 개발자들은 LLM이 생성한 연락, .cc 도메인, 면접 코드베이스 내의 예상치 못한 패치 파일과 같은 위험 신호에 주의해야 합니다.

  • 반복되는 가짜 면접 사기가 Lua Ventures와 같은 가짜 벤처 캐피털 페르소나를 사용하여 개발자를 노립니다.
  • 공격 벡터는 patch-package 파일(typescript+5.9.2.patch) 내부에 숨겨진 악성 코드가 포함된 TypeScript 저장소입니다.
  • PinpinRAT이라는 멀웨어는 현재 VirusTotal에서 탐지되지 않는 자체 실행 base64 난독화 스텁을 사용합니다.
  • 이 캠페인은 개발자 머신에 백도어를 설치하고 crates.io와 같은 레지스트리의 업스트림 패키지를 손상시키는 것을 목표로 합니다.
  • 위험 신호로는 의심스러운 LinkedIn 프로필, .cc 도메인을 사용하는 통신, LLM이 생성한 텍스트 등이 있습니다.

개발자들은 외부 저장소가 포함된 기술 면접 시 극도로 주의해야 합니다. 이 캠페인은 특히 로컬 머신과 crates.io와 같은 업스트림 패키지 레지스트리를 손상시키려 하기 때문입니다.

SOURCES

6. Claude Code, 엔지니어링 생산성 3배 향상 및 개발 병목 현상 변화

에이전트 코딩 도구의 광범위한 채택은 소프트웨어 엔지니어링 워크플로우와 팀 역학을 근본적으로 변화시키고 있습니다. Anthropic은 Claude Code가 엔지니어링 결과물을 효과적으로 3배 증가시켜, 주요 병목 현상을 '코드 작성'에서 '무엇을 만들지 결정하는 것'으로 옮겼다고 보고합니다. 실제 구현 사례가 이를 뒷받침합니다. 한 AWS 팀은 18개월짜리 재설계 프로젝트를 계획된 인원의 일부만 사용하여 76일 만에 완료했으며, 아마존의 Kiro IDE 팀은 기능 구축 시간을 2주에서 2일로 단축했습니다. 이러한 변화는 개발자가 개발 파이프라인에서 직접 지속적, 예약 또는 웹훅 트리거 에이전트를 실행할 수 있게 해주는 Claude Code Routines와 같은 도구에 의해 뒷받침됩니다.

  • Anthropic은 Claude Code가 엔지니어링 결과물을 실제 인원의 약 3배로 증가시켜 개발 병목 현상을 제품 정의 단계로 옮겼다고 보고합니다.
  • AWS 엔지니어링 팀은 원래 계획된 30명이 아닌 6명의 엔지니어를 사용하여 18개월짜리 재설계 프로젝트를 76일 만에 완료했습니다.
  • 아마존의 Kiro IDE 팀은 사양 중심 워크플로우를 채택하여 기능 구축 시간을 2주에서 2일로 단축했습니다.
  • 2026년 4월에 출시된 Anthropic의 Claude Code Routines는 개발자가 일정에 따라 또는 웹훅을 통해 실행되는 지속적 에이전트를 배포할 수 있게 합니다.
  • 이러한 생산성 급증으로 인해 전통적인 제품 관리자 대 엔지니어 비율이 1:8에서 약 1:20으로 변화했습니다.

개발자들은 사양 중심 워크플로우와 지속적 에이전트를 활용하여 프로젝트 일정을 획기적으로 단축할 수 있으며, 이는 18개월 프로젝트를 3개월 미만으로 줄인 팀들의 사례에서 입증되었습니다.

SOURCES

7. 새로운 hf-claude 도구, Claude Code에 대한 다중 모델 지원 자동화

GLM-5.2를 Claude Code와 함께 사용하기 위한 이전의 수동 통합 가이드를 이어받아, 새로운 hf-claude 유틸리티가 이제 이 과정을 자동화합니다. 이 도구를 사용하면 개발자는 복잡한 환경 변수 구성 없이 DeepSeek V4 Pro, Minimax-m3, GLM 5.2를 포함한 100개 이상의 오픈 가중치 모델을 Claude Code CLI 내에서 직접 실행할 수 있습니다.

  • hf-claude 도구는 100개 이상의 오픈 모델을 Claude Code에 통합하는 과정을 자동화합니다.
  • GLM 5.2와 같은 모델을 사용하기 위해 이전에 필요했던 수동 구성 과정을 대체합니다.
  • 지원되는 모델에는 DeepSeek V4 Pro, Minimax-m3, GLM 5.2가 포함됩니다.
  • 개발자는 기존 Claude Code 워크플로우를 유지하면서 대체 백엔드 간을 쉽게 전환할 수 있습니다.

이 도구는 수동 설정 부담을 제거하여 비용이나 성능 최적화를 위해 Claude Code 백엔드를 교체하는 것을 훨씬 쉽게 만듭니다.

SOURCES

8. 오픈 소스 claude_converter, Claude Code 세션을 파인튜닝 데이터로 변환

자신의 개인 코딩 스타일에 맞춰 로컬 모델을 학습시키려는 개발자들은 이제 무종속성 Python 유틸리티인 claude_converter를 사용할 수 있습니다. 이 도구는 ~/.claude/projects/ 디렉토리에서 로컬 Claude Code CLI 세션 기록을 추출하고, 원시 JSONL 파일을 TRL, Axolotl, LLaMA-Factory와 같은 인기 있는 파인튜닝 라이브러리와 호환되는 표준 채팅 형식으로 변환합니다. 고품질 학습 데이터를 보장하기 위해 이 도구에는 세션을 정리하고 검사하는 도우미가 포함되어 있지만, 개발자는 학습 파이프라인을 실행하기 전에 실패한 시도나 재시도가 포함된 세션을 필터링하는 것이 좋습니다.

  • claude_converter 도구는 ~/.claude/projects/ 디렉토리에 저장된 로컬 Claude Code 세션 파일(.jsonl)을 파싱합니다.
  • 세션을 TRL, Axolotl, LLaMA-Factory와 같은 학습 프레임워크를 위한 apply_chat_template()과 호환되는 표준 메시지 구조로 형식화합니다.
  • 이 도구는 종속성이 없으며 uv pip install claude-converter를 사용하여 즉시 설치할 수 있습니다.
  • 원치 않는 블록을 제거하는 clean_messages()와 토큰 수를 분석하는 inspect_session()과 같은 도우미 함수가 포함되어 있습니다.
  • 개발자는 최종 어시스턴트 턴이 코딩 문제를 성공적으로 해결한 세션만 포함하도록 필터링하는 것이 좋습니다.

개발자들은 자신의 실제 코딩 워크플로우와 성공적인 문제 해결 궤적을 캡처하여 자신의 코드베이스 패턴에 맞춰 더 작고 작업 특화된 로컬 모델을 파인튜닝할 수 있습니다.

SOURCES

9. 오픈 소스 Adrafinil, 활성 에이전트 작업 중 MacBook 깨어 있음 유지

macOS에서 장기 실행 에이전트 작업을 수행하는 개발자들은 이제 덮개가 닫혀 있어도 MacBook을 깨어 있게 하도록 설계된 오픈 소스 유틸리티인 Adrafinil을 사용할 수 있습니다. Claude Code 및 Codex와 같은 활성 개발자 도구에 연결하여, Adrafinil은 pmset을 사용하여 시스템 잠자기 설정을 동적으로 전환하고 에이전트가 작업을 마치거나 하드웨어가 과열되기 시작하면 자동으로 기본 동작을 복원합니다. 이 유틸리티는 선택적 MCP(Model Context Protocol) 서버를 제공하여 에이전트가 호스트 머신이 지정된 시간 동안 깨어 있도록 프로그래밍 방식으로 요청할 수 있게 합니다.

  • Adrafinil은 활성 AI 에이전트 작업 중 잠자기 설정을 관리하도록 설계된 MIT 라이선스 오픈 소스 macOS 애플리케이션입니다.
  • 이 앱은 Claude Code 및 Codex와 같은 도구에서 에이전트 활동을 감지하면 자동으로 잠자기를 비활성화하고, 작업이 끝나거나 장치가 과열되면 다시 활성화합니다.
  • 에이전트가 특정 기간 동안 깨어 있기를 프로그래밍 방식으로 요청할 수 있는 선택적 MCP(Model Context Protocol) 서버가 포함되어 있습니다.
  • 이 소프트웨어는 시스템 잠자기 명령을 안전하게 실행하기 위한 공증된 루트 도우미를 포함하여 4개의 바이너리로 구성됩니다.

Claude Code나 Codex에서 장기 실행 로컬 에이전트 작업을 수행하는 개발자들은 작업을 중단하지 않고 노트북을 닫을 수 있어 조기 작업 종료를 방지할 수 있습니다.

SOURCES

10. BrowserBC, 브라우저 기록을 에이전트 기술로 변환하는 시스템 오픈 소스화

강력한 웹 자동화 에이전트를 구축하려면 종종 지루한 스크립팅이 필요하지만, 새로 오픈 소스화된 BrowserBC 시스템은 이 과정을 단순화하는 것을 목표로 합니다. BrowserBC는 인간의 브라우저 궤적을 재사용 가능한 에이전트 기술로 직접 변환하며, 단 한 번의 사용자 기록에서 기능적 기술을 일반화하는 능력을 보여줍니다. GitHub에 코드베이스와 문서를 오픈 소스로 공개함으로써, 이 프로젝트는 개발자들에게 웹 기반 자동화 에이전트의 학습 및 배포를 가속화할 수 있는 실용적인 프레임워크를 제공합니다.

  • BrowserBC는 인간의 브라우저 궤적을 재사용 가능한 에이전트 기술로 변환하는 오픈 소스 시스템입니다.
  • 이 시스템은 단 한 번의 사용자 기록만으로 새로운 기술을 일반화할 수 있습니다.
  • 프로젝트의 전체 소스 코드와 문서는 GitHub에서 이용할 수 있습니다.

웹 자동화 에이전트를 구축하는 개발자들은 복잡한 브라우저 상호 작용 스크립트를 수동으로 프로그래밍할 필요 없이 작업을 한 번 기록하는 것만으로 에이전트의 기능을 빠르게 확장할 수 있습니다.

SOURCES

11. Qwen 3.6 27B로 구축된 로컬 에이전트 문서 수정 시스템

민감한 문서를 로컬에서 처리하려는 개발자들은 새로 오픈 소스화된 에이전트 수정 파이프라인을 활용할 수 있습니다. doc_redaction GitHub 저장소에 호스팅된 이 시스템은 40GB VRAM 설정에서 완전히 오프라인으로 실행되며, Q6 양자화된 Qwen 3.6 27B 모델을 OCR 엔진(Tesseract 및 PaddleOCR) 및 Microsoft Presidio와 결합합니다. 로컬 모델을 최소한의 에이전트 하네스로 감싸서, 이 시스템은 이메일 샘플에서 10/10, 22페이지 정책 문서에서 8/10의 점수를 기록하며 높은 정확도를 달성하는 동시에 기존의 비에이전트 수정 워크플로우보다 20%의 추가 시간 절감 효과를 제공합니다.

  • 이 시스템은 Q6 양자화된 Qwen 3.6 27B 모델을 활용하여 40GB VRAM 설정에서 완전히 로컬로 실행됩니다.
  • 아키텍처는 초기 PII 식별을 위해 Microsoft Presidio와 함께 OCR 엔진(Tesseract 및 PaddleOCR)을 통합합니다.
  • 평가에서 에이전트 수정 시스템은 이메일 예제에서 10/10, 복잡한 22페이지 정책 문서에서 8/10을 기록했습니다.
  • 에이전트 하네스는 표준 비에이전트 수정 도구가 달성한 60% 절감 효과에 더해 20%의 추가 시간 절감을 제공합니다.
  • 전체 소스 코드와 방법론은 doc_redaction GitHub 저장소에 오픈 소스로 공개되었습니다.

민감한 기업 문서를 다루는 개발자들은 이 로컬 에이전트 파이프라인을 배포하여 API 비용을 발생시키거나 타사 클라우드 제공업체에 데이터를 노출할 위험 없이 PII 수정을 자동화할 수 있습니다.

SOURCES

12. CLI-Universe, 검증 가능한 터미널 에이전트 작업 합성

CLI-Universe는 강력한 에이전트 평가의 필요성을 해결하기 위해 실제 자료를 사용하여 검증 가능한 터미널 에이전트 작업을 합성하도록 설계된 엔진을 출시했습니다. 그 유용성을 입증하기 위해 개발자들은 엔진이 생성한 6,000개의 궤적에 대해 Qwen3-32B 모델을 파인튜닝했습니다. 결과 모델은 Terminal-Bench 2.0에서 33.4%의 점수를 달성하여 10배 더 큰 모델들을 능가했으며, 터미널 기반 자동화를 위한 타겟 파인튜닝의 효과를 강조했습니다.

  • CLI-Universe는 실제 자료에 기반한 검증 가능한 터미널 에이전트 작업을 합성하도록 설계된 새로운 엔진입니다.
  • 6,000개의 궤적에 대해 파인튜닝된 Qwen3-32B 모델은 Terminal-Bench 2.0 벤치마크에서 33.4%의 점수를 달성했습니다.
  • 파인튜닝된 32B 모델은 터미널 벤치마크에서 10배 더 큰 모델들보다 뛰어난 성능을 보였습니다.

터미널 기반 에이전트를 구축하는 개발자들은 CLI-Universe를 사용하여 현실적인 학습 데이터와 벤치마크를 생성할 수 있으며, 작업 특화 파인튜닝된 소형 모델이 거대한 프론티어 모델을 이길 수 있음을 증명할 수 있습니다.

SOURCES

13. 모델 레지스트리, 오픈 가중치 모델을 위한 토렌트 배포 시작

거대한 오픈 가중치 모델을 다운로드하는 것은 느리고 대역폭을 많이 소모할 수 있으며, 이는 인기 있는 모델을 BitTorrent를 통해 배포하는 실험적 플랫폼인 modelregistry.io의 생성으로 이어졌습니다. 신뢰성을 보장하기 위해 이 프로젝트는 웹 시드 지원을 구현하여 활성 피어가 없을 때 BitTorrent 클라이언트를 Hugging Face 엔드포인트로 자동으로 리디렉션합니다. 이 시스템은 실험 단계에서 가끔 CDN 오류가 발생하지만, 대용량 모델 파일을 빠르게 확보하려는 개발자들에게 유망한 탈중앙화 대안을 제공합니다.

  • Modelregistry.io는 BitTorrent를 통해 인기 있는 오픈 가중치 모델을 공유하고 다운로드하기 위한 새로운 플랫폼입니다.
  • 이 시스템은 Hugging Face를 폴백 웹 시드로 통합하여 피어가 활성화되지 않을 때 토렌트 클라이언트를 Hugging Face 엔드포인트로 리디렉션합니다.
  • 사용자 지정 백엔드는 대상 모델 파일이 Hugging Face의 LFS(Large File Storage)에 저장되어 있는지 여부에 따라 리디렉션을 처리합니다.
  • 이 프로젝트는 현재 실험적이며 Hugging Face CDN 오류로 인해 가끔 재시도가 필요합니다.

거대한 모델 가중치를 다운로드하는 개발자들은 더 빠르고 탈중앙화된 다운로드 속도를 달성하는 동시에 피어 가용성이 낮을 때 강력한 Hugging Face 폴백에 의존할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.