Inference Brew

H Company, NeoMME 싱글 타워 멀티모달 인코더 출시

00:00 / --:--

← 메인으로

H Company, NeoMME 싱글 타워 멀티모달 인코더 출시

1. H Company, NeoMME 싱글 타워 멀티모달 인코더 출시

H Company는 싱글 타워 멀티모달 모델로 작동하는 260M 및 800M 파라미터 양방향 인코더 제품군인 NeoMME를 출시했습니다. 다국어 텍스트와 원시 32x32 RGB 이미지 패치를 단일 트랜스포머를 통해 처리함으로써, NeoMME는 별도의 비전 타워나 인과적 디코더가 필요하지 않습니다. 작은 크기에도 불구하고 NeoMME-Retriever-260M은 ViDoRe v3 벤치마크에서 3.75B 규모의 ColQwen2.5 모델과 대등한 성능을 보여줍니다. 이 모델들은 Apache 2.0 라이선스로 출시되었으며, 16,384 토큰 컨텍스트를 지원하고 인덱스 저장 용량을 페이지당 1.5MB에서 6kB로 압축할 수 있습니다.

  • • NeoMME 모델은 260M 및 800M 파라미터 크기로 제공되며 Apache 2.0 라이선스를 따르고 Hugging Face를 즉시 지원합니다.
  • • 싱글 타워 아키텍처는 다국어 텍스트와 원시 32x32 RGB 이미지 패치를 단일 트랜스포머로 처리하여 별도의 비전 타워를 제거했습니다.
  • • NeoMME-Retriever-260M은 ViDoRe v3 벤치마크에서 0.523 nDCG@10을 기록하며 3.75B 파라미터의 ColQwen2.5 모델과 대등한 성능을 보입니다.
  • • NVIDIA L40S에서 260M 모델은 초당 51.3페이지를 인덱싱하며, CPU 전용 호스트에서 쿼리 인코딩은 78.3ms가 소요됩니다.
  • • 계층적 토큰 풀링과 비대칭 양자화를 사용하여 인덱스 저장 요구 사항을 페이지당 1.5MB에서 6kB로 줄일 수 있습니다.

개발자들은 CPU에서 빠르게 실행되고 최소한의 인덱스 저장 공간만 차지하는 소형 모델을 사용하여 효율적인 멀티모달 검색 및 RAG 파이프라인을 구축할 수 있습니다.

SOURCES

2. XHToken, 1M 컨텍스트 윈도우를 갖춘 Spark-X2.5 모델 출시

XHToken은 긴 컨텍스트 작업을 위해 설계된 두 개의 소형 언어 모델인 Spark-X2.5-4B와 Spark-X2.5-1.7B를 출시했습니다. 작은 파라미터 크기에도 불구하고 두 모델 모두 200개 이상의 언어를 지원하며, 1개의 풀 어텐션 레이어와 3개의 슬라이딩 윈도우 어텐션 레이어를 결합한 하이브리드 어텐션 아키텍처를 통해 최대 100만 토큰의 네이티브 컨텍스트 윈도우를 제공합니다. 이 모델들은 에이전트 워크플로우를 위해 구축되었으며 Claude Code, Codex와 같은 프레임워크와 vLLM, SGLang, llama.cpp, Ollama 등의 추론 엔진과 즉시 통합됩니다.

  • • Spark-X2.5-4B 및 Spark-X2.5-1.7B 모델은 200개 이상의 언어를 지원하며 최대 100만 토큰의 네이티브 컨텍스트 윈도우를 갖추고 있습니다.
  • • 아키텍처는 1개의 풀 어텐션 레이어와 3개의 슬라이딩 윈도우 어텐션 레이어로 구성된 하이브리드 어텐션 설계를 사용합니다.
  • • 이 모델들은 Codex, Claude Code, OpenClaw, Hermes를 포함한 에이전트 하네스와 통합되어 있습니다.
  • • 지원되는 추론 프레임워크에는 vLLM, SGLang, llama.cpp, MLX, Ollama, LM Studio가 포함됩니다.
  • • 이 모델들은 NVIDIA, Huawei, Hygon, HOUMO.AI의 하드웨어 플랫폼과 호환됩니다.

개발자들은 인기 있는 에이전트 프레임워크 및 추론 엔진을 네이티브로 지원하는 소형의 긴 컨텍스트 모델을 로컬에서 실행할 수 있습니다.

SOURCES

3. UC Berkeley, 컴퓨터 사용 에이전트를 위한 CUA-Lite 출시

UC Berkeley 연구진은 컴퓨터 사용 에이전트(CUA)의 개발 및 평가를 간소화하기 위해 설계된 오픈 플랫폼 CUA-Lite를 출시했습니다. 이 플랫폼은 에이전트, 환경, 추적 및 평가 프레임워크를 단일 액션 공간과 데이터 스키마로 통합합니다. 핵심 구성 요소인 Lite.OSWorld는 무거운 가상 머신을 Docker 컨테이너로 대체하여 환경 설치 공간을 4.1GB에서 0.9GB로 줄이면서도 13개 테스트 모델에서 동일한 성능 점수를 유지합니다. CUA-Lite는 Python 3.12를 지원하며 중첩 가상화 없이 모든 Docker 호스트에 배포할 수 있습니다.

  • • CUA-Lite는 데스크톱, 브라우저 및 모바일 환경 전반에 걸쳐 단일 액션 공간과 데이터 스키마를 제공합니다.
  • • 이 플랫폼에는 OSWorld 작업을 가상 머신 대신 Docker 컨테이너에서 실행하여 설치 공간을 4.1GB에서 0.9GB로 줄인 Lite.OSWorld가 포함되어 있습니다.
  • • Lite.OSWorld 컨테이너의 성능 점수는 13개 테스트 모델 전반에서 기존 OSWorld VM과 일치합니다.
  • • 이 플랫폼은 Hugging Face에서 30,000개 이상의 검증 가능한 작업, 15개 이상의 벤치마크, 10개 이상의 에이전트, 20개 이상의 데이터셋을 제공합니다.
  • • CUA-Lite는 Python 3.12와 호환되며 중첩 가상화 요구 없이 모든 Docker 호스트에 배포할 수 있습니다.

개발자들은 평가 정확도를 희생하지 않으면서 디스크 점유율을 75% 이상 줄인 경량 Docker 기반 환경에서 컴퓨터 사용 에이전트를 구축하고 테스트할 수 있습니다.

SOURCES

4. 오픈소스 'lm-eval-ledger' 하네스, 모델 답변 시각적 비교 지원

한 개발자가 서로 다른 모델이 특정 벤치마크 질문에 어떻게 답변하는지 검사하고 비교할 수 있도록 설계된 오픈소스 벤치마크 하네스인 `lm-eval-ledger`를 출시했습니다. 이 도구는 YAML 기반으로 사용자가 여러 모델과 작업을 구성하여 단일 명령으로 실행할 수 있습니다. 시스템 프롬프트, 원시 생성물, 추출된 답변, 중단 이유 등 질문별 상세 데이터를 SQLite 데이터베이스에 저장하며, 포함된 Flask 웹 인터페이스를 사용하여 나란히 비교할 수 있습니다. 이 도구는 vLLM, SGLang, Hugging Face 및 llama.cpp 백엔드를 지원합니다.

  • • 이 도구는 YAML 기반으로 사용자가 구성 파일에 여러 모델과 작업을 정의하여 단일 명령으로 벤치마크를 실행할 수 있습니다.
  • • 벤치마크 데이터를 SQLite 데이터베이스에 저장하고 Flask 애플리케이션을 사용하여 모델 답변을 시각화하고 비교합니다.
  • • 하네스는 시스템 프롬프트, 모델 생성물, 추출된 답변, 정답, 중단 이유를 포함한 질문별 데이터를 기록합니다.
  • • Linux와 Windows 모두에서 vLLM, SGLang, Hugging Face, llama.cpp를 포함한 백엔드를 지원합니다.
  • • 단일 5090 GPU에서 실행된 초기 벤치마크는 Qwen3.5-9B, NVIDIA-Nemotron-3.5-Lightning, Gemma-4-12B-it을 비교했습니다.

개발자들은 벤치마크 전반에서 정확한 모델 출력을 시각적으로 검사하고 비교하여 단순 점수 이상의 모델 성공 및 실패 원인을 파악할 수 있습니다.

SOURCES

5. 오픈소스 'cache-pressure' 도구, 로컬 LLM KV 캐시 제거 검증

로컬 LLM 배포 환경에서 KV 캐시 관리 성능을 검증하고 측정할 수 있도록 돕는 `cache-pressure`라는 오픈소스 도구가 출시되었습니다. 이 도구는 캐시 기대치를 보정하고, 안정적인 컨텍스트로 캐시를 채운 뒤, 역순으로 캐시 적중을 검증하여 이전 컨텍스트가 정확히 어떻게 제거되는지 확인하는 방식으로 작동합니다. 이 도구의 제작자는 이를 사용하여 vLLM의 캐시 관리 버그를 식별하고 해결했으며, 부하 상태에서 유지되는 토큰 수를 약 100만 개에서 300만 개 이상으로 늘렸습니다. 이 도구는 vLLM, ninfer, llama.cpp, SGLang과 호환됩니다.

  • • 이 도구는 캐시 기대치를 보정하고, 안정적인 컨텍스트로 캐시를 채운 뒤, 역순으로 캐시 적중을 검증하는 방식으로 작동합니다.
  • • 제작자는 이 도구를 사용하여 vLLM의 캐시 관리 문제를 식별하고 수정하여 부하 상태에서 유지되는 토큰 수를 1,052,025개에서 3,000,048개로 늘렸습니다.
  • • 이 도구는 vLLM, ninfer, llama.cpp, SGLang을 포함한 여러 추론 엔진과 호환됩니다.
  • • 이 도구를 실행하면 대상 배포 환경의 기존 캐시된 컨텍스트가 모두 제거됩니다.

개발자들은 로컬 추론 엔진의 보이지 않는 컨텍스트 제거 버그를 식별하고 해결하여 높은 부하 상태에서도 안정적인 긴 컨텍스트 성능을 보장할 수 있습니다.

SOURCES

6. 8종의 Abliterated Qwen 3.8 27B 변형 모델 평가 비교

Qwen 3.8 27B 모델의 8종의 Abliterated(검열되지 않은) 변형 모델을 평가한 상세 연구는 다양한 검열 해제 기술의 장단점을 강조합니다. 167 GPU 시간을 사용하여 11일 동안 진행된 이 연구에 따르면, 정밀한 편집이 일반적으로 과도한 편집보다 성능이 우수한 것으로 나타났습니다. 과도한 편집은 모델이 사고 루프를 종료하지 못하게 만드는 경우가 많았습니다(예: 'obliteratus' 변형의 경우 응답의 44.8%가 완료되지 않음). 'orcarouter' 변형은 HarmBench 공격 성공률 82.2%로 가장 높았으며, 'apostate' 변형은 낮은 KL 발산과 거의 동일한 기능 사이에서 강력한 균형을 제공했습니다.

  • • 11일 동안 약 167 GPU 시간을 사용하여 Qwen 3.8 27B의 8종의 Abliterated 변형 모델을 평가했습니다.
  • • 방법론에는 가중치 비교, KL 발산 측정, 13개 벤치마크, HarmBench 400 클래식이 포함되었습니다.
  • • 'orcarouter' 변형은 82.2%의 가장 높은 HarmBench 공격 성공률(ASR)을 기록했으며 완전히 검증된 가중치를 가진 유일한 모델이었습니다.
  • • 'apostate' 변형은 78.7%의 ASR을 달성했으며 낮은 KL 발산과 거의 동일한 기능으로 주목받았습니다.
  • • 'obliteratus' 변형은 과도한 편집으로 인해 응답의 44.8%가 사고 과정을 완료하지 못했으므로 피해야 합니다.
  • • 'blackfrost' 변형에는 채팅 템플릿 내에 1457자 분량의 공개되지 않은 탈옥 시스템 프롬프트가 포함되어 있는 것으로 밝혀졌습니다.

검열되지 않은 로컬 모델을 배포하는 개발자들은 추론 능력을 유지하고 과도한 편집으로 인한 사고 루프 오류를 방지하는 변형 모델을 선택할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.