Inference Brew

OpenBMB, 온디바이스 모델 MiniCPM5-2B 출시

00:00 / --:--

← 메인으로

OpenBMB, 온디바이스 모델 MiniCPM5-2B 출시

1. OpenBMB, 온디바이스 모델 MiniCPM5-2B 출시

OpenBMB의 MiniCPM5-2B는 온디바이스 환경에서 효율적으로 실행되도록 설계된 고도로 최적화된 밀집 인과 언어 모델입니다. 4,000억 개의 토큰을 사용한 지도 미세 조정(SFT)과 16개 강화 학습 전문가의 온폴리시 증류 과정을 거쳐 구축된 이 모델은 도구 사용, 코딩 에이전트, 긴 컨텍스트 검색 분야에서 강력한 성능을 발휘합니다. 34개 벤치마크 평균에서 Qwen3.5-4B 베이스라인을 능가하며, Artificial Analysis Intelligence Index 기준 작업당 19k 출력 토큰만을 사용하는 높은 토큰 효율성을 보여줍니다.

  • • MiniCPM5-2B는 Apache 2.0 라이선스로 출시된 25.2억 파라미터 밀집 모델입니다.
  • • 131,072 토큰의 네이티브 컨텍스트 윈도우와 그룹 쿼리 어텐션(GQA)을 적용한 42개 레이어 아키텍처를 갖추고 있습니다.
  • • Artificial Analysis Intelligence Index v4.2에서 15점을 기록하며 40억 파라미터 미만 오픈 웨이트 모델 중 최고 점수를 달성했습니다.
  • • vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX 등 표준 런타임과 호환됩니다.
  • • OpenBMB는 모델 가중치와 함께 중간 체크포인트 및 Ultra-FineWeb, UltraX와 같은 데이터셋을 공개했습니다.

이 모델은 개발자들에게 소비자용 하드웨어에서 로컬 에이전트 워크플로우와 긴 컨텍스트 검색을 수행할 수 있는 고성능, 고효율의 완전 오픈 웨이트 옵션을 제공합니다.

2. Tencent, 시각적 문서 검색 모델 EVIE 출시

Tencent의 새로운 EVIE-8B 및 EVIE-4.5B 모델은 RAG 파이프라인 내 시각적 문서 검색의 과제를 해결합니다. 문서 페이지를 시각적으로 표현함으로써 텍스트 전용 파서가 종종 손실하는 중요한 레이아웃, 표, 타이포그래피 정보를 보존합니다. 특히 EVIE-4.5B 모델은 동적 차원 절단을 위한 Prefix-MRL 탄력성과 페이지를 32개의 벡터로 압축하는 고급 클러스터링 기능을 갖추어 프로덕션 환경에 최적화되었으며, 벡터 데이터베이스 저장 비용을 획기적으로 절감합니다.

  • • EVIE-8B는 ViDoRe V3 벤치마크에서 66.75 nDCG@10이라는 최첨단 검색 성능을 달성했습니다.
  • • 4096차원 표현을 활용하여 타이포그래피, 차트, 표와 같은 미세한 세부 정보를 보존합니다.
  • • EVIE-4.5B는 Prefix-MRL 탄력성을 지원하여 런타임 시 64에서 2048 사이의 차원 절단이 가능합니다.
  • • EVIE-4.5B는 계층적 응집 클러스터링(HAC)을 사용하여 페이지당 토큰 수를 32개의 벡터로 압축합니다.
  • • 이 압축 기술을 통해 백만 페이지당 인덱스 저장 요구 사항을 3.81 GiB로 줄였습니다.

이 모델들을 통해 개발자는 방대한 저장 공간 오버헤드 없이 복잡한 문서 레이아웃, 차트, 표를 보존하는 고정밀 시각적 RAG 파이프라인을 구축할 수 있습니다.

SOURCES

3. Engrim, AI CLI를 위한 로컬 우선 SQLite 메모리 엔진 출시

Tim Gordon이 개발한 Engrim은 동일한 코드베이스에서 여러 AI 코딩 어시스턴트를 사용할 때 발생하는 컨텍스트 파편화 문제를 해결합니다. 범용적인 로컬 우선 메모리 계층으로 작동하여 Cursor나 Claude Code와 같은 도구 전반에서 아키텍처 결정과 프로젝트 상태가 보존되도록 합니다. 이 엔진은 키워드 검색과 경량 벡터 임베딩을 결합하여 빠른 컨텍스트 로딩을 지원하며, 오프라인 우선 아키텍처를 통해 민감한 코드베이스 메타데이터가 개발자의 로컬 머신에 안전하게 유지되도록 보장합니다.

  • • Engrim은 MIT 라이선스로 제공되는 프로젝트 범위의 로컬 우선 메모리 엔진입니다.
  • • Claude Code, Cursor, Windsurf, Google Antigravity 등 다양한 환경을 지원합니다.
  • • SQLite FTS5 키워드 검색과 model2vec 정적 벡터 임베딩을 결합한 하이브리드 검색을 사용합니다.
  • • 완전히 오프라인으로 작동하며, ~/.engrim/memory.db에 제한된 권한의 SQLite 파일로 데이터를 저장합니다.
  • • Engrim은 각 메모리 항목의 출처를 추적하여 어떤 에이전트나 사용자가 생성했는지 식별합니다.

개발자는 Engrim을 사용하여 데이터 유출 없이 Claude Code, Cursor, Windsurf 등 다양한 코딩 도구 간에 일관된 컨텍스트와 상태를 유지할 수 있습니다.

SOURCES

4. 에이전트 피드백을 위한 LLM-as-a-Verifier 프레임워크 출시

오픈 소스 LLM-as-a-Verifier 프레임워크는 AI 에이전트의 신뢰성을 높이기 위한 학습이 필요 없는 방법을 제공합니다. 단계별 상세 피드백을 생성함으로써 개발자는 에이전트 파이프라인 내에서 직접 테스트 타임 스케일링과 진행 상황 추적을 구현할 수 있습니다. 이 시스템은 소프트웨어 엔지니어링 및 로봇 공학을 포함한 다양한 분야에서 최첨단 결과를 입증했으며, 복잡한 다단계 에이전트를 구축하는 개발자에게 다재다능한 도구가 됩니다.

  • • LLM-as-a-Verifier는 GitHub에서 제공되는 범용 학습 불필요 프레임워크입니다.
  • • 에이전트 워크플로우를 안내하고 수정하기 위한 세밀한 피드백을 제공합니다.
  • • 코딩, 로봇 공학, 의료 에이전트 벤치마크 전반에서 최첨단 성능을 달성합니다.
  • • 검증자로부터 받은 피드백은 테스트 타임 스케일링과 강화 학습에 직접 적용할 수 있습니다.

개발자는 이 프레임워크를 통합하여 미세 조정의 오버헤드 없이 에이전트를 위한 테스트 타임 스케일링, 진행 상황 추적 및 강화 학습을 구현할 수 있습니다.

SOURCES

5. FreeCAD MCP 서버, AI 어시스턴트와 CAD 워크플로우 통합

freecad-mcp 프로젝트는 Model Context Protocol을 컴퓨터 지원 설계(CAD)에 도입하여 개발자가 로컬 AI 에이전트를 통해 FreeCAD를 제어할 수 있도록 합니다. MCP 서버를 설정하고 FreeCAD 내에서 동반 RPC 서버를 시작하면, 개발자는 자연어 프롬프트를 로컬 모델에 전달하여 복잡한 기하학적 설계 작업을 실행할 수 있습니다. 또한 시각적 기능을 갖춘 GGUF 모델을 활용하면 어시스턴트가 FreeCAD 스크린샷을 시각적으로 검사하여 기하학적 작업이 올바르게 수행되었는지 확인할 수 있습니다.

  • • freecad-mcp 프로젝트는 FreeCAD와 AI 모델링 어시스턴트를 통합하는 애드온입니다.
  • • MCP 서버 구성을 통해 llama.cpp나 pi와 같은 로컬 런타임을 모델링 어시스턴트로 사용할 수 있습니다.
  • • 시스템에는 AI 어시스턴트와의 통신을 처리하기 위해 FreeCAD 내부에 RPC 서버가 포함되어 있습니다.
  • • --mmproj 옵션으로 멀티미디어 지원 모델을 로드하면 AI가 스크린샷을 분석하여 기하학적 작업을 검증할 수 있습니다.
  • • 필수 조건으로 FreeCAD, llama.cpp, GGUF 모델, uv 패키지 관리자가 필요합니다.

이 통합을 통해 개발자는 자연어 명령을 사용하여 물리적 3D 모델을 생성, 수정 및 검증할 수 있는 에이전트 워크플로우를 구축할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.