1. Mistral AI, Lean 4 코드 검증을 위한 Leanstral 1.5 출시
Mistral AI의 새로운 Leanstral 1.5는 총 119B 파라미터, 토큰당 6.5B 활성 파라미터를 가진 Mixture-of-Experts 모델입니다. 이 모델은 256k 토큰의 컨텍스트 길이를 지원하며 멀티모달 입력을 처리할 수 있습니다. 학습은 중간 학습(mid-training), 지도 미세 조정(SFT), CISPO를 활용한 강화 학습의 3단계 과정을 거쳤습니다. 57개 저장소를 대상으로 한 실제 테스트에서 11개의 실제 버그를 식별했으며, 그중 5개는 GitHub에 보고되지 않은 새로운 버그였습니다. Hugging Face 가중치, 무료 API 또는 vLLM 0.24.0 이상을 통한 자체 호스팅으로 이용 가능합니다.
- • Mistral AI는 Leanstral 1.5를 Apache 2.0 라이선스로 출시했으며, Hugging Face 가중치, 무료 API, 또는 vLLM 0.24.0+를 통한 자체 호스팅으로 이용 가능합니다.
- • 이 모델은 총 119B 파라미터와 토큰당 6.5B 활성 파라미터를 가진 Mixture-of-Experts 아키텍처입니다.
- • 256k 토큰의 컨텍스트 길이를 제공하며 텍스트와 이미지를 포함한 멀티모달 입력을 지원합니다.
- • Leanstral 1.5는 miniF2F 벤치마크에서 100% 성공률을 기록했으며, PutnamBench의 672개 문제 중 587개를 해결했습니다.
- • 57개 저장소를 대상으로 한 실제 테스트에서 11개의 실제 버그를 식별했으며, 그중 5개는 GitHub에 보고되지 않은 것이었습니다.
개발자들은 이 오픈 가중치 모델이나 무료 API를 사용하여 소프트웨어 정확성 검증을 자동화하고 코드베이스 내의 버그를 식별할 수 있습니다.
2. Interfaze, 다국어 오디오 확산(Audio Diffusion) ASR 모델 오픈소스화
Interfaze는 최초의 오픈소스 다국어 오디오 확산 ASR 모델로 알려진 diffusion-gemma-asr-small을 공개했습니다. 이 모델은 영어, 독일어, 프랑스어, 스페인어, 힌디어, 북경어를 지원합니다. 약 42M 파라미터의 어댑터가 고정된 26B 파라미터 DiffusionGemma 백본 위에 학습되었으며, 특징 추출기로 고정된 Whisper 인코더를 사용합니다. 대부분의 확산 LLM과 달리 균일한 랜덤 토큰 확산을 사용하여, 전사 비용이 전사 길이에 비례하는 것이 아니라 노이즈 제거 단계 수에 비례합니다. 어댑터는 Apache-2.0 라이선스로 출시되었습니다.
- • Interfaze는 영어, 독일어, 프랑스어, 스페인어, 힌디어, 북경어를 지원하는 다국어 오디오 확산 ASR 모델인 diffusion-gemma-asr-small을 오픈소스화했습니다.
- • 이 모델은 고정된 26B 파라미터 DiffusionGemma 백본 위에 학습된 약 42M 파라미터의 어댑터를 사용합니다.
- • 균일한 랜덤 토큰 확산과 특징 추출기로 고정된 Whisper 인코더를 사용합니다.
- • 전사 비용은 전사 길이가 아닌 노이즈 제거 단계 수에 따라 결정됩니다.
- • 어댑터는 Apache-2.0 라이선스로 출시되었으며, 기반 모델은 각자의 라이선스를 따릅니다.
- • LibriSpeech 벤치마크 결과, 다른 확산 기반 ASR 모델보다 성능이 뛰어나지만 자기회귀 방식의 Whisper 모델보다는 뒤처지는 것으로 나타났습니다.
개발자들은 전사 비용이 전사 길이가 아닌 노이즈 제거 단계에 따라 결정되는 오픈소스 비자기회귀(non-autoregressive) 음성 인식 모델을 사용할 수 있게 되었습니다.
3. Wafer, AMD MI355X에서 GLM 5.2 구동으로 Blackwell 대비 2배 높은 비용 효율성 달성
Wafer는 AMD MI355X 하드웨어에서 GLM 5.2 모델을 사용하여 노드당 2626 tok/s의 총 처리량과 213 tok/s의 단일 스트림 성능을 달성했습니다. 이 추론 성능은 유사한 NVIDIA Blackwell 하드웨어보다 2배 이상 낮은 비용으로 구현되었습니다. Wafer는 sglang 추론 프레임워크를 활용하고 AMD Quark을 사용하여 GLM-5.2 모델을 MXFP4로 양자화했습니다. 팀은 추측 디코딩(speculative decoding)을 활성화하기 위해 sglang ROCm 이미지에 두 가지 특정 수정을 적용하여 단일 스트림 처리량을 거의 3배 향상시켰으며, GLM-5.2의 fp4 형태에 맞춰 MoE 커널 선택을 수동으로 조정하여 프리필(prefill) 성능을 개선했습니다.
- • Wafer는 AMD MI355X에서 GLM 5.2를 구동하여 노드당 2626 tok/s의 총 처리량과 213 tok/s의 단일 스트림 성능을 달성했습니다.
- • 이 추론 성능은 유사한 NVIDIA Blackwell 하드웨어 대비 2배 이상 낮은 비용으로 달성되었습니다.
- • sglang 추론 프레임워크를 활용하고 AMD Quark을 통해 GLM-5.2 모델을 MXFP4로 양자화했습니다.
- • sglang ROCm 이미지에 두 가지 수정을 적용하여 추측 디코딩을 활성화하고 단일 스트림 처리량을 약 3배 향상시켰습니다.
- • GLM-5.2의 fp4 형태에 맞춰 MoE 커널 선택을 수동으로 조정하여 프리필 성능을 개선했습니다.
추론 비용 최적화를 원하는 개발자들은 AMD MI355X 하드웨어와 sglang을 활용하여 NVIDIA의 최신 칩보다 훨씬 저렴한 비용으로 고성능 추론을 구현할 수 있습니다.
4. 에이전트 코딩 및 장기 작업용 Laguna XS 2.1 출시
Laguna XS 2.1은 에이전트 코딩 및 장기 작업에 최적화되었습니다. 이 모델은 SWE-bench Multilingual 벤치마크에서 5.4점 향상된 63.1%의 점수를 기록했습니다. OpenMDW-1.1 라이선스로 출시되었으며 Hugging Face에서 다운로드하거나 API를 통해 사용할 수 있습니다. 자원 효율적인 배포를 지원하기 위해 세 가지 양자화 체크포인트가 포함되어 있습니다.
- • Laguna XS 2.1은 에이전트 코딩에 최적화된 33B 파라미터 Mixture-of-Experts 모델입니다.
- • SWE-bench Multilingual 벤치마크에서 63.1%의 점수를 기록하며 5.4점의 성능 향상을 보였습니다.
- • OpenMDW-1.1 라이선스로 출시되었으며 Hugging Face 또는 API를 통해 이용 가능합니다.
- • 자원 효율적인 배포를 지원하기 위해 세 가지 양자화 체크포인트가 제공됩니다.
개발자들은 다국어 소프트웨어 엔지니어링 성능을 개선하고 자원 효율적인 로컬 배포를 위한 양자화 체크포인트를 제공하는 새로운 오픈 가중치 코딩 모델을 선택할 수 있게 되었습니다.
5. Micro-World, 동작 제어 가능한 인터랙티브 월드 모델 출시
Micro-World는 고품질의 오픈 도메인 장면을 생성하도록 설계된 동작 제어 가능한 인터랙티브 월드 모델입니다. Wan2.1 모델 제품군을 기반으로 구축되었으며, 이미지-투-월드(I2W) 및 텍스트-투-월드(T2W) 변형을 모두 포함합니다. T2W 모델은 동작 주입을 위해 ControlNet을 사용하며, I2W 모델은 가벼운 파라미터 풋프린트를 위해 adaLN을 사용합니다. 이 프로젝트는 모델 가중치, 전체 학습 및 추론 코드, 그리고 큐레이션된 데이터셋을 GitHub에 공개했습니다.
- • Micro-World는 오픈 도메인 장면을 생성하도록 설계된 동작 제어 가능한 인터랙티브 월드 모델입니다.
- • Wan2.1 제품군을 기반으로 하며 이미지-투-월드(I2W) 및 텍스트-투-월드(T2W) 변형을 포함합니다.
- • T2W 모델은 동작 주입을 위해 ControlNet을 사용하고, I2W 모델은 가벼운 파라미터 풋프린트를 위해 adaLN을 사용합니다.
- • 모델 가중치, 전체 학습 및 추론 코드, 그리고 큐레이션된 데이터셋을 GitHub에 공개했습니다.
개발자들은 이 오픈소스 가중치와 학습 코드를 사용하여 인터랙티브하고 동작 제어가 가능한 비디오 또는 장면 생성 기능을 구축할 수 있습니다.
6. 포르투갈, AMALIA 9B 오픈 가중치 LLM 출시
포르투갈 정부는 9B 파라미터 모델인 AMALIA LLM 출시를 발표했습니다. 이 모델은 Hugging Face에서 SFT 및 DPO(Direct Preference Optimization) 버전으로 모두 이용 가능합니다. AMALIA LLM 프로젝트는 Apache 2.0 라이선스로 출시되었으며, 모델에 대한 자세한 연구 논문은 arXiv(식별자 2603.26511)에서 확인할 수 있습니다.
- • 포르투갈 정부가 9B 파라미터 모델인 AMALIA LLM을 출시했습니다.
- • Hugging Face에서 SFT 및 DPO(Direct Preference Optimization) 버전으로 이용 가능합니다.
- • Apache 2.0 라이선스로 출시되었습니다.
- • 모델에 대한 연구 논문이 arXiv(식별자 2603.26511)에 공개되어 있습니다.
개발자들은 로컬 배포나 미세 조정을 위해 SFT 및 DPO로 최적화된 새로운 Apache 2.0 라이선스 9B 모델을 사용할 수 있습니다.
7. Meituan-Longcat, LongCat 2.0 FP8 및 INT8 모델 가중치 공개
Meituan-longcat은 LongCat 2.0 모델의 두 가지 양자화 버전에 대한 모델 가중치를 공개했습니다. LongCat-2.0-INT8 및 LongCat-2.0-FP8 모델 가중치 모두 현재 Hugging Face 플랫폼에서 다운로드할 수 있습니다.
- • Meituan-longcat이 Hugging Face에 LongCat-2.0-INT8 모델 가중치를 공개했습니다.
- • Meituan-longcat이 Hugging Face에 LongCat-2.0-FP8 모델 가중치도 공개했습니다.
개발자들은 이제 LongCat 2.0 모델의 양자화 버전을 다운로드하여 로컬 환경이나 자체 추론 파이프라인에서 실행할 수 있습니다.
8. pxpipe 프록시, 컨텍스트를 이미지로 변환하여 Claude Code 토큰 비용 절감
pxpipe는 시스템 프롬프트, 도구 문서, 이전 기록과 같은 방대한 컨텍스트를 압축된 PNG 이미지로 변환하여 Claude Code 입력 토큰 비용을 줄여주는 로컬 프록시입니다. 이 시스템은 이미지 토큰 비용이 픽셀 크기에 따라 고정된다는 점을 활용하여 코드나 JSON과 같은 밀도 높은 콘텐츠를 텍스트보다 효율적으로 표현합니다. 주로 Claude Fable 5 모델에 최적화되어 있으며, 이미지화된 콘텐츠 읽기 벤치마크에서 100/100점을 기록했습니다. 이 도구는 손실 압축 방식이므로 ID, 해시, 비밀번호와 같은 항목의 정확한 원문 복구는 신뢰할 수 없습니다.
- • pxpipe는 방대한 컨텍스트(시스템 프롬프트, 도구 문서, 기록)를 압축된 PNG 이미지로 변환하여 Claude Code 입력 토큰 비용을 절감하는 로컬 프록시입니다.
- • 픽셀 크기에 따른 고정 이미지 토큰 비용을 활용하여 엔드투엔드 토큰 비용을 약 59%에서 70%까지 절감합니다.
- • 이미지화된 콘텐츠 읽기 벤치마크에서 100/100점을 기록한 Claude Fable 5 모델에 최적화되어 있습니다.
- • 손실 압축 방식이므로 ID, 해시, 비밀번호와 같은 항목의 정확한 원문 복구는 신뢰할 수 없습니다.
- • SWE-bench Pro 테스트에서 pxpipe를 사용한 인스턴스는 14/19의 해결률을 기록했으며, 대조군은 15/19를 기록했습니다.
- • 사용자는 `npx pxpipe-proxy`를 사용하여 프록시를 배포하고 `ANTHROPIC_BASE_URL` 환경 변수를 통해 Claude Code를 연결할 수 있습니다.
개발자들은 고정된 이미지 토큰 가격을 활용하여 Claude Code 사용 시 API 비용을 크게 낮출 수 있지만, 비밀 정보의 정확한 원문 복구는 신뢰할 수 없다는 점을 유의해야 합니다.
9. Apple, 자동화된 웹 디버깅을 위한 Safari MCP 서버 도입
Apple의 Safari Technology Preview 247은 웹 개발자를 위해 설계된 MCP 서버인 Safari MCP 서버를 도입했습니다. 이 서버를 통해 MCP 호환 에이전트가 Safari 브라우저 창에 연결하여 웹 애플리케이션을 디버깅하고 문제를 해결할 수 있습니다. 연결된 에이전트는 DOM, 네트워크 요청, 스크린샷, 콘솔 출력을 포함한 브라우저 데이터에 액세스할 수 있습니다. 이 도구는 로컬 머신에서 완전히 작동하며, 캡처된 데이터를 Apple이 아닌 에이전트로 직접 전송하고 자동 완성(AutoFill)과 같은 개인 브라우저 데이터에는 액세스하지 않습니다.
- • Safari Technology Preview 247은 웹 개발자를 위한 Safari MCP 서버를 도입했습니다.
- • 이 서버를 통해 MCP 호환 에이전트가 Safari 브라우저 창에 연결하여 웹 애플리케이션을 디버깅하고 문제를 해결할 수 있습니다.
- • 연결된 에이전트는 DOM, 네트워크 요청, 스크린샷, 콘솔 출력을 포함한 브라우저 데이터에 액세스할 수 있습니다.
- • 이 도구는 로컬 머신에서 완전히 작동하며 캡처된 데이터를 Apple이 아닌 에이전트로 직접 전송합니다.
- • 사용하려면 Safari Technology Preview를 설치하고 브라우저 설정에서 원격 자동화 및 외부 에이전트를 활성화해야 합니다.
개발자들은 이제 AI 에이전트가 Safari에서 DOM, 네트워크 요청, 스크린샷, 콘솔 로그를 자율적으로 검사하게 하여 웹 애플리케이션 디버깅을 자동화할 수 있습니다.
10. Cognition, 전체 코드베이스 취약점 탐지를 위한 Devin Security Swarm 출시
Cognition은 복잡한 코드베이스 내의 보안 취약점을 식별하기 위해 설계된 전문 도구인 Devin Security Swarm을 출시했습니다. 이 시스템은 전체 코드베이스 추론을 가능하게 하는 'Agentic MapReduce'라는 새로운 아키텍처를 기반으로 합니다. 이 프로세스는 저장소 전반의 신호를 매핑하고, 제한된 샤드(shard)에 걸쳐 에이전트에게 작업을 분배하며, 결과를 단일 보고서로 요약하고, 격리된 샌드박스에서 취약점을 검증합니다. Cognition은 이 아키텍처에 대한 기술 문서를 공개했습니다.
- • Cognition은 복잡한 코드베이스 내의 보안 취약점을 식별하기 위해 Devin Security Swarm을 도입했습니다.
- • 이 시스템은 전체 코드베이스 추론을 수행하기 위해 새로운 'Agentic MapReduce' 아키텍처를 사용합니다.
- • 저장소 전반의 신호를 매핑하고, 에이전트에게 작업을 분배하며, 결과를 요약하고, 격리된 샌드박스에서 취약점을 검증합니다.
- • Cognition은 Agentic MapReduce 아키텍처에 대한 기술 문서를 공개했습니다.
개발자들은 이 에이전트 시스템을 활용하여 전체 저장소를 자동으로 스캔하고, 잠재적인 보안 결함을 매핑하며, 격리된 샌드박스에서 이를 검증할 수 있습니다.
11. mcpsnoop, MCP 트래픽을 위한 실시간 TUI 디버거 출시
mcpsnoop은 AI 클라이언트와 서버 간의 MCP 트래픽을 디버깅하기 위해 설계된 투명한 프록시 도구입니다. 이 도구는 데이터 경로상에 위치하여 사용자가 터미널 UI에서 실시간 JSON-RPC 프레임을 볼 수 있게 합니다. 주요 기능으로는 응답 없는 호출(hung-call) 감지, 기능 검사, 프레임 검색, 캡처된 도구 호출 재실행 기능이 있습니다. 사용자는 클라이언트의 MCP 구성에서 서버 명령을 래핑하거나 스트리밍 가능한 HTTP 서버를 위한 리버스 프록시로 실행하여 mcpsnoop을 통합할 수 있습니다.
- • mcpsnoop은 AI 클라이언트와 서버 간의 MCP 트래픽을 디버깅하기 위해 데이터 경로상에 위치하는 투명한 프록시 도구입니다.
- • 터미널 UI에 실시간 JSON-RPC 프레임을 표시하며 프레임 검색, 기능 검사, 응답 없는 호출 감지를 지원합니다.
- • 캡처된 도구 호출을 재실행하여 서버 동작을 테스트할 수 있습니다.
- • 설치는 `go install` 또는 Homebrew를 통해 지원되며, 현재 1.0 이전 버전 상태입니다.
- • 사용자의 클라이언트 구성에 지정된 서버만 실행합니다.
MCP 서버를 구축하는 개발자들은 실시간 JSON-RPC 프레임을 쉽게 검사하고, 응답 없는 호출을 감지하며, 도구 호출을 재실행하여 디버깅 과정을 간소화할 수 있습니다.
12. WebBrain, 오픈소스 로컬 우선 AI 브라우저 에이전트로 출시
WebBrain은 Emre Sokullu가 제작하고 MIT 라이선스로 배포되는 Chrome 및 Firefox용 무료 오픈소스 AI 브라우저 에이전트입니다. 브라우저 사이드 패널 내에서 작동하며, 로컬 모델(llama.cpp 및 Ollama 등)에서 완전히 실행되거나 클라우드 API에 연결할 수 있으며, 최적의 성능을 위해 Qwen 3.6 35B를 권장합니다. 읽기 전용 작업을 위한 'Ask' 모드와 Chrome DevTools Protocol을 통해 페이지와 상호 작용하는 'Act' 모드의 두 가지 모드를 제공합니다. WebBrain은 보안 우선 접근 방식으로 설계되어 결과가 따르는 작업에 대해 승인을 요구하며, 직접적인 API 호출 대신 가시적인 UI를 사용하여 변경을 수행합니다.
- • WebBrain은 MIT 라이선스로 배포되는 Chrome 및 Firefox용 무료 오픈소스 AI 브라우저 에이전트입니다.
- • 브라우저 사이드 패널에서 작동하며 로컬 모델(llama.cpp, Ollama) 또는 클라우드 API를 지원하고 Qwen 3.6 35B를 권장합니다.
- • 읽기 전용 작업을 위한 'Ask' 모드와 Chrome DevTools Protocol을 통해 페이지와 상호 작용하는 'Act' 모드를 제공합니다.
- • 보안 우선 접근 방식을 사용하여 결과가 따르는 작업에 대해 승인을 요구하고 가시적인 UI를 사용하여 변경을 수행합니다.
- • 장치 프로필당 월 5달러의 관리형 옵션인 WebBrain Cloud를 이용할 수 있습니다.
개발자들은 이 오픈소스 에이전트를 사용하거나 커스터마이징하여 Ollama나 llama.cpp와 같은 모델을 통해 로컬에서 브라우저 기반 워크플로우를 자동화할 수 있습니다.
13. SGLang 팀, 에이전트 워크플로우를 재사용 가능한 플레이북으로 표준화
SGLang 팀은 워크플로우를 재사용 가능한 자산으로 변환하여 에이전트 개발 프로세스를 표준화하고 있습니다. 이러한 자산에는 SKILL.md 파일, 벤치마크 계약, 검토 루프 및 프로덕션 디버깅 플레이북이 포함됩니다. 팀은 에이전트의 가치를 실행, 테스트 및 검토할 수 있는 절차적 엔지니어링 지식으로 정의합니다.
- • SGLang 팀은 에이전트 워크플로우를 재사용 가능한 SKILL.md 파일 및 벤치마크 계약으로 변환하고 있습니다.
- • 이 이니셔티브에는 검토 루프와 프로덕션 디버깅 플레이북이 포함됩니다.
- • 팀은 에이전트의 가치를 실행, 테스트 및 검토할 수 있는 절차적 엔지니어링 지식으로 정의합니다.
개발자들은 SGLang 생태계 내에서 에이전트 워크플로우를 엔지니어링, 테스트 및 검토하기 위한 구조화된 실행 가능 프레임워크를 얻게 됩니다.
14. llama.cpp, 실험적 입자 산란 샘플러(Particle Scattering Sampler) 추가
산란 샘플러는 llama.cpp에 추가된 실험적 기능으로, 상위 K개 후보 간의 다음 토큰 확률 분포를 부드럽게 합니다. 이는 온도를 높일 때 발생하는 약한 꼬리 토큰이 포함되는 등의 부작용 없이 생성의 경직성을 줄이도록 설계되었습니다. 이 샘플러는 top-K, top-P, min-P, XTC와 같은 다른 필터가 후보군을 정의한 후 작동하며, 순위 거리에 기반한 가우시안 평활화 커널을 사용하여 가장 강력한 후보들 사이에 확률 질량을 재분배합니다. 기본적으로 비활성화되어 있으며 기본 샘플러 체인에서 XTC와 온도 사이에 위치합니다.
- • llama.cpp는 상위 K개 후보 간의 다음 토큰 확률 분포를 부드럽게 하는 실험적 '산란 샘플러'를 추가했습니다.
- • 순위 거리에 기반한 가우시안 평활화 커널을 사용하여 가장 강력한 후보들 사이에 확률 질량을 재분배합니다.
- • 다른 필터(top-K, top-P, min-P, XTC) 이후에 작동하며 XTC와 온도 사이에 위치합니다.
- • 엔트로피 기반 적응형 강도, 반복 토큰 흡수, 충돌 게이팅과 같은 선택적 기능을 포함합니다.
- • 기본적으로 비활성화되어 있으며 창의적인 글쓰기에는 권장되지만 엄격한 코딩이나 수학 작업에는 권장되지 않습니다.
개발자들은 이 샘플러를 사용하여 창의적이거나 역할극 생성 시 경직성을 줄이면서 약한 꼬리 토큰을 피할 수 있지만, 엄격한 코딩이나 수학 작업에는 위험할 수 있습니다.
15. lift-pdf를 사용한 스키마 가이드 송장 추출 파이프라인 튜토리얼 공개
새로운 튜토리얼은 lift-pdf를 사용하여 합성 송장 PDF를 구조화된 JSON으로 변환하는 엔드투엔드 미지급금 추출 파이프라인을 보여줍니다. 이 파이프라인은 송장 파싱을 스키마 가이드 문서 이해로 프레임화하여 공급업체 식별, PO 번호, 품목, 결제 상태와 같은 필드를 타겟팅합니다. 구현에는 선택적 4비트 NF4 양자화를 포함한 GPU 인식 모델 로딩과 성능 최적화를 위한 재사용 가능한 InferenceManager가 사용됩니다. 합성 송장은 수학적 일관성을 보장하기 위해 ReportLab을 사용하여 생성되며, 파이프라인에는 필드 수준 정확도를 계산하고 추출된 데이터를 pandas 기반 미지급금 원장으로 변환하는 검증 단계가 포함됩니다.
- • 이 튜토리얼은 lift-pdf를 사용하여 합성 송장 PDF를 구조화된 JSON으로 변환하는 엔드투엔드 미지급금 추출 파이프라인을 보여줍니다.
- • 공급업체 식별, PO 번호, 품목, 결제 상태와 같은 필드를 타겟팅하며 소계와 세후 합계를 구분하는 등의 문제를 해결합니다.
- • GPU 인식 모델 로딩과 선택적 4비트 NF4 양자화, 재사용 가능한 InferenceManager를 사용합니다.
- • 필드 수준 정확도를 계산하고 추출된 데이터를 pandas 기반 미지급금 원장으로 변환하는 검증 단계를 포함합니다.
- • 튜토리얼은 재현 가능한 Colab 노트북으로 제공됩니다.
개발자들은 이 패턴을 구현하여 청구지 주소 구분과 같은 복잡한 추출 문제를 처리하는 고정밀 문서 지능 파이프라인을 구축할 수 있습니다.
16. 실제 작업에서 AI 에이전트를 평가하기 위한 CursorBench 3.1 출시
CursorBench 3.1은 AI 에이전트의 성능을 평가하기 위해 설계된 벤치마크로 출시되었습니다. 이 벤치마크는 모호한 다중 파일 작업을 사용하여 에이전트를 테스트합니다. 모든 작업은 실제 Cursor 사용자 세션에서 가져온 것으로, 에이전트 코딩 도구에 대한 현실적인 평가 환경을 제공합니다.
- • CursorBench 3.1은 AI 에이전트의 성능을 평가하기 위해 설계된 벤치마크입니다.
- • 모호한 다중 파일 작업을 사용하여 에이전트를 테스트합니다.
- • 모든 작업은 실제 Cursor 사용자 세션에서 가져온 것입니다.
개발자들은 이 벤치마크를 사용하여 코딩 에이전트가 복잡하고 다중 파일이며 모호한 실제 시나리오를 얼마나 효과적으로 처리하는지 측정할 수 있습니다.