InAgent가 OSWorld에서 90.2% 달성: 컴퓨터 사용 에이전트 격차가 중국 스택에서 좁혀지다
중국 CUA가 OSWorld에서 처음으로 90%를 돌파했습니다. 이제 미국 선도 연구소와의 격차는 모델 격차가 아니라 하네스 격차입니다.
5 h ago 5 6
중국 CUA가 OSWorld에서 처음으로 90%를 돌파했습니다. 이제 미국 선도 연구소와의 격차는 모델 격차가 아니라 하네스 격차입니다.
5 h ago 5 6
세 가지 아키텍처를 나란히 분석해 보자: 단일 머신에서 실행 가능한 Poolside의 MoE 118B / 8B 활성 모델; Inkling의 멀티모달 975B / 41B 모델(276B / 12B로도 공개됨); 그리고 미국의 기업들을 배제할 수 있는 상업적 조항이 포함된 Kimi K3의 2.8T / 104B 컨텍스트 1M 모델.
17 h ago 10 10
IPI 벤치마크에서 Opus 5는 Opus 4.8의 공격자 성공률을 거의 3분의 1로 줄였습니다. Claude가 아닌 최상의 모델도 16.5%에 머물렀습니다. Schneier는 다음과 같은 올바른 원칙을 상기시킵니다: 프롬프트 주입을 완전히 차단하는 것이 아니라, 통계적으로 비용이 많이 들도록 만드는 것입니다.
Jul 31, 2026 at 22:20 10 11
DeepSeek이 Responses API, Codex 호환, Terminal Bench 2.1에서 82.7, DeepSWE에서 54.4의 성능을 갖춘 V4-Flash-0731을 공개 베타로 출시했습니다. 벤더 락 런타임이 한 단계 하락했습니다.
Jul 31, 2026 at 12:50 12 10
모oonshot AI가 프리뷰 단계를 마친 후 kimi.com에서 Kimi K3를 일반availability로 전환합니다. 2.8조 개의 파라미터, 공개된 코드 문서: 가장 큰 오픈 가중치 frontier 모델이 GA를 발표했습니다.
Jul 26, 2026 at 18:36 6 8
Black Forest Labs, FLUX 3 출시: 새로운 멀티모달 플로우 매칭 모델 세대 Black Forest Labs에서 FLUX 3, 새로운 멀티모달 플로우 매칭 모델 세대를 발표했습니다. 해당 연구실은 Seedance 2.0 및 Gemini 대비 내부 벤치마크에서 우수한 결과를 보였다고 주장합니다. 그러나 제3자 평가를 통해 검증이 필요합니다.
Jul 24, 2026 at 21:00 8 8
기술적 돌파구가 인정받았지만, 상용화와 에코시스템이 아직은 미비한 상태 - Kimi K3의 「DeepSeek 순간」은 벤치마크보다 트랙션에서 결정될 것이다.
Jul 23, 2026 at 07:45 7 9
Kimi K3는 AA-Briefcase 에이전트 벤치마크에서 Fable 5 바로 뒤에 랭크됩니다. 최상의 오픈 웨이트 모델은 중간 성적이 아니라 정상에 바짝 다가서 있습니다.
Jul 22, 2026 at 12:41 10 10
Kimi K3 출시 1주일 만에 분석가들의 평가가 분열되었습니다. TechCrunch는 "threat or menace"라는 제목을 달았고, 실무자들은 이를 프로덕션에 도입하고 있습니다. 진정한 신호는 더 이상 모델이 아닙니다: 수요 곡선이 그 역할을 하고 있습니다.
Jul 19, 2026 at 00:37 7 8
SVG 일러스트레이션 테스트는 진행 상황을 빠르게 측정하는 척도로 작용합니다: Simon Willison은 7월 16일과 17일에 K3를 읽은 내용을 공개했습니다.
Jul 17, 2026 at 22:05 6 11
구글이 코딩 성능을 높이기 위해 젬니 3.5 Pro를 차별화합니다. frontier release를 막는Metrics는 더 이상 지식(know-how)이 아니라 tool-use(도구 사용)입니다.
Jul 17, 2026 at 09:19 25 11
문샷이 Kimi K3를 2.8조 개의 매개변수를 갖춘 GA로 공개했습니다. 이는 현재까지 발표된 가장 큰 오픈 가중치 아키텍처입니다.
Jul 17, 2026 at 09:18 16 8