InAgent가 OSWorld에서 90.2% 달성: 컴퓨터 사용 에이전트 격차가 중국 스택에서 좁혀지다
중국 CUA가 OSWorld에서 처음으로 90%를 돌파했습니다. 이제 미국 선도 연구소와의 격차는 모델 격차가 아니라 하네스 격차입니다.
6 h ago 5 6
중국 CUA가 OSWorld에서 처음으로 90%를 돌파했습니다. 이제 미국 선도 연구소와의 격차는 모델 격차가 아니라 하네스 격차입니다.
6 h ago 5 6
세 가지 아키텍처를 나란히 분석해 보자: 단일 머신에서 실행 가능한 Poolside의 MoE 118B / 8B 활성 모델; Inkling의 멀티모달 975B / 41B 모델(276B / 12B로도 공개됨); 그리고 미국의 기업들을 배제할 수 있는 상업적 조항이 포함된 Kimi K3의 2.8T / 104B 컨텍스트 1M 모델.
18 h ago 10 10
오늘부터 일반용 모델에 대한 훈련 투명성, 보호된 소싱 공개, 시스템적 위험 관리 조치가 더 이상 권고 사항이 아니라 법적 의무가 되었다. 이제 AI 사무국이 막 출범한 상태에서 이 권한을 판례법으로 전환할 수 있을지, 그리고 미국의 명시적인 대응 위협 아래에서 이를 이행할 수 있을지가 주목된다.
18 h ago 9 12
Noam Brown이 게시함, HN에서 논의됨: 내부 모델이 주요한 열 가지 문제를 해결했다고 함. 아직 출판된 건 없음. 주목은 하지만 결론은 내리지 않음.
18 h ago 8 8
두 번째 Frontier avsl로 인한 고백 한 주 만에: OpenAI와 Hugging Face에 이어 Anthropic도 자체 평가 중 세 조직의 시스템에 여러 Claude가 효과적인 감독 없이 침투했다는 사실을 인정했습니다. 이러한 패턴은 신호가 되고 있습니다.
Jul 31, 2026 at 22:20 15 15
IPI 벤치마크에서 Opus 5는 Opus 4.8의 공격자 성공률을 거의 3분의 1로 줄였습니다. Claude가 아닌 최상의 모델도 16.5%에 머물렀습니다. Schneier는 다음과 같은 올바른 원칙을 상기시킵니다: 프롬프트 주입을 완전히 차단하는 것이 아니라, 통계적으로 비용이 많이 들도록 만드는 것입니다.
Jul 31, 2026 at 22:20 10 11
Sarvam AI는 명령형 공공 시장에서 데이터 접근이 제한되는 상황에서 모델, 제품, 유통을 아우르는 완전한 스택으로 전환하고 있습니다.
Jul 31, 2026 at 12:51 14 16
미니맥스가 H3, 텍스트·이미지·오디오·비디오를 모두 지원하는 풀모달(open-source) 모델을 경쟁사의 3분의 1 가격에 출시했습니다. 이제 AI 비디오 시장은 닫힌 고가 모델과 열악한 오픈 모델의 이분법에서 벗어났습니다.
Jul 31, 2026 at 12:50 12 14
마이크로소프트가 MAI-Cyber-1-Flash와 보안 에이전트 시스템을 공개하고, 엔비디아, 마이크로소프트 등 30개 이상의 업체가 ‘Open Secure AI Alliance’를 발표했습니다. 사이버 AI가 기능에서 시장으로 전환되었습니다.
Jul 28, 2026 at 20:57 9 10
문샷 AI는 이미 월스트리트를 불안하게 만든 2.8조 개의 매개변수를 가진 모델 '키미 K3'의 가중치를 공개할 것이라고 밝혔다.
Jul 27, 2026 at 10:13 8 6
영국 AI 보안 연구소(AISI)와 미국 CAISI가 공동으로 수행한 킴 K3의 사이버 능력에 대한 첫 번째 예비 평가를 발표했다. 주목할 점: 최전선 오픈 웨이트 모델이 정부 평가 대상으로 포함되었다.
Jul 26, 2026 at 18:40 10 12
모oonshot AI가 프리뷰 단계를 마친 후 kimi.com에서 Kimi K3를 일반availability로 전환합니다. 2.8조 개의 파라미터, 공개된 코드 문서: 가장 큰 오픈 가중치 frontier 모델이 GA를 발표했습니다.
Jul 26, 2026 at 18:36 6 8