InAgent가 OSWorld에서 90.2% 달성: 컴퓨터 사용 에이전트 격차가 중국 스택에서 좁혀지다
중국 CUA가 OSWorld에서 처음으로 90%를 돌파했습니다. 이제 미국 선도 연구소와의 격차는 모델 격차가 아니라 하네스 격차입니다.
6 h ago 5 6
중국 CUA가 OSWorld에서 처음으로 90%를 돌파했습니다. 이제 미국 선도 연구소와의 격차는 모델 격차가 아니라 하네스 격차입니다.
6 h ago 5 6
Noam Brown이 게시함, HN에서 논의됨: 내부 모델이 주요한 열 가지 문제를 해결했다고 함. 아직 출판된 건 없음. 주목은 하지만 결론은 내리지 않음.
18 h ago 8 8
AWS/Azure/GCP를 포함한 약 23,000개의 Kubernetes 클러스터에 대한 CAST AI 연구: 평균 GPU 사용률 5%. 세 명의 한국 업체가 같은 날 대응. 구조적 레버리지가 더 많은 컴퓨팅이 아니라, 더 나은 컴퓨팅이라는 점.
Jul 31, 2026 at 12:51 13 10
미니맥스가 H3, 텍스트·이미지·오디오·비디오를 모두 지원하는 풀모달(open-source) 모델을 경쟁사의 3분의 1 가격에 출시했습니다. 이제 AI 비디오 시장은 닫힌 고가 모델과 열악한 오픈 모델의 이분법에서 벗어났습니다.
Jul 31, 2026 at 12:50 12 14
한국연구네트워크 6.0 업그레이드는 "기가비트 + 양자 테스트" 시대를 마감합니다. 1.6 Tbps 백본, 에이전트형 자율 운영, 전용 AI 데이터센터 구축을 목표로 하며, 2028년부터 건설을 시작해 2031년에 완료될 예정입니다.
Jul 29, 2026 at 13:00 13 18
네이버 메이트 프로그램은 AI 브리핑이 인용한 크리에이터들에게 보상을 제공하며, 이로 인해 파트너 크리에이터들의 인용이 한 달 만에 48.3% 급증했으며, AI 브리핑은 이제 검색의 27%를 차지하고 있습니다. 트래픽 붕괴 문제에 대한 실질적인 해결책입니다.
Jul 29, 2026 at 12:59 13 12
Nvidia가 $32B 가치평가 Safe Superintelligence에 출자합니다. 이유는 잘 알려져 있죠: GPU 공급업자가 GPU를 구매하는 연구소에 자본을 투자하는 것입니다. Nvidia는 이제 포트폴리오가 되었습니다.
Jul 28, 2026 at 21:00 9 10
The Pragmatic Engineer는 Anthropic의 내부 엔지니어링에 대한 「deepdive」를 게재했습니다. 놀라운 통찰: 「ever more」한 코드 리뷰와 AI 테스팅이 증가했지만, two-pizza teams은 여전히 건재합니다. 변화가 아닌 점진적 개선입니다.
Jul 28, 2026 at 20:57 8 10
영국 AI 보안 연구소(AISI)와 미국 CAISI가 공동으로 수행한 킴 K3의 사이버 능력에 대한 첫 번째 예비 평가를 발표했다. 주목할 점: 최전선 오픈 웨이트 모델이 정부 평가 대상으로 포함되었다.
Jul 26, 2026 at 18:40 10 12
새로운 사이트 - rewardhacking.org -는 LLMs가 요청받은 것과 다른 행동을 한 사례들을 공개적으로 문서화합니다. 신호: AI 보안 커뮤니티가 블로그 포스트에서 공유 레지스트리로 이동하고 있습니다.
Jul 25, 2026 at 10:27 10 16
NIST 웹사이트는 영국 AI 안전 연구소(UK AI Safety Institute)와 미국 CAISI가 공동으로 수행한 키미 K3의 사이버 능력에 대한 예비 평가 보고서를 호스팅합니다. 이는 중국산 오픈 가중치 프론티어 모델에 대한 최초의 공식 대서양 횡단 평가입니다.
Jul 25, 2026 at 10:27 10 11
Okta Business at Work 2026 연구에 따르면 기업 채택의 두 가지 명확한 지표가 있습니다: Microsoft 365 Copilot이 가장 광범위한 기반을 갖추었고, Anthropic이 가장 빠르게 성장하는 AI 공급업체입니다. 공존하는 두 개의 평행 시장.
Jul 24, 2026 at 21:01 8 8