의료 AI 환각 진단 벤치마크 클린할루(ClinHallu)가 AI 오진의 원인을 시각·지식·추론 3단계로 처음 분해했다. 제미나이 3 플래시도 시각 환각률 25.8%를 기록했다. 정작 추론은 가장 멀쩡했다는…
멀티모달 AI 환각 원인은 이미지를 한 번만 보여주는 구조에 있다. 저장대 연구진은 매 단어마다 사진을 다시 주입하는 VIF로 14개 시험 성능을 높였다. 추가 비용은…
학습 없는 AI 분할 기술 세그에이전트(Seg-Agent)가 130억 파라미터 LISA-13B를 65.8점 대 70.6점으로 이겼다. 비결은 세트오브마크 3단계 시각 추론이다. 학습 시대에서 추론 시대로 넘어가는 AI…
유튜브 AI 학습 데이터로 컴퓨터 자동 조작 능력을 두 배 끌어올린 GUI 에이전트가 등장했다. 베이징대와 샤오미 연구팀이 공개한 WildGUI 데이터셋은 1,200만 개 작업 궤적을…
멀티모달 AI 검색 에이전트 LMM-Searcher가 100턴까지 추론을 확장했다. 인민대 연구진은 이미지를 외부 파일로 저장하고 ID로만 추적하는 방식으로 컨텍스트 폭발 문제를 해결했다. MMSearch-Plus 34.8점으로 오픈소스…
AI 에이전트 모달리티 라우팅이 텍스트 변환 방식보다 과업 정확도를 20%p 끌어올린다는 스탠퍼드 연구 결과를 정리했다. MMA2A 방식은 제품 결함 보고에서 38.5%p 향상을 기록했다. 단,…
LLM 뇌영상 자동화 시스템 뉴로에이전트가 알츠하이머 환자와 정상군 총 1,470명 데이터에서 AUC 0.9518을 달성했다. USC 연구진이 개발한 계층적 AI 에이전트의 성과다. 단, 백엔드 LLM…
오포 모바일 AI 에이전트 X-옴니클로가 클라우드 없이 안드로이드 폰 안에서 카메라, 음성, 갤러리를 통합 처리한다. 사용자가 한 번 보여준 행동을 복제해 메이투안 특가 페이지나…
구글 클라우드 넥스트(Google Cloud Next) 2026 행사 주간인 4월 22~24일, 씽킹 머신스 랩(Thinking Machines Lab, 이하 TML)이 두 가지 굵직한 소식을 동시에 알렸다. 첫째는…
저녁 식탁 차리다 말고 “여보, 접시 좀 꺼내줘”라고 말한다. 듣는 사람은 한 치의 망설임 없이 상부 찬장 문을 연다. 그런데 이 단순한 심부름을 요즘…
AI에게 거실 사진을 보여주면 소파나 TV보다 고양이를 먼저 알아본다. 눈에 띄는 것만 골라 보는 것이 지금까지 AI 시각 모델의 한계였다. 뉘른베르크 공과대학교(University of Technology…
메타(Meta)가 자체 AI 연구 조직인 메타 초지능 연구소(MSL, Meta Superintelligence Labs)를 통해 개발한 첫 번째 대규모 언어 모델(LLM, Large Language Model) ‘뮤즈 스파크(Muse Spark)’를…
3D 콘텐츠를 만드는 AI는 왜 2D 이미지 생성 AI보다 훨씬 뒤처져 있을까. 답은 간단하다. 데이터가 부족하기 때문이다. 중국 선전 중문대학교(CUHK)와 메시AI(Meshy AI) 연구팀은 이…
중국 빅테크(Big Tech) 기업 알리바바(Alibaba)의 AI 연구팀 ‘Qwen 팀’이 텍스트, 음성, 이미지, 영상을 단일 계산 파이프라인(pipeline) 내에서 동시에 처리하는 멀티모달(multimodal) AI 모델 ‘Qwen 3.5…
음성으로 AI에게 말을 건넬 때, AI는 정말 당신의 말을 듣고 있을까? 최근 발표된 연구에 따르면, 음성과 텍스트가 충돌할 때 AI는 사용자의 목소리보다 텍스트를 10배나…
중국의 IT 기업 텐센트(Tencent)가 말만 하면 원하는 이미지를 그려주는 초대형 인공지능 ‘훈위안이미지 3.0(HunyuanImage 3.0)’을 오픈소스로 공개했다. 이 AI는 현재까지 공개된 오픈소스 이미지 생성 AI 중 가장 크고 강력하며, 오픈AI의…
미국 스탠퍼드 대학 연구팀이 단 하룻밤 잠을 자는 동안의 데이터만으로 향후 걸릴 수 있는 질병을 예측하는 인공지능 ‘SleepFM’을 개발했다. 해당 연구 논문에 따르면, 이 AI는 약 6만…
한국지능정보사회진흥원(NIA)이 2025년 국내외 주요 매체 282건을 토픽 모델링 기법으로 분석한 결과, 2026년은 AI가 실험 단계를 넘어 산업 전반의 핵심 인프라로 자리 잡는 전환점이 될…
건설업은 전 세계적으로 가장 위험한 산업 중 하나로 꼽힌다. 미국 노동통계국에 따르면 2023년 전체 산업재해 사망의 약 5분의 1이 건설 현장에서 발생했으며, 그중 38.5%가…
멀티모달 AI 영상 분석 솔루션 기업 PIA-SPACE가 구글의 인공지능 ‘제미나이’를 활용해 CCTV에서 폭력 상황을 실시간으로 찾아내는 기술을 개발했다. 해당 연구 논문에 따르면, 정확도는 95.25%에…
인공지능 언어모델들이 서로 협력할 때 텍스트 메시지 대신 ‘생각’을 직접 교환하는 새로운 방법이 개발됐다. 중국 칭화대학교와 인피니전스 AI 연구팀은 여러 AI 모델이 함께 일할…
삼성전자가 22일 AI 기반 XR 헤드셋 ‘갤럭시 XR(Galaxy XR)’을 국내에 출시했다. 삼성전자에 따르면 이 제품은 삼성전자와 구글(Google), 퀄컴(Qualcomm)이 공동 개발한 ‘안드로이드 XR(Android XR)’ 플랫폼을…
상하이교통대 연구팀이 사용자가 요청하기 전에 먼저 필요를 파악해 서비스를 제공하는 AI 시스템 ‘알파서비스’를 공개했다. AI 안경만 쓰면 블랙잭 게임 조언부터 박물관 가이드, 쇼핑 추천까지…
글로벌 컨설팅 회사 캡제미니(Capgemini)가 발표한 리포트에 따르면, 인공지능 기술이 단순한 작업 수행을 넘어 인간의 감정과 맥락을 이해하는 새로운 단계로 진입하고 있다. 이른바 ‘인간-기계 이해(Human-Machine…
AI 시장이 급성장하면서 조기 투자로 큰 수익을 올릴 것으로 예상되는 엔젤 투자자들의 순위가 공개됐다. 비즈니스 분석 플랫폼 CB 인사이트(CB Insights)가 지난달 22일(현지 시간) 발표한…
엔비디아(NVIDIA)가 로봇공학과 물리적 AI 분야를 겨냥한 새로운 컴퓨팅 플랫폼 젯슨 토르(Jetson Thor)를 출시했다고 25일(현지 시간) 발표했다. 블랙웰(Blackwell) 아키텍처 기반의 이 제품은 2,070 FP4 테라플롭스…
국가유산청이 한국의 문화유산을 기반으로 한 ‘멀티모달 인공지능’ 개발에 나선다고 14일(한국 시간) 발표했다. 이번 사업은 ‘2025년 민간클라우드 기반 AI·데이터레이크 활용지원 사업’에 선정된 것으로, 국가유산청·국가유산진흥원·모티프테크놀로지스가 컨소시엄을…
생성형 AI 시장에서 새로운 강자가 등장했다. 일론 머스크(Elon Musk)의 xAI가 개발한 AI 챗봇 그록(Grok)이 7월 주요 생성형 AI 웹사이트 중 가장 높은 월간 성장률을…
나사(NASA)와 구글(Google)이 화성 탐사 임무를 수행하는 우주비행사들의 건강을 지키기 위한 인공지능 의료 도우미를 공동 개발하고 있다고 테크크런치(TechCrunch)가 8일(현지 시간) 보도했다. 인간의 우주 탐사 임무가…
핀터레스트(Pinterest) CEO 빌 레디(Bill Ready)가 AI 에이전트가 사용자를 대신해 쇼핑하는 에이전틱 웹(agentic web) 시대는 아직 먼 미래의 일이라고 밝혔다. 테크크런치(TechCrunch)가 8일(현지 시간) 보도한 내용에…