Search

멀티모달 AI

ClinHallu. A BenchmarkforDiagnosingStage-wise

의료 AI가 없는 병변을 봤다고 우길 때, 진짜 범인은 추론이 아니었다

6월 16, 2026

의료 AI 환각 진단 벤치마크 클린할루(ClinHallu)가 AI 오진의 원인을 시각·지식·추론 3단계로 처음 분해했다. 제미나이 3 플래시도 시각 환각률 25.8%를 기록했다. 정작 추론은 가장 멀쩡했다는…

Vision Inference Former Sustaining Visual Consistency in Multimodal Large Language Models

AI가 사진을 오래 설명할수록 없는 것을 지어내는 진짜 이유

5월 22, 2026

멀티모달 AI 환각 원인은 이미지를 한 번만 보여주는 구조에 있다. 저장대 연구진은 매 단어마다 사진을 다시 주입하는 VIF로 14개 시험 성능을 높였다. 추가 비용은…

Seg-Agent_Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

학습 안 한 AI가 수십만 장 훈련한 AI를 이긴 단 하나의 비결

5월 19, 2026

학습 없는 AI 분할 기술 세그에이전트(Seg-Agent)가 130억 파라미터 LISA-13B를 65.8점 대 70.6점으로 이겼다. 비결은 세트오브마크 3단계 시각 추론이다. 학습 시대에서 추론 시대로 넘어가는 AI…

Video2GUI Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

베이징대 AI, 유튜브 강좌 보고 컴퓨터 조작 성공률 2배 높여… 근데 어떻게 접속?

5월 18, 2026

유튜브 AI 학습 데이터로 컴퓨터 자동 조작 능력을 두 배 끌어올린 GUI 에이전트가 등장했다. 베이징대와 샤오미 연구팀이 공개한 WildGUI 데이터셋은 1,200만 개 작업 궤적을…

Towards Long-horizon Agentic Multimodal Search

100턴까지 멈추지 않는 AI 검색 에이전트, 비결은 ‘잘 잊는 법’이었다

5월 14, 2026

멀티모달 AI 검색 에이전트 LMM-Searcher가 100턴까지 추론을 확장했다. 인민대 연구진은 이미지를 외부 파일로 저장하고 ID로만 추적하는 방식으로 컨텍스트 폭발 문제를 해결했다. MMSearch-Plus 34.8점으로 오픈소스…

Modality-Native Routing in Agent-to-Agent Networks A Multimodal A2A Protocol Extension

사진 설명을 텍스트 한 줄로 바꾸는 순간 AI 에이전트 인식 정확도가 7.7%로 추락한다

5월 13, 2026

AI 에이전트 모달리티 라우팅이 텍스트 변환 방식보다 과업 정확도를 20%p 끌어올린다는 스탠퍼드 연구 결과를 정리했다. MMA2A 방식은 제품 결함 보고에서 38.5%p 향상을 기록했다. 단,…

NeuroAgent LLM Agents for Multimodal Neuroimaging Analysis and Research

정확도 95%로 알츠하이머 잡아낸 AI 에이전트, ‘이것’ 모르면 0점?

5월 12, 2026

LLM 뇌영상 자동화 시스템 뉴로에이전트가 알츠하이머 환자와 정상군 총 1,470명 데이터에서 AUC 0.9518을 달성했다. USC 연구진이 개발한 계층적 AI 에이전트의 성과다. 단, 백엔드 LLM…

X-OmniClaw Technical Report A Unified Mobile Agent for Multimodal Understanding and Interaction

카메라 들이대고 “이거 얼마야?” 물으면 폰이 알아서 타오바오를 연다, 오포(OPPO)가 공개한 엣지 AI 에이전트

5월 11, 2026

오포 모바일 AI 에이전트 X-옴니클로가 클라우드 없이 안드로이드 폰 안에서 카메라, 음성, 갤러리를 통합 처리한다. 사용자가 한 번 보여준 행동을 복제해 메이투안 특가 페이지나…

Thinking Machines Lab 메타 AI 인재 영입

Thinking Machines Lab, 메타 AI 핵심 인재 영입과 구글 클라우드 수십억 달러 계약 동시 성사

4월 30, 2026

구글 클라우드 넥스트(Google Cloud Next) 2026 행사 주간인 4월 22~24일, 씽킹 머신스 랩(Thinking Machines Lab, 이하 TML)이 두 가지 굵직한 소식을 동시에 알렸다. 첫째는…

AI에게 접시 가져다달라 했더니 냉장고부터 연 이유

AI에게 접시 가져다달라 했더니 냉장고부터 연 이유

4월 23, 2026

저녁 식탁 차리다 말고 “여보, 접시 좀 꺼내줘”라고 말한다. 듣는 사람은 한 치의 망설임 없이 상부 찬장 문을 연다. 그런데 이 단순한 심부름을 요즘…

AI Matters_Steerable Visual Representations

AI가 고양이만 보는 이유, 그리고 리모컨까지 보게 만드는 법

4월 13, 2026

AI에게 거실 사진을 보여주면 소파나 TV보다 고양이를 먼저 알아본다. 눈에 띄는 것만 골라 보는 것이 지금까지 AI 시각 모델의 한계였다. 뉘른베르크 공과대학교(University of Technology…

AI 매터스 기사 썸네일_메타 슈퍼 인텔리전스

메타, MSL 개발 AI 모델 ‘뮤즈 스파크’ 공개…”개인 초지능 시대 향한 첫걸음”

4월 9, 2026

메타(Meta)가 자체 AI 연구 조직인 메타 초지능 연구소(MSL, Meta Superintelligence Labs)를 통해 개발한 첫 번째 대규모 언어 모델(LLM, Large Language Model) ‘뮤즈 스파크(Muse Spark)’를…

AI 매터스 기사 썸네일_Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

2D 이미지로 3D 모델 만드는 AI, 데이터 부족 문제를 이렇게 풀었다

4월 8, 2026

3D 콘텐츠를 만드는 AI는 왜 2D 이미지 생성 AI보다 훨씬 뒤처져 있을까. 답은 간단하다. 데이터가 부족하기 때문이다. 중국 선전 중문대학교(CUHK)와 메시AI(Meshy AI) 연구팀은 이…

알리바바, Qwen 3.5 Omni 출시…텍스트·음성·영상 동시 처리하는 멀티모달 AI

알리바바, Qwen 3.5 Omni 출시…텍스트·음성·영상 동시 처리하는 멀티모달 AI

4월 2, 2026

중국 빅테크(Big Tech) 기업 알리바바(Alibaba)의 AI 연구팀 ‘Qwen 팀’이 텍스트, 음성, 이미지, 영상을 단일 계산 파이프라인(pipeline) 내에서 동시에 처리하는 멀티모달(multimodal) AI 모델 ‘Qwen 3.5…

When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration

AI가 내 말을 못 믿는다고? 음성 AI의 충격적인 편향 실험 결과

2월 25, 2026

음성으로 AI에게 말을 건넬 때, AI는 정말 당신의 말을 듣고 있을까? 최근 발표된 연구에 따르면, 음성과 텍스트가 충돌할 때 AI는 사용자의 목소리보다 텍스트를 10배나…

"중국 텐센트 AI, 구글·오픈AI 이미지 AI를 뛰어넘었다... 무료 공개로 업계 발칵"

중국 텐센트, 구글·오픈AI의 이미지 생성 AI 뛰어넘은 오픈소스 모델로 업계 발칵 

1월 29, 2026

중국의 IT 기업 텐센트(Tencent)가 말만 하면 원하는 이미지를 그려주는 초대형 인공지능 ‘훈위안이미지 3.0(HunyuanImage 3.0)’을 오픈소스로 공개했다. 이 AI는 현재까지 공개된 오픈소스 이미지 생성 AI 중 가장 크고 강력하며, 오픈AI의…

이제 잠만 자도 질병 예측 가능? 스탠퍼드 AI, 하룻밤 수면으로 130가지 병 찾아낸다

이제 잠만 자도 질병 예측 가능? 스탠퍼드 AI, 하룻밤 수면으로 130가지 병 찾아낸다

1월 8, 2026

미국 스탠퍼드 대학 연구팀이 단 하룻밤 잠을 자는 동안의 데이터만으로 향후 걸릴 수 있는 질병을 예측하는 인공지능 ‘SleepFM’을 개발했다. 해당 연구 논문에 따르면, 이 AI는 약 6만…

토픽 분석을 통한 AI 주요 트렌드 및 2026 전망 

2026년 ‘AI 대전환 시대’ 온다… 한국지능정보원, AI 주요 트렌드 및 2026 전망 

12월 29, 2025

한국지능정보사회진흥원(NIA)이 2025년 국내외 주요 매체 282건을 토픽 모델링 기법으로 분석한 결과, 2026년은 AI가 실험 단계를 넘어 산업 전반의 핵심 인프라로 자리 잡는 전환점이 될…

Automated Hazard Detection in Construction Sites Using Large Language and Vision-Language Models

건설 현장 사망사고 20%가 ‘추락’… AI가 안전모 미착용까지 잡아낸다

11월 27, 2025

건설업은 전 세계적으로 가장 위험한 산업 중 하나로 꼽힌다. 미국 노동통계국에 따르면 2023년 전체 산업재해 사망의 약 5분의 1이 건설 현장에서 발생했으며, 그중 38.5%가…

Short-Window Sliding Learning for Real-Time Violence Detection via LLM-based Auto-Labeling

“AI가 CCTV 속 폭력 포착”… 제미나이가 ‘주먹 드는 순간’ 95% 정확도로 잡는다

11월 18, 2025

멀티모달 AI 영상 분석 솔루션 기업 PIA-SPACE가 구글의 인공지능 ‘제미나이’를 활용해 CCTV에서 폭력 상황을 실시간으로 찾아내는 기술을 개발했다. 해당 연구 논문에 따르면, 정확도는 95.25%에…

AI 모델끼리 '생각'을 직접 주고받는다… 텍스트 없이 소통하는 신기술 등장

AI 모델끼리 ‘생각’을 직접 주고받는다… 텍스트 없이 소통하는 신기술 등장

11월 5, 2025

인공지능 언어모델들이 서로 협력할 때 텍스트 메시지 대신 ‘생각’을 직접 교환하는 새로운 방법이 개발됐다. 중국 칭화대학교와 인피니전스 AI 연구팀은 여러 AI 모델이 함께 일할…

삼성 무한 '갤럭시 XR', 제미나이 AI로 음성·시선·제스처 제어…269만원에 출시

삼성 무한 ‘갤럭시 XR’, 제미나이 AI로 음성·시선·제스처 제어…269만원에 출시

10월 23, 2025

삼성전자가 22일 AI 기반 XR 헤드셋 ‘갤럭시 XR(Galaxy XR)’을 국내에 출시했다. 삼성전자에 따르면 이 제품은 삼성전자와 구글(Google), 퀄컴(Qualcomm)이 공동 개발한 ‘안드로이드 XR(Android XR)’ 플랫폼을…

AI for Service: Proactive Assistance with AI Glasses

“먼저 알아서 도와준다”는 AI 안경, 과연 축복일까 재앙일까

10월 20, 2025

상하이교통대 연구팀이 사용자가 요청하기 전에 먼저 필요를 파악해 서비스를 제공하는 AI 시스템 ‘알파서비스’를 공개했다. AI 안경만 쓰면 블랙잭 게임 조언부터 박물관 가이드, 쇼핑 추천까지…

Machine precision, human intuition: A new era in human-machine understanding

“AI가 당신의 스트레스까지 감지한다”… 인간 행동 패턴 분석하는 HMU 기술 주목

9월 22, 2025

글로벌 컨설팅 회사 캡제미니(Capgemini)가 발표한 리포트에 따르면, 인공지능 기술이 단순한 작업 수행을 넘어 인간의 감정과 맥락을 이해하는 새로운 단계로 진입하고 있다. 이른바 ‘인간-기계 이해(Human-Machine…

AI 투자왕 봤더니 1위는 ‘엘라드 길’… 퍼플렉시티·코그니션 등 36곳 투자

AI 투자왕 봤더니 1위는 ‘엘라드 길’… 퍼플렉시티·코그니션 등 36곳 투자

9월 9, 2025

AI 시장이 급성장하면서 조기 투자로 큰 수익을 올릴 것으로 예상되는 엔젤 투자자들의 순위가 공개됐다. 비즈니스 분석 플랫폼 CB 인사이트(CB Insights)가 지난달 22일(현지 시간) 발표한…

엔비디아, 488만원짜리 로봇용 AI 컴퓨팅 플랫폼 '젯슨 토르' 판매 시작

엔비디아, 488만원짜리 로봇용 AI 컴퓨팅 플랫폼 ‘젯슨 토르’ 판매 시작

8월 27, 2025

엔비디아(NVIDIA)가 로봇공학과 물리적 AI 분야를 겨냥한 새로운 컴퓨팅 플랫폼 젯슨 토르(Jetson Thor)를 출시했다고 25일(현지 시간) 발표했다. 블랙웰(Blackwell) 아키텍처 기반의 이 제품은 2,070 FP4 테라플롭스…

‘빛 바랜 문화재 고퀄리티로 재현한다’… 국가유산청, 한국형 '창작 AI' 개발 본격화

‘빛 바랜 문화재 고퀄리티로 재현한다’… 국가유산청, 한국형 ‘창작 AI’ 개발 본격화

8월 19, 2025

국가유산청이 한국의 문화유산을 기반으로 한 ‘멀티모달 인공지능’ 개발에 나선다고 14일(한국 시간) 발표했다. 이번 사업은 ‘2025년 민간클라우드 기반 AI·데이터레이크 활용지원 사업’에 선정된 것으로, 국가유산청·국가유산진흥원·모티프테크놀로지스가 컨소시엄을…

요즘 대세 AI는 ‘그록’… 생성형 AI 웹사이트 성장률 1위 등극

요즘 대세 AI는 ‘그록’… 생성형 AI 웹사이트 성장률 1위 등극

8월 12, 2025

생성형 AI 시장에서 새로운 강자가 등장했다. 일론 머스크(Elon Musk)의 xAI가 개발한 AI 챗봇 그록(Grok)이 7월 주요 생성형 AI 웹사이트 중 가장 높은 월간 성장률을…

NASA-구글, 화성 우주비행사용 AI 의료 도우미 공동 개발

NASA-구글, 화성 우주비행사용 AI 의료 도우미 공동 개발

8월 11, 2025

나사(NASA)와 구글(Google)이 화성 탐사 임무를 수행하는 우주비행사들의 건강을 지키기 위한 인공지능 의료 도우미를 공동 개발하고 있다고 테크크런치(TechCrunch)가 8일(현지 시간) 보도했다. 인간의 우주 탐사 임무가…

핀터레스트 CEO “AI 쇼핑, 비서까지는 가능하지만, 대리 구매는 멀었다”

핀터레스트 CEO “AI 쇼핑 비서 가능하지만, 대리 AI 구매는 아직 멀었다”

8월 11, 2025

핀터레스트(Pinterest) CEO 빌 레디(Bill Ready)가 AI 에이전트가 사용자를 대신해 쇼핑하는 에이전틱 웹(agentic web) 시대는 아직 먼 미래의 일이라고 밝혔다. 테크크런치(TechCrunch)가 8일(현지 시간) 보도한 내용에…