Search

멀티모달

바이트댄스, 보면서 듣고 먼저 말 거는 AI…'시드리얼타임' 더우바오에 전면 적용

바이트댄스, 보면서 듣고 먼저 말 거는 AI…’시드리얼타임’ 더우바오에 전면 적용

8월 7, 2026

바이트댄스가 음성과 영상, 텍스트를 하나의 모델에서 동시에 처리하는 시드리얼타임(SeedRealtime)을 공개했다. 현지 시각 8월 5일 바이트댄스 시드(Seed) 팀이 공식 블로그에 게시한 발표다. 전이중(full-duplex)은 전화처럼 양쪽이…

알리바바, 2조 4천억 매개변수 '큐원 3.8' 프리뷰 공개…"페이블 5 다음은 우리"

알리바바, 2조 4천억 매개변수 ‘큐원 3.8’ 프리뷰 공개…”페이블 5 다음은 우리”

7월 20, 2026

알리바바가 7월 19일 매개변수 2조 4천억 개 규모의 큐원3.8-맥스-프리뷰를 공개했다. 페이블 5에 이어 두 번째라고 주장했으나 벤치마크와 모델 카드는 공개되지 않았다. 가중치 공개도 날짜…

구글 제미나이 3.5 프로, 6월 출시 약속 마감 임박…9일 남았다

구글 제미나이 3.5 프로, 6월 출시 약속 마감 임박…9일 남았다

6월 22, 2026

구글(Google)의 차세대 모델 제미나이 3.5 프로(Gemini 3.5 Pro)가 6월 일반 출시 약속을 지키지 못한 채 마감 시한에 쫓기고 있다. 빌드패스트위드AI(Build Fast with AI)에 따르면…

구글 '제미나이 옴니' 공개… 지금은 영상 편집기, 곧 이미지·오디오까지 만든다

[구글 I/O 2026] 구글 ‘제미나이 옴니’ 공개… 지금은 영상 편집기, 곧 이미지·오디오까지 만든다

5월 20, 2026

구글이 19일 I/O 2026에서 새로운 멀티모달 모델 ‘제미나이 옴니(Gemini Omni)’를 공개했다. 이름 그대로 모든(omni) 형태의 입력을 받아 원하는 결과물로 변환하는 모델이다. 다만 첫 출시…

오픈AI, 소라(Sora) 앱 4월 26일 공식 종료… AI 동영상 전략 재정비

오픈AI, 소라(Sora) 앱 4월 26일 공식 종료… AI 동영상 전략 재정비

4월 27, 2026

오픈AI가 4월 26일 소라(Sora) 웹·앱 서비스를 공식 종료했다. API는 9월 24일까지 유지된다. 챗GPT와 워크스페이스 에이전트 중심으로 사업 구조가 재편되는 신호다.

AI 매터스 기사 썸네일_UniMotion A Unified Framework for Motion-Text-Vision Understanding and Generation

AI가 사람 움직임을 ‘언어’처럼 이해하게 됐다

4월 2, 2026

북경대와 둥화대, 화난이공대 공동 연구진이 3월 23일 발표한 유니모션(UniMotion) 논문은 AI가 사람의 동작, 이미지, 텍스트를 하나의 ‘언어’처럼 자유롭게 읽고 쓸 수 있게 만든 첫…

임신테스트부터 은행거래까지… 시각장애인이 AI에게 맡긴 '극비 정보'들

임신테스트부터 은행거래까지… 시각장애인이 AI에게 맡긴 ‘극비 정보’들

7월 7, 2025

가족에게도 말 못 할 개인정보, AI가 지켜줄 수 있을까? 펜실베니아 주립대학교(Pennsylvania State University)와 콜로라도 대학교(University of Colorado) 연구팀이 시각장애인들의 생성형 AI 사용 실태를 조사한…

2024 Naver Consolidated Report

“검색도 쇼핑도 다 AI” 네이버가 말하는 AI 미래 ‘2024 통합보고서’

6월 23, 2025

2024 통합보고서 네이버, 검색·쇼핑·광고에 AI 전면 적용… ‘On-Service AI’ 선언 네이버가 생성형 AI 기술을 기반으로 자사 모든 서비스를 재설계하는 전사적 전략을 본격화했다. 2024년 통합보고서에…

"2030년, 합성데이터가 실제 데이터 사용량 추월" 키워드 분석으로 살펴본 AI 시장 전망

“2030년, 합성데이터가 실제 데이터 사용량 추월” 키워드로 살펴본 AI 시장 전망

6월 17, 2025

키워드 분석으로 살펴본 2024년 AI 주요 키워드 한국지능정보원(NIA)이 2024년 5월부터 12월까지 8개월간 국내 주요 언론 기사 173건을 분석한 결과, 올해 AI 데이터 분야에서는 합성데이터가…

영상 생성 AI 모델 ‘클링 2.0’ 출시… "MVL 도입으로 표현력 향상”

中 콰이쇼우, 영상 생성 AI 모델 ‘클링 2.0’ 출시… “MVL 도입으로 표현력 향상”

4월 16, 2025

콰이쇼우(Kuaishou, 快手)가 15일(현지 시간) ‘Kling AI 2.0’ 행사에서 혁신적인 AI 영상 생성 모델 ‘Kling AI 2.0 Master’를 공식 출시했다. 이번 모델은 기존 버전보다 대폭…

구글, 최고 지능형 AI 모델 '제미나이 2.5' 공개

구글, 최고 지능형 AI 모델 ‘제미나이 2.5 프로’ 공개… 에이전트에 최적화

3월 26, 2025

구글 딥마인드(Google DeepMind)가 25일(현지 시간) 자사 블로그를 통해, 지금까지 개발한 AI 모델 중 가장 지능적인 AI 모델인 ‘제미나이 2.5(Gemini 2.5)’를 출시했다고 밝혔다. 첫 번째…

오픈AI, 차세대 오디오 API 모델 출시… 단어 오류율 크게 개선돼

오픈AI, 차세대 오디오 API 모델 출시… 단어 오류율 크게 개선돼

3월 21, 2025

오픈AI가 20일(현지 시간) 자사 웹사이트를 통해 개발자를 위한 새로운 음성 인식(STT)과 음성 합성(TTS) 모델을 공개했다. API를 통해 공개된 이번 모델은 더 정확하고 맞춤형 음성…

구글, Gemini API에 실험용 모델 추가…개발자 피드백 수집 나서

구글, Gemini API에 실험용 모델 추가…개발자 피드백 수집 나서

11월 26, 2024

구글이 최근 Gemini API에 세 가지 실험용 모델을 추가하며 개발자들의 피드백 수집에 나섰다. 이번에 공개된 모델은 ‘gemini-exp-1121’, ‘gemini-exp-1114’, ‘learnlm-1.5-pro-experimental’로, 각각 코딩, 추론, 비전 기능…

삼성전자, 차세대 AI 모델 '가우스2' 공개...멀티모달 지원으로 성능 대폭 향상

삼성전자, 차세대 AI 모델 ‘가우스2’ 공개…멀티모달 지원으로 성능 대폭 향상

11월 22, 2024

삼성전자가 21일 ‘삼성 개발자 콘퍼런스 코리아 2024(Samsung Developer Conference Korea 2024)’를 온라인으로 개최하고 차세대 AI 모델 ‘삼성 가우스2(Samsung Gauss2)’를 공개했다. 이번 행사는 2014년부터 시작해…

네이버, 멀티모달 처리 능력 강화된 하이퍼클로바X 공개

네이버, 멀티모달 처리 능력 강화된 하이퍼클로바X 공개

8월 23, 2024

네이버가 자사의 대화형 AI 에이전트 클로바X(CLOVA X)에 시각 정보 처리 능력을 새롭게 추가한다고 밝혔다. 오는 27일 서비스 업데이트를 통해 이 기능이 도입될 예정이다. 또한…

검색 시장을 뒤흔들 핫 키워드 ‘멀티모달’

검색 시장을 뒤흔들 핫 키워드 ‘멀티모달’

7월 19, 2024

최근 AI 업계의 핫 키워드는 단연 ‘멀티모달(Multi-modal)’과 ‘AI 에이전트(AI Agent)’이다. 주요 생성형 AI 기술에 멀티모달 추가되고 정교화되면서 정보 검색의 양상이 크게 달라질 것으로 예상되고…