Search

  • Home
  • AI Report 언어 모델 연구

AI Report 언어 모델 연구

"눈으로 보고, 글로 계산"… AI 추론 능력 끌어올리는 해법 찾았다

“눈으로 보고, 글로 계산”… AI 추론 능력 끌어올리는 해법 찾았다

11월 27, 2025

인공지능이 사람처럼 생각하려면 무엇이 필요할까. 중국 홍콩중문대학과 상하이AI연구소 공동 연구팀이 AI의 논리력을 측정하는 대표적인 시험인 ARC-AGI에서 ‘이미지 보기’와 ‘글자 읽기’를 적절히 조합해 기존 방식보다…

AI에 "넌 가난한 학생이야" 역할 줬더니… 취향 물을 땐 역할 충실, 시험 보면 본색 드러내

AI에 “넌 가난한 학생이야” 역할 줬더니… 취향 물을 땐 역할 충실, 시험 보면 본색 드러내

11월 26, 2025

요즘 AI가 인간처럼 행동할 수 있다는 기대가 커지고 있다. 설문조사나 사회과학 연구에서 AI를 ‘가상의 응답자’로 활용하려는 시도도 늘고 있다. 하지만 미국 오하이오주의 신시내티 대학교…

AI한테 마피아 게임 시켰더니… 최신 AI 12개 전부 거짓말쟁이 못 찾아

AI한테 마피아 게임 시켰더니… 최신 AI 12개 전부 거짓말쟁이 못 찾아

11월 26, 2025

인간은 상대방의 표정, 말투, 몸짓을 보고 “저 사람 지금 거짓말하는 것 같은데?”라고 느끼는 능력이 있다. 그렇다면 가장 똑똑하다는 AI는 어떨까? 일본 도쿄대학교 연구팀이 GPT-4o,…

Classification of Hope in Textual Data using Transformer-Based Models

AI가 ‘희망’이라는 감정을 이해할까? AI 희망 감지 대결서 구형 AI 모델이 압승

11월 25, 2025

미국 텍사스공대 연구팀이 문장 속 ‘희망’이라는 감정을 찾아내는 AI 실험을 했다. 놀랍게도 5년 전에 나온 구형 AI가 최신 AI들을 제치고 가장 뛰어난 성능을 보였다.…

People readily follow personal advice from AI but it does not improve their well-being

AI가 준 조언, 심각한 문제에도 62%가 실천했지만… 2주 후 효과는 ‘제로’

11월 25, 2025

영국 AI 안전연구소(UK AI Security Institute)의 대규모 실험 연구가 충격적인 결과를 발표했다. 해당 논문에 따르면, 사람들은 AI가 제공하는 개인적 조언을 기꺼이 따르지만, 정작 그…

AI는 답 모르면 무조건 "아니요"… 서울대 연구진, 챗GPT의 숨겨진 습관 발견

AI는 답 모르면 무조건 “아니요”… 서울대 연구진, 챗GPT의 숨겨진 습관 발견

11월 24, 2025

인공지능 챗봇에 질문했을 때 “예” 또는 “아니요”로 답해야 하는 상황에서, AI가 답을 모르면 무조건 “아니요”라고 대답하는 경향이 있다는 연구 결과가 나왔다. 서울대학교 전기·정보공학부 연구팀의…

챗GPT에 1000번 물어봐도 비슷한 답변뿐... 베이징대 연구진이 해결책 찾았다

챗GPT에 1,000번 물어봐도 비슷한 답변뿐… 베이징대 연구진이 해결책 찾았다

11월 24, 2025

대규모 AI 언어모델이 JSON 같은 정해진 형식으로 답변을 만들 때, 문법적으로는 맞지만 비슷비슷한 답변만 반복한다는 문제가 새로운 연구로 확인됐다. 중국 베이징대 연구팀은 이 문제를…

AI에 코딩 도구 주면 정답률 19%↑…풀이 과정은 41% 더 형편없어져

AI에 코딩 도구 주면 정답률 19%↑…풀이 과정은 41% 더 형편없어져

11월 20, 2025

ChatGPT나 Claude 같은 AI에게 코드를 실행할 수 있는 기능을 주면 정답을 더 잘 맞히지만, 정작 ‘어떻게 그 답이 나왔는지’ 설명하는 능력은 오히려 떨어진다는 연구…

챗GPT에게 "어느 나라가 더 나쁜가?" 물었더니... AI도 국가별 차별한다

챗GPT에게 “어느 나라가 더 나쁜가?” 물었더니… AI도 국가 차별한다

11월 20, 2025

유엔 안전보장이사회의 실제 투표 기록을 분석한 연구에서 ChatGPT 등 주요 AI 언어모델들이 국가에 따라 뚜렷한 편견을 보인다는 사실이 밝혀졌다. 해당 논문에 따르면 연구 결과,…

AI 여러 개 쓰면 답 정확해진다더니... 토큰비용 5배에 정답률은 제자리

AI 여러 개 쓰면 답 정확해진다더니… 토큰비용 5배에 정답률은 제자리

11월 19, 2025

여러 AI가 함께 문제를 풀면 더 정확한 답을 낼 수 있다는 아이디어가 주목받고 있다. 하지만 미국 버지니아공대 연구진이 발표한 논문에 따르면, 모든 질문에 AI끼리…

Benchmarking Visual LLMs Resilience to Unanswerable Questions on Visually Rich Documents

“챗GPT도 속았다”… AI에게 ‘답 없는 질문’하자 60% 이상 틀려

11월 18, 2025

문서를 읽고 질문에 답하는 AI가 크게 발전했지만, 정작 “이 질문은 답할 수 없다”는 사실을 알아채는 능력은 형편없는 것으로 드러났다. 이탈리아 토리노 공대 연구팀이 GPT-4를…

AI 설득 실험, 챗GPT는 유연한 반면 제미나이는 상당한 고집불통

AI 설득 실험, 챗GPT는 유연한 반면 제미나이는 상당한 고집불통

11월 17, 2025

AI 설득 실험, 챗GPT는 유연한 반면 제미나이는 상당한 고집불통 AI를 여러 개 연결해 서로 대화하게 했더니 놀라운 일이 벌어졌다. 인간처럼 다른 AI의 말에 설득당해…

AI 과학자 '코스모스', 6개월 연구를 하루 만에…"생성형 AI가 과학 발견을 자동화하다"

AI 과학자 ‘코스모스’, 6개월 연구를 하루 만에 완료

11월 17, 2025

퓨처하우스(FutureHouse)가 차세대 AI 과학자 ‘코스모스(Kosmos)’를 공개했다. 코스모스는 연구자가 6개월 동안 수행할 분량의 연구를 단 하루 만에 완료하며, 생성형 AI를 활용한 과학 연구 자동화의 새로운…

AI가 실험 없이 만든 가짜 논문, AI 심사위원에게 보여주자 최대 82% 통과

AI가 실험 없이 만든 가짜 논문, AI 심사위원에게 보여주자 최대 82% 통과

11월 13, 2025

인공지능 기술이 과학 논문을 쓰고 검토하는 시대가 되면서 새로운 문제가 생겼다. 미국 워싱턴대학교 연구팀이 개발한 실험용 AI 심사 시스템에서, 실제 실험 없이 AI가 만든…

Nested Learning: The Illusion of Deep Learning Architectures

“챗GPT는 왜 배운 걸 금방 잊을까?” 구글이 밝힌 AI의 ‘기억상실’ 비밀

11월 11, 2025

구글 리서치가 현재 인공지능의 근본적인 문제점을 지적하며, 이를 해결할 새로운 학습 방법 ‘중첩 학습(Nested Learning)’을 제안했다. 이 연구는 챗GPT 같은 대규모 언어모델이 왜 대화…

AI가 언어 습관까지 배운다? 치매 환자 소통 돕는 '맞춤형 대화 기술' 등장

AI가 언어 습관까지 배운다? 치매 환자 소통 돕는 ‘맞춤형 대화 기술’ 등장

11월 11, 2025

대형 언어 모델(LLM)이 발전하면서 AI와의 대화가 점점 자연스러워지고 있다. 하지만 여전히 해결되지 않은 과제가 있다. 바로 상대방의 언어 스타일에 맞춰 대화하는 ‘어휘 정렬(lexical alignment)’…

"URL만으로 충분하다"… AI, 정치 뉴스 판별 정확도 92% 돌파

“URL만으로 충분하다”… AI, 정치 뉴스 판별 정확도 92% 돌파

11월 11, 2025

인공지능(AI)이 뉴스 기사의 인터넷 주소(URL)만 보고도 정치 관련 내용인지 아닌지를 높은 정확도로 구분할 수 있다는 연구 결과가 나왔다. 스페인 바르셀로나 슈퍼컴퓨팅 센터와 바르셀로나대학교, 카탈루냐…

"베트남어가 가장 협력적"… AI, 사용 언어 따라 협력 수준 다르다

“베트남어가 가장 협력적”… AI, 사용 언어 따라 협력 수준 다르다

11월 10, 2025

룩셈부르크 과학기술연구소(Luxembourg Institute of Science and Technology)의 알레시오 부세미(Alessio Buscemi) 연구원과 케임브리지대학교(University of Cambridge) 피에트로 리오(Pietro Liò) 교수 연구팀이 GPT-4o와 라마 4 매버릭(Llama 4…

AI에게 그림 그리라고 했더니... '>' 와 '

AI에게 그림 그리라고 했더니… ‘<‘ 와 ‘>’ 구분도 못했다

11월 10, 2025

중국 텐센트 유투랩 연구팀이 AI의 ‘그림 그리기 능력’을 테스트하는 새로운 평가 방법을 개발했다. 이름은 ‘LTD-Bench’다. 기존에는 AI 성능을 숫자로만 평가했지만, 이제는 AI가 직접 그린…

Can LLMs subtract numbers?

AI, ‘덧셈’보다 ‘뺄셈’에서 훨씬 자주 틀린다?… “음수 앞에 ‘-‘부호 빼먹어”

11월 6, 2025

챗GPT 같은 AI가 덧셈 문제는 거의 완벽하게 풀지만, 뺄셈 특히 답이 음수로 나오는 계산에서는 이상한 실수를 반복한다는 연구 결과가 나왔다. 독일 자를란트대학교와 미국 브라운대학교…

One ruler to measure them all: Benchmarking multilingual long-context language models

“폴란드어 1위, 영어 6위, 한국어 22위”… AI 언어 이해력 테스트 결과 충격

11월 6, 2025

메릴랜드 대학교와 UMass Amherst 연구진이 26개 언어로 대형 언어 모델의 긴 맥락 처리 능력을 평가한 원룰러(OneRuler) 벤치마크를 공개했다. 해당 연구 논문에 따르면, 한국어는 26개…

AI 모델끼리 '생각'을 직접 주고받는다… 텍스트 없이 소통하는 신기술 등장

AI 모델끼리 ‘생각’을 직접 주고받는다… 텍스트 없이 소통하는 신기술 등장

11월 5, 2025

인공지능 언어모델들이 서로 협력할 때 텍스트 메시지 대신 ‘생각’을 직접 교환하는 새로운 방법이 개발됐다. 중국 칭화대학교와 인피니전스 AI 연구팀은 여러 AI 모델이 함께 일할…

AI, 상황 따라 법적 책임질 수도... 구글이 제시한 'AI 인격'의 미래

AI, 상황 따라 법적 책임질 수도… 구글이 제시한 ‘AI 인격’의 미래

11월 4, 2025

구글 딥마인드(Google DeepMind) 연구진이 인공지능(AI)을 어떻게 다뤄야 할지에 대한 논문을 내놨다. 핵심은 간단하다. AI에게 ‘인격’을 줄 수 있다는 것이다. 단, 여기서 말하는 인격은 AI가…

Can AI be Accountable

“AI가 잘못 판단하면 누구 책임?”… 800년 전 마그나카르타가 제시한 해법

11월 4, 2025

미국 뉴햄프셔대학교(University of New Hampshire) 앤드류 쿤 교수가 발표한 논문에 따르면, AI의 힘이 빠르게 강해지는 지금 우리는 중대한 기로에 서 있다. AI가 우리 삶에…

Who Has The Final Say? Conformity Dynamics in ChatGPT's Selections

챗GPT, 8명이 반대하자 99.9% 의견 바꿔… AI도 ‘눈치’ 본다

11월 3, 2025

챗GPT가 객관적으로 판단하는 도구가 아니라 다른 사람들의 의견에 따라 자기 생각을 바꾸는 ‘눈치 보는 AI’라는 연구 결과가 나왔다. 독일 빌레펠트대학교 연구진은 GPT-4o를 대상으로 세…

Remote Labor Index: Measuring AI Automation of Remote Work

AI 자동화 공포, 과장됐다… 실제 업무 중 겨우 2.5%만 해내

11월 3, 2025

인공지능이 지식과 추론 벤치마크에서 빠르게 발전하고 있지만, 실제 경제적 가치를 창출하는 업무를 자동화하는 능력은 여전히 바닥 수준에 머물러 있다는 연구 결과가 나왔다. AI 안전…

Emergent Introspective Awareness in Large Language Models

AI, 입력된 글자와 ‘머릿속 생각’ 구별한다… 앤트로픽 “LLM, 자기 내부 상태 일부 인식”

10월 31, 2025

AI 개발사 앤트로픽(Anthropic)이 자사 AI 모델 ‘클로드(Claude)’가 자신의 내부 상태 일부를 제한적으로 인식할 수 있다는 연구 결과를 발표했다. 연구진은 AI의 뇌에 해당하는 부분에 특정…

SocializeChat: A GPT-Based AAC Tool Grounded in Personal Memories to Support Social Communication

“공원서 낚시했던 기억” AI가 대화로 만든다… 노년층을 위한 대화 보조 도구 등장

10월 28, 2025

중국 저장대학교 연구팀이 말하기 어려운 노인들의 과거 추억을 활용해 더 풍부한 대화를 나눌 수 있도록 돕는 인공지능 대화 보조 도구를 개발했다. 이 시스템은 사용자가…

Outraged AI: Large language models prioritise emotion over cost in fairness enforcement

“조금만 불공평해도 용납 못해”… AI, 도덕 판단에는 인간보다 더 감정적으로 판단한다

10월 28, 2025

중국 칭화대학교 심리인지과학과 연구팀이 AI의 감정 기반 의사결정을 분석한 결과, 대규모 언어모델(LLM)이 인간처럼 감정을 이용해 도덕적 판단을 내린다는 사실이 처음으로 입증됐다. 연구팀은 성인과 AI…

GPT-5, ‘기억상실증 걸린 천재’ 수준… MIT·스탠퍼드 연구진이 밝힌 AGI의 현주소

GPT-5, ‘기억상실증 걸린 천재’ 수준… MIT·스탠퍼드 연구진이 밝힌 AGI의 현주소

10월 27, 2025

AGI(범용 인공지능)가 정확히 무엇인지에 대한 명확한 정의가 없어, AI 기술이 얼마나 발전했는지 제대로 평가하기 어렵다는 문제가 있었다. 미국 AI 안전센터(Center for AI Safety), UC버클리,…

AI Report 언어 모델 연구 – AI 매터스