Search

양자화

오픈AI, 소프트웨어만으로 추론 비용 절반 절감…챗GPT 무료 트래픽 GPU 수백 장으로

오픈AI, 소프트웨어로 추론 비용 절반 절감…챗GPT 무료 트래픽 GPU 수백 장 만으로 처리한다

7월 8, 2026

오픈AI 엔지니어들이 소프트웨어 최적화만으로 AI 모델 운영 비용을 절반 이상 줄였다. IT 전문 매체 디인포메이션(The Information)이 보도했다. 새 하드웨어를 늘리지 않고, 이미 학습된 모델을…

투게더AI, 2비트 KV 캐시 압축 'OSCAR' 오픈소스 공개…긴 문맥 AI 추론 비용 낮춘다

투게더AI, 2비트 KV 캐시 압축 ‘OSCAR’ 오픈소스 공개…긴 문맥 AI 추론 비용 낮춘다

5월 27, 2026

투게더AI가 긴 문맥 LLM 서빙용 2비트 KV 캐시 압축 ‘OSCAR’를 오픈소스로 공개했다. 어텐션 통계로 회전축을 정해 INT2 압축의 정확도 손실을 줄였다. AI 추론 비용을…

구글, AI 모델 압축 기술 터보퀀트 공개 - 성능 손실 없이 모델 크기 절반으로

구글, AI 모델 압축 기술 터보퀀트 공개 – 성능 손실 없이 모델 크기 절반으로

3월 26, 2026

구글(Google) 딥마인드(DeepMind) 연구팀이 대형 AI 모델의 크기를 대폭 줄이면서도 성능 손실을 최소화하는 새 양자화(quantization) 기술 ‘터보퀀트(TurboQuant)’를 공개했다. 더뉴런(The Neuron)이 3월 25일(현지 시각) 보도한 바에…

Compress and Compare: Interactively Evaluating Efficiency and Behavior Across ML Model Compression Experiments

생성형 AI 시대의 모델 압축, 시각화 도구로 효율성과 성능 모두 잡는다

10월 8, 2024

머신러닝 모델의 규모가 급격히 커지면서 모델 압축의 중요성이 높아지고 있다. 최근 몇 년 사이 발표된 모델의 매개변수 수는 2018년 10억 개에서 2024년 1000억 개…