오픈AI 엔지니어들이 소프트웨어 최적화만으로 AI 모델 운영 비용을 절반 이상 줄였다. IT 전문 매체 디인포메이션(The Information)이 보도했다. 새 하드웨어를 늘리지 않고, 이미 학습된 모델을…
투게더AI가 긴 문맥 LLM 서빙용 2비트 KV 캐시 압축 ‘OSCAR’를 오픈소스로 공개했다. 어텐션 통계로 회전축을 정해 INT2 압축의 정확도 손실을 줄였다. AI 추론 비용을…
구글(Google) 딥마인드(DeepMind) 연구팀이 대형 AI 모델의 크기를 대폭 줄이면서도 성능 손실을 최소화하는 새 양자화(quantization) 기술 ‘터보퀀트(TurboQuant)’를 공개했다. 더뉴런(The Neuron)이 3월 25일(현지 시각) 보도한 바에…
머신러닝 모델의 규모가 급격히 커지면서 모델 압축의 중요성이 높아지고 있다. 최근 몇 년 사이 발표된 모델의 매개변수 수는 2018년 10억 개에서 2024년 1000억 개…