Two ~300B MoE models, each on ONE 128 GB mini PC (AMD Strix Halo): GLM-5.3-Flash at ~580 tok/s prefill, MiMo-V2.6-Flash up to 44 tok/s decode. EXL3 weights + open ROCm engine
128GB 미니PC 한 대에 3000억 급 모델을 돌리는 엔진이 공개됐다
로컬에서 큰 모델을 돌린다면 서버급 GPU 없이도 쓸 수 있는 선택지가 생겼다
이 기사는 두 개의 대형 모델, GLM-5.3-Flash와 MiMo-V2.6-Flash를 각각 하나의 128GB 미니 PC에 설치하는 방법을 소개합니다. 이 모델들은 토큰당 처리 속도가 빠르며, GLM-5.3-Flash는 약 580토큰/초, MiMo-V2.6-Flash는 최대 44토큰/초를decode합니다. 이 정보는 AI 모델의 성능과 사용 가능성에 관심이 있는 사람들에게 중요하며, 소상공인이나 창작자들이 직접 활용할 수 있는 기회가 생겼습니다.
로컬에서 큰 모델을 돌린다면 서버급 GPU 없이도 쓸 수 있는 선택지가 생겼다
원문 읽기이어서 볼 것
이 글을 읽은 뒤 바로 이어볼 수 있는 추천
더 읽기로 감을 넓히고, 사례를 본 뒤, 필요하면 참여나 도구로 넘어가면 됩니다.
다음 행동
아직 댓글이 없습니다. 첫 댓글을 작성해보세요!