Qwen3.8-Flash-Next 177B NVFP4(119GiB): SSD streaming at 9-10 tok/s on one 16 GB RTX 5060 Ti + 32 GB RAM
Qwen3.8-Flash-Next 모델은 VRAM과 RAM에 맞지 않는 큰 모델을 처리하기 위해 SSD에서 데이터를 스트리밍합니다. 현재 9-10 토큰/초의 속도로 작동하고, 향후 업데이트에서는 이 속도가 약 14-15 토큰/초까지 빨라질 것으로 예상됩니다. 이 모델은 창작자나 AI에 관심 있는 사람들에게 도움이 될 수 있습니다.
Qwen3.8-Flash-Next 모델은 VRAM과 RAM에 맞지 않는 큰 모델을 처리하기 위해 SSD에서 데이터를 스트리밍합니다. 현재 9-10 토큰/초의 속도로 작동하고, 향후 업데이트에서는 이 속도가 약 14-15 토큰/초까지 빨라질 것으로 예상됩니다. 이 모델은 창작자나 AI에 관심 있는 사람들에게 도움이 될 수 있습니다.
로컬에서 큰 모델을 돌리고 싶다면 그래픽카드와 메모리 예산 기준을 다시 세울 수 있다
원문 읽기이어서 볼 것
이 글을 읽은 뒤 바로 이어볼 수 있는 추천
더 읽기로 감을 넓히고, 사례를 본 뒤, 필요하면 참여나 도구로 넘어가면 됩니다.
다음 행동
아직 댓글이 없습니다. 첫 댓글을 작성해보세요!