Running 95.5 GiB Qwen3.8-Flash-Next at 41–52 tok/s on a 64GB Mac (1.76x faster than llama.cpp): Slipstream release, 130k context scaling, + Swift variant
Qwen3.8-Flash-Next 모델을 빠르게 실행할 수 있는 Slipstream 엔진이 출시되었습니다. 이 엔진은 기존 모델을 사용하지 않고 1.76배 더 빠른 속도로 작동합니다. 또한 긴 컨텍스트에서도 성능이 안정적입니다.
Qwen3.8-Flash-Next 모델을 빠르게 실행할 수 있는 Slipstream 엔진이 출시되었습니다. 이 엔진은 기존 모델을 사용하지 않고 1.76배 더 빠른 속도로 작동합니다. 또한 긴 컨텍스트에서도 성능이 안정적입니다.
로컬에서 큰 모델을 돌리는 개발자라면 맥에서 쓰는 추론 엔진을 오늘 바꿔볼 수 있다
원문 읽기이어서 볼 것
이 글을 읽은 뒤 바로 이어볼 수 있는 추천
더 읽기로 감을 넓히고, 사례를 본 뒤, 필요하면 참여나 도구로 넘어가면 됩니다.
다음 행동
아직 댓글이 없습니다. 첫 댓글을 작성해보세요!