최근 로컬 LLM에 관심이 많아지면서 MacBook에서도 어느 정도 수준의 AI 모델을 직접 실행할 수 있는지 테스트하고 있다. 특히 코딩과 디버깅 용도로 사용할 수 있는 모델을 찾고 있었는데, 최근 공개된 Alibaba Qwen 시리즈의 Qwen3.8이 상당히 흥미로웠다. 사용하는 MacBook Pro는 M3 Max, 30-core GPU, Unified Memory 36GB 사양이다. 이 환경에서 Qwen3.8 27B 모델을 Ollama로 실행해 보고, 일반 버전과 MLX 버전의 속도를 직접 비교했다.테스트 결과 요약Qwen3.8 27B 일반 버전9.74 tokens/secQwen3.8 27B MLX 버전33.26 tokens/sec약 3.41배 빠른 생성 속도동일한 프롬프트, 동일한 Context,..