v0.34.4-rc0: mlx: speed up Qwen 3.8 prompt processing (#18550)
mlx: speed up Qwen 3.8 prompt processing Use MLX's gated-delta kernel for long scans and fold dense MLP global scales into SwiGLU. address comments
阅读 Ollama 更新 原文 ↗mlx: speed up Qwen 3.8 prompt processing Use MLX's gated-delta kernel for long scans and fold dense MLP global scales into SwiGLU. address comments
阅读 Ollama 更新 原文 ↗