折腾记录
Mac 上还有比 Ollama 更快的本地推理引擎
Apple Silicon 上有个叫 Rapid-MLX 的纯 MLX 本地推理引擎,官方说法是比 Ollama 快 2 到 4 倍。我在 16GB Mac 上装了一把,体感差异明显,但 16GB 装不下 35B——这是一篇折腾日志,不是广告。
TTS 也能脱离 PyTorch 了:MOSS-TTS 的 llama.cpp 后端
我之前在 NAS 上跑过几个 TTS 服务,最后发现最烦的不是模型效果,是环境。一个项目要 PyTorch,另 … 阅读更多
TTS 模型也用上 GGUF 了,500M 参数手机直跑
NeuTTS 把 GGUF 这套思路搬到了语音模型上——552M 参数的 Air 走 Q4 GGUF 量化,手机、Mac、树莓派都能实时合成,3 秒克隆一个说话人,顺带还做了情感版和水印。