AI
colibrì:把 744B 模型当数据流流到 25GB 的笔记本上跑——纯 C 写的 MoE 推理引擎
colibrì 是个纯 C 写的零依赖 MoE 推理引擎,把 744B 的 GLM-5.2 模型当成按需跨 VRAM / RAM / NVMe 三层缓存分阶段搬运的数据流,用「权重的 JIT」的思路在 25 GB 笔记本 RAM 上跑得动。
开源 TTS 也能压闭源一头:Fish Audio S2 的 4B 模型真有那么神?
我折腾本地 TTS 一直觉得有两座大山:要么模型小得像个电子喇叭,要么闭源 API 念得再好也绕不开上传文本。 … 阅读更多
开源大模型打到闭源公司的成本底线了
Mozilla 7 月发的那份《开源 AI 现状》报告里藏着几个有意思的数据:36 个月推理价格跌 50 倍,OpenRouter 上开源权重模型占比突破 50%,但能力差距其实是锯齿状的。作为本地跑模型的人,我的真实反应没那么兴奋——这场战争真正的受益人是企业。
Mac 上还有比 Ollama 更快的本地推理引擎
Apple Silicon 上有个叫 Rapid-MLX 的纯 MLX 本地推理引擎,官方说法是比 Ollama 快 2 到 4 倍。我在 16GB Mac 上装了一把,体感差异明显,但 16GB 装不下 35B——这是一篇折腾日志,不是广告。
TTS 也能脱离 PyTorch 了:MOSS-TTS 的 llama.cpp 后端
我之前在 NAS 上跑过几个 TTS 服务,最后发现最烦的不是模型效果,是环境。一个项目要 PyTorch,另 … 阅读更多
TTS 模型也用上 GGUF 了,500M 参数手机直跑
NeuTTS 把 GGUF 这套思路搬到了语音模型上——552M 参数的 Air 走 Q4 GGUF 量化,手机、Mac、树莓派都能实时合成,3 秒克隆一个说话人,顺带还做了情感版和水印。