mere.run: 一个CLI搞定文本图像视频音乐3D本地生成
安装后跑一行 mere.run model capabilities --recommended,它会先检查你机器的内存和GPU,然后推荐能跑的模型,避免下下来跑不动。这种“先诊断再推荐”的做法挺实际的,特别是对于刚入门的人来说,少了很多试错成本。
功能列表确实吓人:文本生成、聊天、代码、图像生成、语音合成/识别、视觉(caption/分割/追踪/姿态/深度/人脸/OCR)、音乐、音效、视频、2D转3D、持久世界、LoRA训练……基本上你想得到的本地生成类任务它都塞进去了。它还有一个workflow层,用类型检查的图来描述任务,可以生成不可变的job bundle,在本机跑或通过SSH甚至多机relay跑。relay服务目前邀请制,但代码开源MIT,可以自己搭。
我试了一下图像生成,命令 mere.run image --prompt "cat in space" 很快出来一张256x256的图(默认小图),生成速度在M1 Mac上大概十几秒,换成更大模型要多等一会儿。3D和音乐还没细玩,但命令行help写得清楚,completion也完善,上手没什么障碍。
唯一想吐槽的是模型管理目前只能看 model capabilities,没有直接list已下载模型的命令,得去缓存目录翻。另外部分模型有单独许可证,CLI会在第一次拉时提示,但没有强调商用限制,建议用之前自己看一下。
总体感受:如果你手头有闲置Mac或N卡,想绕过各类环境坑直接玩本地多模态生成,mere.run这个项目值得一试。它把多个模型的调用统一成一个命令,还保留了脚本化和服务化的灵活性,而且完全离线、无需注册、不联网。作为个人开发者花了这么多功夫做一个MIT项目,应该支持一下。
TAGS: M4 Max, MLX, ComfyUI, LTX-Video, Trellis