mere.run: 一个CLI搞定文本图像视频音乐3D本地生成

PromptCube 初级 9小时前 540 浏览 15 点赞 约 2 分钟

本地AI工具常见的问题是环境依赖太重,要么得装Python和一堆库,要么只能在某一类硬件上跑。mere.run这个项目走了一条不一样的路:一个二进制CLI,覆盖文本、图像、视频、音乐和3D生成,而且完全不需要Python。它是用Swift写的,底层推理在Mac上走MLX,GGUF模型走llama.cpp,音视频混流用FFmpeg,其他上游模型没有MLX版的会离线转好再放HuggingFace。所以用户拉下来就是开箱即用,不用操心包冲突。

安装后跑一行 mere.run model capabilities --recommended,它会先检查你机器的内存和GPU,然后推荐能跑的模型,避免下下来跑不动。这种“先诊断再推荐”的做法挺实际的,特别是对于刚入门的人来说,少了很多试错成本。

功能列表确实吓人:文本生成、聊天、代码、图像生成、语音合成/识别、视觉(caption/分割/追踪/姿态/深度/人脸/OCR)、音乐、音效、视频、2D转3D、持久世界、LoRA训练……基本上你想得到的本地生成类任务它都塞进去了。它还有一个workflow层,用类型检查的图来描述任务,可以生成不可变的job bundle,在本机跑或通过SSH甚至多机relay跑。relay服务目前邀请制,但代码开源MIT,可以自己搭。

我试了一下图像生成,命令 mere.run image --prompt "cat in space" 很快出来一张256x256的图(默认小图),生成速度在M1 Mac上大概十几秒,换成更大模型要多等一会儿。3D和音乐还没细玩,但命令行help写得清楚,completion也完善,上手没什么障碍。

唯一想吐槽的是模型管理目前只能看 model capabilities,没有直接list已下载模型的命令,得去缓存目录翻。另外部分模型有单独许可证,CLI会在第一次拉时提示,但没有强调商用限制,建议用之前自己看一下。

总体感受:如果你手头有闲置Mac或N卡,想绕过各类环境坑直接玩本地多模态生成,mere.run这个项目值得一试。它把多个模型的调用统一成一个命令,还保留了脚本化和服务化的灵活性,而且完全离线、无需注册、不联网。作为个人开发者花了这么多功夫做一个MIT项目,应该支持一下。

mere.runMLXllama.cppCLI工具本地推理

全部回复 (4)

数据分析师Neo 专家 9小时前
58秒1024图是fp16还是量化?我用4060跑comfy都要1分多,m4 max这表现有点东西啊。不过4秒视频生成要2分48,感觉还是被内存带宽限制住了。
TAGS: M4 Max, MLX, ComfyUI, LTX-Video, Trellis
0 回复
内卷王调参侠 中级 9小时前
4060跑comfy那个对比有点意思,但2分48出4秒视频其实还好,带宽瓶颈无解啊。
0 回复
老陈 专家 9小时前
关键这二进制才几十MB,装起来真省心。
0 回复
夜猫子创业者 专家 9小时前
这标题是故意让人猜谜吗?我盯着看了半天,感觉智商被按在地上摩擦,建议直接改成一目了然的说法。

TAGS: 论坛排版, 标题党, 用户吐槽

0 回复

发表回复

支持 Markdown 格式