用 Hetzner 的实验性接口跑 Qwen3.6 居然这么快

小Ray在路上 中级 2026/7/24 237 浏览 0 点赞 约 2 分钟

最近在给项目找低成本的推理方案,无意中撞到了 Hetzner 正在搞的一个推理实验接口。最让我惊喜的是,它不仅完全兼容 OpenAI API 格式,而且在响应速度上表现得极其激进。对于那些习惯了在各种 API 平台之间迁移、厌倦了复杂配置的开发者来说,这种只需要修改一个 base_url 就能无缝切换的体验确实很舒服。

用 Hetzner 的实验性接口跑 Qwen3.6 居然这么快

这次实验性接口提供的是 Qwen3.6-35B-A3B-FP8 模型。从规格上看,这是一个 MoE 架构的模型,激活参数仅为 3B,但支持高达 262K 的上下文窗口。虽然它目前处于实验阶段,没有正式的 SLA 服务等级协议保证,随时可能波动,但在实际测试中,它的速度快到令人发指。

我实测了一下,首字响应时间(TTFT)大约在 150ms 左右,而输出速度在峰值时能跑到每秒 200 多个 token。在目前的免费/实验性推理接口中,这个性能表现绝对属于第一梯队。当然,由于是 FP8 量化版本,模型在处理极高精度的算术题时偶尔会出现偏差,但如果只是处理常规的文本生成、代码辅助或图像识别任务,它的能力完全足够。

这里有一个非常关键的细节,很多初次尝试的人可能会踩坑,那就是 enable_thinking 参数。这个模型在默认情况下可能会在输出最终答案之前,在内部进行大量的推理思考。如果你在请求体中不显式地将其关闭,你会发现响应速度明显变慢,而且会消耗掉大量的 token 额度。

如果你想快速部署测试,直接使用 Python 的 openai 库即可。首先确保环境安装了最新版本:

pip install openai

然后参考下面的代码实现调用。请注意,重点在于 extra_body 里的 chat_template_kwargs 配置,必须将 enable_thinking 设为 False 才能获得最快的响应速度:

from openai import OpenAI

client = OpenAI(
 base_url="https://inference.hetzner.com/api/v1",
 api_key="你的TOKEN",
)

response = client.chat.completions.create(
 model="Qwen/Qwen3.6-35B-A3B-FP8",
 messages=[
 {"role": "user", "content": "用一句话解释为什么天空是蓝色的。"}
 ],
 extra_body={
 "chat_template_kwargs": {
 "enable_thinking": False, # 必须关闭思考过程,否则响应延迟会增加
 }
 },
)

print(response.choices[0].message.content)

这种把实验产品直接扔给社区测试的风格非常 Hetzner。虽然目前接口里只有一个模型,且不保证长期稳定性,但它提供了一个极低成本的测试环境。如果你正好需要一个轻量级的 API 接口来替代昂贵的商业方案,或者在开发阶段需要一个快速响应的临时后端,这个接口非常值得折腾一下。

提示词AILLMcloud

全部回复 (3)

架构师Neo 中级 2026/7/24
确实快,我试了下写代码基本秒出,挺好用的。
0 回复
内卷王调参侠 中级 2026/7/24
这个怎么鉴权?直接改地址就能用,不用 API Key 吗?
0 回复
创业者阿杰 中级 2026/7/24
我之前试过几个类似的,这个响应确实快,挂在翻译插件里很稳。
0 回复

发表回复

支持 Markdown 格式