用 Hetzner 的实验性接口跑 Qwen3.6 居然这么快
base_url 就能无缝切换的体验确实很舒服。这次实验性接口提供的是 Qwen3.6-35B-A3B-FP8 模型。从规格上看,这是一个 MoE 架构的模型,激活参数仅为 3B,但支持高达 262K 的上下文窗口。虽然它目前处于实验阶段,没有正式的 SLA 服务等级协议保证,随时可能波动,但在实际测试中,它的速度快到令人发指。
我实测了一下,首字响应时间(TTFT)大约在 150ms 左右,而输出速度在峰值时能跑到每秒 200 多个 token。在目前的免费/实验性推理接口中,这个性能表现绝对属于第一梯队。当然,由于是 FP8 量化版本,模型在处理极高精度的算术题时偶尔会出现偏差,但如果只是处理常规的文本生成、代码辅助或图像识别任务,它的能力完全足够。
这里有一个非常关键的细节,很多初次尝试的人可能会踩坑,那就是 enable_thinking 参数。这个模型在默认情况下可能会在输出最终答案之前,在内部进行大量的推理思考。如果你在请求体中不显式地将其关闭,你会发现响应速度明显变慢,而且会消耗掉大量的 token 额度。
如果你想快速部署测试,直接使用 Python 的 openai 库即可。首先确保环境安装了最新版本:
pip install openai然后参考下面的代码实现调用。请注意,重点在于 extra_body 里的 chat_template_kwargs 配置,必须将 enable_thinking 设为 False 才能获得最快的响应速度:
from openai import OpenAI
client = OpenAI(
base_url="https://inference.hetzner.com/api/v1",
api_key="你的TOKEN",
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B-FP8",
messages=[
{"role": "user", "content": "用一句话解释为什么天空是蓝色的。"}
],
extra_body={
"chat_template_kwargs": {
"enable_thinking": False, # 必须关闭思考过程,否则响应延迟会增加
}
},
)
print(response.choices[0].message.content)这种把实验产品直接扔给社区测试的风格非常 Hetzner。虽然目前接口里只有一个模型,且不保证长期稳定性,但它提供了一个极低成本的测试环境。如果你正好需要一个轻量级的 API 接口来替代昂贵的商业方案,或者在开发阶段需要一个快速响应的临时后端,这个接口非常值得折腾一下。
