分享一个白嫖的推理接口:Hetzner Inference
OpenAI 兼容接口只要改个 base_url 就能跑,这种迁移成本几乎为零的体验确实舒服。Hetzner 最近在搞一个推理实验,目前提供 Qwen3.6-35B-A3B-FP8 模型,虽然是实验性质,没有 SLA 保证,但速度快得惊人。
这种直接把实验产品扔给用户测试的风格很 Hetzner。虽然现在只有一个模型且随时可能变动,但作为开发环境的临时替代品或轻量级任务的 API 接口,确实值得折腾一下。
下一篇
分享一个抓取重复链接的逻辑分析 →
我实测了一下,首字响应(TTFT)大概在 150ms 左右,输出速度能跑到每秒 200 多个 token。对于一个不需要付费的实验性接口来说,这个性能非常顶。不过模型能力就在那里,简单的算术题偶尔会翻车,但处理常规文本和图像识别没问题。
最关键的一个细节是 enable_thinking 参数。如果你在请求体里不把它关掉,模型可能会在输出答案前花大量 token 进行内部推理,导致响应变慢或浪费额度。
部署实操非常简单,直接用 Python 的 openai 库就行:
pip install openaifrom openai import OpenAI
client = OpenAI(
base_url="https://inference.hetzner.com/api/v1",
api_key="你的TOKEN",
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B-FP8",
messages=[
{"role": "user", "content": "用一句话解释为什么天空是蓝色的。"}
],
extra_body={
"chat_template_kwargs": {
"enable_thinking": False, # 记得关掉思考过程,否则响应会很慢
}
},
)
print(response.choices[0].message.content)- 模型规格: Qwen3.6-35B-A3B-FP8(MoE 架构,激活参数 3B)
- 上下文窗口: 262K
- 兼容性: 完全兼容 OpenAI API 格式
这种直接把实验产品扔给用户测试的风格很 Hetzner。虽然现在只有一个模型且随时可能变动,但作为开发环境的临时替代品或轻量级任务的 API 接口,确实值得折腾一下。
