ROBOTWAR.ioOSINT research running on the Hetzner inference APIbeta test

Hetzner Inference API — Performance


Measured from robotwar.io Hetzner OSINT · generated 2026-08-25T06:39:12Z · window: last 30 days (all-time totals in summary)

Calls in window
1 053
1 053 all time
Success rate
76.9%
810 completed
Latency p50
47.4 s
p95 226.5 s
Output tokens/s
29.9
median of completed calls
Rate limited
0.0%
0 responses
Server errors
22.9%
241 incl. gateway 504
Timeouts
0.0%
0 calls
Parse errors
0.0%
0 calls
Tokens in
4 170 537
4 170 537 all time
Tokens out
1 453 414
1 453 414 all time
Attempts per success
1.1
1.0 = never retried
Retries
205
calls beyond the first attempt

Collection schedule

All times on this page are Amsterdam (CET/CEST). A missed slot means no collection started within the tolerance of a scheduled time.

Collection runs at 00:00, 08:00, 16:00 Europe/Amsterdam · next expected 2026-08-25 16:00 CEST · arrived 21 of 26 expected since 2026-08-16 · 6 did not finish

Last completed collection started 2026-08-24 16:00 CEST and took 28 min.

Missed: 2026-08-17 00:00, 2026-08-17 08:00, 2026-08-17 16:00, 2026-08-18 00:00, 2026-08-19 16:00

starteddurationstatus
2026-08-25 08:00 CESTrunning (unfinished)
2026-08-25 00:00 CESTrunning (unfinished)
2026-08-24 16:00 CEST28 minok
2026-08-24 08:00 CEST27 minok
2026-08-24 00:00 CEST22 minfailed
2026-08-23 16:00 CEST19 minok
2026-08-23 08:00 CEST18 minok
2026-08-23 00:00 CEST21 minfailed
2026-08-22 16:00 CEST20 minok
2026-08-22 08:00 CEST16 minok
2026-08-22 00:00 CEST17 minok
2026-08-21 16:00 CEST19 minok

Model selection

Chosen from measurement: a model is used once the endpoint offers it and it has answered reliably, inside the response-time limit.

stepmodelhowsincewhy
corroborateQwen3.8-27Bevidence2026-08-24beats Qwen/Qwen3.6-35B-A3B-FP8 by 0.953 on measured reliability and speed
deepQwen/Qwen3.6-35B-A3B-FP8held2026-08-24still the best measured option
lensQwen3.8-27Bevidence2026-08-24beats Qwen/Qwen3.6-35B-A3B-FP8 by 0.953 on measured reliability and speed
synthesizeQwen/Qwen3.6-35B-A3B-FP8held2026-08-24still the best measured option
tagQwen/Qwen3.6-35B-A3B-FP8held2026-08-24still the best measured option
trendwatchQwen/Qwen3.6-35B-A3B-FP8held2026-08-24still the best measured option

Calls by status, per day

Stacked by outcome, Amsterdam days.

Calls by status per day010020030040008-16 · ok: 5408-16 · http_error: 1908-16 · error: 208-17 · ok: 23608-17 · http_error: 8508-18 · ok: 12408-18 · http_error: 11108-19 · ok: 2408-19 · http_error: 908-20 · ok: 8208-21 · ok: 6308-21 · http_error: 108-22 · ok: 6208-23 · ok: 6108-23 · http_error: 1108-24 · ok: 6108-25 · ok: 4308-25 · http_error: 507-2607-3008-0308-0708-1108-1508-1908-2308-25okhttp_errorerror

Speed over time

Latency percentiles cover completed calls; the dashed line is the 7-day mean.

Latency per day (successful calls)0ms75s2m4m5m08-16 · p50: 51s08-17 · p50: 57s08-18 · p50: 70s08-19 · p50: 93s08-20 · p50: 49s08-21 · p50: 34s08-22 · p50: 14s08-23 · p50: 18s08-24 · p50: 36s08-25 · p50: 82s08-16 · p95: 4m08-17 · p95: 4m08-18 · p95: 5m08-19 · p95: 4m08-20 · p95: 2m08-21 · p95: 107s08-22 · p95: 49s08-23 · p95: 41s08-24 · p95: 79s08-25 · p95: 3m07-2607-3008-0308-0708-1108-1508-1908-2308-25p50p95
Median output tokens per second, per day0387511215008-16 · median tokens/s: 2808-17 · median tokens/s: 2708-18 · median tokens/s: 2608-19 · median tokens/s: 1908-20 · median tokens/s: 3608-21 · median tokens/s: 4908-22 · median tokens/s: 10108-23 · median tokens/s: 9308-24 · median tokens/s: 4708-25 · median tokens/s: 2207-2607-3008-0308-0708-1108-1508-1908-2308-25
Success rate per day0%25%50%75%100%08-16 · success rate: 72%08-17 · success rate: 74%08-18 · success rate: 53%08-19 · success rate: 73%08-20 · success rate: 100%08-21 · success rate: 98%08-22 · success rate: 100%08-23 · success rate: 85%08-24 · success rate: 100%08-25 · success rate: 90%08-16 · 7-day mean: 72%08-17 · 7-day mean: 73%08-18 · 7-day mean: 66%08-19 · 7-day mean: 68%08-20 · 7-day mean: 74%08-21 · 7-day mean: 78%08-22 · 7-day mean: 81%08-23 · 7-day mean: 83%08-24 · 7-day mean: 87%08-25 · 7-day mean: 92%07-2607-3008-0308-0708-1108-1508-1908-2308-25success rate7-day mean

Latency per model

Median latency per Amsterdam day.

Qwen/Qwen3.6-35B-A3B-FP8

Qwen/Qwen3.6-35B-A3B-FP8: median latency per day0ms33s67s100s08-16 · p50: 50s08-17 · p50: 57s08-18 · p50: 70s08-19 · p50: 93s08-20 · p50: 49s08-21 · p50: 34s08-22 · p50: 14s08-23 · p50: 18s08-24 · p50: 36s08-25 · p50: 82s07-2608-0208-0908-1608-2308-25

Kimi-K2.7-Code

Kimi-K2.7-Code: median latency per day0ms0ms0ms1ms07-2608-0208-0908-1608-2308-25

DeepSeek-V4-Flash-0731

DeepSeek-V4-Flash-0731: median latency per day0ms0ms0ms1ms07-2608-0208-0908-1608-2308-25

GLM-5.2-NVFP4

GLM-5.2-NVFP4: median latency per day0ms83s3m4m08-16 · p50: 4m07-2608-0208-0908-1608-2308-25

Per model

Window: last 30 days. First/last seen span the whole log.

modelcallssuccessp50p95maxtok/savg out4295xxtimeoutsfirst seenlast seen
Qwen/Qwen3.6-35B-A3B-FP81 03178.4%47.4 s223.5 s297.5 s29.91 780022202026-08-162026-08-25
Kimi-K2.7-Code100.0%01002026-08-162026-08-16
DeepSeek-V4-Flash-073160.0%0502026-08-162026-08-16
GLM-5.2-NVFP4633.3%240.8 s243.1 s243.4 s5.91 4300402026-08-162026-08-16

Model bench runs

Same prompt, same signals, every model.

whenmodelparsedlatencytokens intokens out
2026-08-16 19:26Qwen/Qwen3.6-35B-A3B-FP8yes76.2 s4 3101 621
2026-08-16 19:25Kimi-K2.7-Codeno
2026-08-16 19:17GLM-5.2-NVFP4yes243.4 s3 9991 698
2026-08-16 18:57DeepSeek-V4-Flash-0731no

Per step

Repair calls are the single retry after an unparseable answer.

stepcallssuccessp50p95avg inavg outrepair calls
tag71470.7%56.2 s234.7 s5 8101 9601
synthesize5496.3%41.0 s249.2 s5 3252 0031
trendwatch3876.3%63.1 s200.2 s10 4282 9590
lens-nl26100.0%21.7 s80.6 s1 5238600
lens-de26100.0%36.1 s131.0 s5 2521 3850
lens-wider2592.0%26.8 s139.0 s5 0241 5271
lens-ir24100.0%22.6 s56.2 s2 5521 1152
lens-pl2491.7%20.8 s86.1 s2 0929930
lens-cn2395.7%29.1 s86.6 s3 5611 5590
lens-baltics23100.0%23.6 s108.4 s2 1031 1031
lens-by23100.0%16.4 s53.2 s1 1707051
lens-kp22100.0%25.8 s131.1 s2 4241 2140
enrich1668.8%234.9 s264.3 s2 8811 9870
bench1513.3%159.8 s235.0 s4 1541 6600

Failures over time

Failures by class per day0387511215008-16 · gateway 504: 1908-16 · empty completion: 208-17 · gateway 504: 6308-17 · 5xx: 2208-18 · gateway 504: 10708-18 · 5xx: 408-19 · gateway 504: 808-19 · 5xx: 108-21 · gateway 504: 108-23 · 5xx: 1108-25 · gateway 504: 507-2607-3008-0308-0708-1108-1508-1908-2308-25gateway 5045xxempty completion

Most recent failures

Last 20, newest first.

whenstepmodelhttpclassmessage
2026-08-24 22:32tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-24 22:27tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-24 22:21tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-24 22:16tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-24 22:11tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-23 14:06trendwatchQwen/Qwen3.6-35B-A3B-FP85005xx500 Error code: 500 - {'error': 'Post "https://inference.hetzner.ai/v1/chat/completions": http2: server sent GOAWAY and
2026-08-23 14:05tagQwen/Qwen3.6-35B-A3B-FP85005xx500 ext_proc failed: no more response messages
2026-08-23 14:05tagQwen/Qwen3.6-35B-A3B-FP85005xx500 ext_proc failed: no more response messages
2026-08-23 14:04tagQwen/Qwen3.6-35B-A3B-FP85005xx500 ext_proc failed: no more response messages
2026-08-23 14:03tagQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 14:02tagQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 14:02tagQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 06:07lens-plQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 06:07lens-plQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 06:03tagQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 06:02tagQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-20 22:21lens-cnQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-19 06:26lens-widerQwen/Qwen3.6-35B-A3B-FP85025xx502 Bad Gateway
2026-08-18 23:05trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:59trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504

Time of day

Amsterdam hours across the whole window.

Median latency — darker is slower

Median latency by hour (Amsterdam)00: 43.7 s0001: 54.9 s02: 61.0 s0203: 47.0 s04: no calls0405: 177.5 s06: 184.3 s0607: 182.3 s08: 40.2 s0809: 114.3 s10: no calls1011: 27.7 s12: no calls1213: no calls14: no calls1415: 234.9 s16: 24.8 s1617: 64.5 s18: 166.1 s1819: no calls20: 48.0 s2021: 160.4 s22: 54.5 s2223: 62.8 s

Failure share — darker is worse

Failure share by hour (Amsterdam)00: 11.7%0001: 10.7%02: 9.2%0203: 18.8%04: 100.0%0405: 25.0%06: 69.2%0607: 61.5%08: 9.5%0809: 93.3%10: 100.0%1011: 17.1%12: no calls1213: no calls14: no calls1415: 0.0%16: 12.2%1617: 44.4%18: 88.9%1819: 100.0%20: 75.9%2021: 55.6%22: 17.7%2223: 43.3%

1053 calls placed across the window

Model availability over time

One availability check per day from /models; calls per model per Amsterdam day; last 14 days. Watch this when a model disappears.

The endpoint currently lists 2 models: Qwen/Qwen3.6-35B-A3B-FP8, Qwen3.8-27B. Not offered on the latest check: DeepSeek-V4-Flash-0731 (last seen 2026-08-16); GLM-5.2-NVFP4 (last seen 2026-08-16); Kimi-K2.7-Code (last seen 2026-08-16). This timeline shows if and when they return.

08-1208-1308-1408-1508-1608-1708-1808-1908-2008-2108-2208-2308-2408-25
DeepSeek-V4-Flash-07316×××××××××
GLM-5.2-NVFP42×××××××××
Kimi-K2.7-Code10×××××××××
Qwen/Qwen3.6-35B-A3B-FP85223612424826362616143
Qwen3.8-27B××

offered and used successfully (number = ok calls) offered, every call failed offered, not used not offered on /models no availability check that day

Notable changes

API surface over time

Capability flags are observed, never assumed.

takenendpointsdkmodelschange
2026-08-24 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-24 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-24 06:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-23 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-23 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-23 06:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-22 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-22 06:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-21 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-21 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 06:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 01:11https://inference.hetzner.com/api/v12.49.02no change
2026-08-19 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-18 22:01https://inference.hetzner.com/api/v12.49.02no change
2026-08-18 20:32https://inference.hetzner.com/api/v12.49.02no change
2026-08-18 14:00https://inference.hetzner.com/api/v12.49.02+Qwen3.8-27B
2026-08-18 09:31https://inference.hetzner.com/api/v12.49.01no change
2026-08-18 06:00https://inference.hetzner.com/api/v12.49.01no change
2026-08-17 16:38https://inference.hetzner.com/api/v12.49.01−DeepSeek-V4-Flash-0731 −GLM-5.2-NVFP4 −Kimi-K2.7-Code (1 model offered)
2026-08-16 17:56https://inference.hetzner.com/api/v12.49.04first snapshot (4 models) — reconstructed from the /models check at 19:56 CEST and the call log

Observed on the latest snapshot

thinking can be switched off: yesgateway 504 observed: norate-limit headers exposed: no

Models offered

Qwen/Qwen3.6-35B-A3B-FP8Qwen3.8-27B

Per-model first and last call

modelfirst calllast callcalls (all time)
DeepSeek-V4-Flash-07312026-08-162026-08-166
GLM-5.2-NVFP42026-08-162026-08-166
Kimi-K2.7-Code2026-08-162026-08-1610
Qwen/Qwen3.6-35B-A3B-FP82026-08-162026-08-251 031

Rate-limit posture

Client budget: 10 requests / 60 s · observed 429 responses in window: 0 (0.0% of calls)

No rate-limit headers are exposed by the API — the client budget is the only guard.