0.00.000.190 I srv llama_server: initializing ... 0.00.171.642 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg) 0.00.171.875 W srv llama_server: security: no API key is set and CORS allows all origins (see https://github.com/ggml-org/llama.cpp/pull/25655) 0.00.173.479 I srv load_model: loading model '/workspace/models/gguf/Qwen3.8-27B-Q4_K_M.gguf' 0.01.950.210 I cmn init: llama threadpool init, n_threads = 12 0.02.037.497 I srv load_model: initializing, n_slots = 1, n_ctx_slot = 32768, kv_unified = 'false' 0.02.040.077 W srv init: chat template supports preserving reasoning, it is enabled by default (may use more tokens, disable via --no-reasoning-preserve) 0.02.040.114 I srv llama_server: model loaded 0.02.040.118 I srv llama_server: listening on http://0.0.0.0:8001 0.24.198.922 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1 0.24.199.048 I slot launch_slot_: id 0 | task 0 | processing task, is_child = 0 0.25.269.503 I slot print_timing: id 0 | task 0 | prompt eval time = 150.80 ms / 59 tokens ( 2.56 ms per token, 391.25 tokens per second) 0.25.269.506 I slot print_timing: id 0 | task 0 | eval time = 919.63 ms / 64 tokens ( 14.60 ms per token, 68.51 tokens per second) 0.25.269.506 I slot print_timing: id 0 | task 0 | total time = 1070.42 ms / 123 tokens 0.25.269.511 I slot print_timing: id 0 | task 0 | graphs reused = 63 0.25.269.538 I slot release: id 0 | task 0 | stop processing: n_tokens = 122, truncated = 0 0.41.284.931 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, f_sim_best = 1.000 (> 0.100 thold), f_keep = 0.484 0.41.382.012 I slot launch_slot_: id 0 | task 67 | processing task, is_child = 0 0.42.373.418 I slot print_timing: id 0 | task 67 | prompt eval time = 73.40 ms / 4 tokens ( 18.35 ms per token, 54.50 tokens per second) 0.42.373.421 I slot print_timing: id 0 | task 67 | eval time = 917.99 ms / 64 tokens ( 14.57 ms per token, 68.63 tokens per second) 0.42.373.422 I slot print_timing: id 0 | task 67 | total time = 991.38 ms / 68 tokens 0.42.373.423 I slot print_timing: id 0 | task 67 | graphs reused = 125 0.42.373.438 I slot release: id 0 | task 67 | stop processing: n_tokens = 122, truncated = 0 0.51.030.971 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679472514429 0.51.125.118 I slot launch_slot_: id 0 | task 132 | processing task, is_child = 0 0.54.461.566 I slot print_timing: id 0 | task 132 | n_gen = 208, tg = 68.83 t/s, tg_3s = 69.17 t/s 0.55.157.143 I slot print_timing: id 0 | task 132 | prompt eval time = 329.17 ms / 927 tokens ( 0.36 ms per token, 2816.17 tokens per second) 0.55.157.145 I slot print_timing: id 0 | task 132 | eval time = 3702.84 ms / 256 tokens ( 14.52 ms per token, 68.87 tokens per second) 0.55.157.146 I slot print_timing: id 0 | task 132 | total time = 4032.01 ms / 1183 tokens 0.55.157.147 I slot print_timing: id 0 | task 132 | graphs reused = 378 0.55.157.178 I slot release: id 0 | task 132 | stop processing: n_tokens = 1224, truncated = 0 0.55.162.899 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679485298169 0.55.299.301 I slot launch_slot_: id 0 | task 391 | processing task, is_child = 0 0.58.639.620 I slot print_timing: id 0 | task 391 | n_gen = 208, tg = 68.82 t/s, tg_3s = 69.15 t/s 0.59.335.262 I slot print_timing: id 0 | task 391 | prompt eval time = 332.41 ms / 942 tokens ( 0.35 ms per token, 2833.88 tokens per second) 0.59.335.264 I slot print_timing: id 0 | task 391 | eval time = 3703.54 ms / 256 tokens ( 14.52 ms per token, 68.85 tokens per second) 0.59.335.264 I slot print_timing: id 0 | task 391 | total time = 4035.95 ms / 1198 tokens 0.59.335.265 I slot print_timing: id 0 | task 391 | graphs reused = 631 0.59.335.296 I slot release: id 0 | task 391 | stop processing: n_tokens = 1239, truncated = 0 0.59.344.048 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679489476287 0.59.478.757 I slot launch_slot_: id 0 | task 650 | processing task, is_child = 0 1.02.868.212 I slot print_timing: id 0 | task 650 | n_gen = 208, tg = 68.82 t/s, tg_3s = 69.15 t/s 1.03.564.248 I slot print_timing: id 0 | task 650 | prompt eval time = 381.48 ms / 1034 tokens ( 0.37 ms per token, 2710.52 tokens per second) 1.03.564.251 I slot print_timing: id 0 | task 650 | eval time = 3704.00 ms / 256 tokens ( 14.53 ms per token, 68.84 tokens per second) 1.03.564.251 I slot print_timing: id 0 | task 650 | total time = 4085.48 ms / 1290 tokens 1.03.564.252 I slot print_timing: id 0 | task 650 | graphs reused = 884 1.03.564.287 I slot release: id 0 | task 650 | stop processing: n_tokens = 1331, truncated = 0 1.03.570.617 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679493705279 1.03.706.960 I slot launch_slot_: id 0 | task 909 | processing task, is_child = 0 1.07.097.495 I slot print_timing: id 0 | task 909 | n_gen = 208, tg = 68.79 t/s, tg_3s = 69.12 t/s 1.07.793.697 I slot print_timing: id 0 | task 909 | prompt eval time = 381.30 ms / 1034 tokens ( 0.37 ms per token, 2711.78 tokens per second) 1.07.793.699 I slot print_timing: id 0 | task 909 | eval time = 3705.42 ms / 256 tokens ( 14.53 ms per token, 68.82 tokens per second) 1.07.793.699 I slot print_timing: id 0 | task 909 | total time = 4086.72 ms / 1290 tokens 1.07.793.700 I slot print_timing: id 0 | task 909 | graphs reused = 1137 1.07.793.737 I slot release: id 0 | task 909 | stop processing: n_tokens = 1331, truncated = 0 1.07.800.442 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679497934728 1.07.935.278 I slot launch_slot_: id 0 | task 1168 | processing task, is_child = 0 1.11.325.003 I slot print_timing: id 0 | task 1168 | n_gen = 208, tg = 68.83 t/s, tg_3s = 69.16 t/s 1.12.021.743 I slot print_timing: id 0 | task 1168 | prompt eval time = 382.33 ms / 1034 tokens ( 0.37 ms per token, 2704.49 tokens per second) 1.12.021.746 I slot print_timing: id 0 | task 1168 | eval time = 3704.12 ms / 256 tokens ( 14.53 ms per token, 68.84 tokens per second) 1.12.021.746 I slot print_timing: id 0 | task 1168 | total time = 4086.44 ms / 1290 tokens 1.12.021.747 I slot print_timing: id 0 | task 1168 | graphs reused = 1390 1.12.021.785 I slot release: id 0 | task 1168 | stop processing: n_tokens = 1331, truncated = 0 1.12.027.877 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679502162778 1.12.164.603 I slot launch_slot_: id 0 | task 1427 | processing task, is_child = 0 1.15.553.579 I slot print_timing: id 0 | task 1427 | n_gen = 208, tg = 68.82 t/s, tg_3s = 69.16 t/s 1.16.250.030 I slot print_timing: id 0 | task 1427 | prompt eval time = 381.31 ms / 1034 tokens ( 0.37 ms per token, 2711.70 tokens per second) 1.16.250.033 I slot print_timing: id 0 | task 1427 | eval time = 3704.10 ms / 256 tokens ( 14.53 ms per token, 68.84 tokens per second) 1.16.250.033 I slot print_timing: id 0 | task 1427 | total time = 4085.41 ms / 1290 tokens 1.16.250.034 I slot print_timing: id 0 | task 1427 | graphs reused = 1643 1.16.250.074 I slot release: id 0 | task 1427 | stop processing: n_tokens = 1331, truncated = 0 1.16.256.603 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679506391066 1.16.390.861 I slot launch_slot_: id 0 | task 1686 | processing task, is_child = 0 1.19.778.057 I slot print_timing: id 0 | task 1686 | n_gen = 207, tg = 68.57 t/s, tg_3s = 68.90 t/s 1.20.490.105 I slot print_timing: id 0 | task 1686 | prompt eval time = 382.88 ms / 1034 tokens ( 0.37 ms per token, 2700.57 tokens per second) 1.20.490.107 I slot print_timing: id 0 | task 1686 | eval time = 3716.35 ms / 256 tokens ( 14.57 ms per token, 68.62 tokens per second) 1.20.490.107 I slot print_timing: id 0 | task 1686 | total time = 4099.23 ms / 1290 tokens 1.20.490.108 I slot print_timing: id 0 | task 1686 | graphs reused = 1896 1.20.490.144 I slot release: id 0 | task 1686 | stop processing: n_tokens = 1331, truncated = 0 1.20.495.519 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679510631136 1.20.641.616 I slot launch_slot_: id 0 | task 1945 | processing task, is_child = 0 1.24.030.985 I slot print_timing: id 0 | task 1945 | n_gen = 208, tg = 68.83 t/s, tg_3s = 69.16 t/s 1.24.727.378 I slot print_timing: id 0 | task 1945 | prompt eval time = 381.80 ms / 1034 tokens ( 0.37 ms per token, 2708.22 tokens per second) 1.24.727.380 I slot print_timing: id 0 | task 1945 | eval time = 3703.94 ms / 256 tokens ( 14.53 ms per token, 68.85 tokens per second) 1.24.727.380 I slot print_timing: id 0 | task 1945 | total time = 4085.74 ms / 1290 tokens 1.24.727.381 I slot print_timing: id 0 | task 1945 | graphs reused = 2149 1.24.727.419 I slot release: id 0 | task 1945 | stop processing: n_tokens = 1331, truncated = 0 1.24.734.402 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679514868410 1.24.873.133 I slot launch_slot_: id 0 | task 2204 | processing task, is_child = 0 1.28.264.112 I slot print_timing: id 0 | task 2204 | n_gen = 208, tg = 68.83 t/s, tg_3s = 69.16 t/s 1.28.960.624 I slot print_timing: id 0 | task 2204 | prompt eval time = 383.51 ms / 1034 tokens ( 0.37 ms per token, 2696.16 tokens per second) 1.28.960.626 I slot print_timing: id 0 | task 2204 | eval time = 3703.96 ms / 256 tokens ( 14.53 ms per token, 68.85 tokens per second) 1.28.960.627 I slot print_timing: id 0 | task 2204 | total time = 4087.47 ms / 1290 tokens 1.28.960.627 I slot print_timing: id 0 | task 2204 | graphs reused = 2402 1.28.960.671 I slot release: id 0 | task 2204 | stop processing: n_tokens = 1331, truncated = 0 1.28.967.911 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679519101662 1.29.104.767 I slot launch_slot_: id 0 | task 2463 | processing task, is_child = 0 1.32.448.807 I slot print_timing: id 0 | task 2463 | n_gen = 208, tg = 68.81 t/s, tg_3s = 69.14 t/s 1.33.144.997 I slot print_timing: id 0 | task 2463 | prompt eval time = 335.63 ms / 951 tokens ( 0.35 ms per token, 2833.51 tokens per second) 1.33.144.999 I slot print_timing: id 0 | task 2463 | eval time = 3704.59 ms / 256 tokens ( 14.53 ms per token, 68.83 tokens per second) 1.33.144.999 I slot print_timing: id 0 | task 2463 | total time = 4040.21 ms / 1207 tokens 1.33.145.000 I slot print_timing: id 0 | task 2463 | graphs reused = 2655 1.33.145.033 I slot release: id 0 | task 2463 | stop processing: n_tokens = 1248, truncated = 0 1.33.152.054 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679523286024 1.33.286.164 I slot launch_slot_: id 0 | task 2722 | processing task, is_child = 0 1.36.614.318 I slot print_timing: id 0 | task 2722 | n_gen = 208, tg = 68.80 t/s, tg_3s = 69.13 t/s 1.37.310.414 I slot print_timing: id 0 | task 2722 | prompt eval time = 319.47 ms / 887 tokens ( 0.36 ms per token, 2776.48 tokens per second) 1.37.310.416 I slot print_timing: id 0 | task 2722 | eval time = 3704.76 ms / 256 tokens ( 14.53 ms per token, 68.83 tokens per second) 1.37.310.416 I slot print_timing: id 0 | task 2722 | total time = 4024.23 ms / 1143 tokens 1.37.310.417 I slot print_timing: id 0 | task 2722 | graphs reused = 2908 1.37.310.447 I slot release: id 0 | task 2722 | stop processing: n_tokens = 1184, truncated = 0 1.37.318.346 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679527451438 1.37.318.418 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 456.507 MiB) 1.37.465.705 I slot launch_slot_: id 0 | task 2981 | processing task, is_child = 0 1.40.809.303 I slot print_timing: id 0 | task 2981 | n_gen = 208, tg = 68.79 t/s, tg_3s = 69.12 t/s 1.41.505.710 I slot print_timing: id 0 | task 2981 | prompt eval time = 334.50 ms / 931 tokens ( 0.36 ms per token, 2783.26 tokens per second) 1.41.505.712 I slot print_timing: id 0 | task 2981 | eval time = 3705.49 ms / 256 tokens ( 14.53 ms per token, 68.82 tokens per second) 1.41.505.713 I slot print_timing: id 0 | task 2981 | total time = 4039.99 ms / 1187 tokens 1.41.505.714 I slot print_timing: id 0 | task 2981 | graphs reused = 3161 1.41.505.746 I slot release: id 0 | task 2981 | stop processing: n_tokens = 1228, truncated = 0 1.41.514.515 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679531646738 1.41.514.587 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 456.507 MiB) 1.41.660.535 I slot launch_slot_: id 0 | task 3240 | processing task, is_child = 0 1.45.054.462 I slot print_timing: id 0 | task 3240 | n_gen = 208, tg = 68.78 t/s, tg_3s = 69.11 t/s 1.45.751.392 I slot print_timing: id 0 | task 3240 | prompt eval time = 384.32 ms / 1034 tokens ( 0.37 ms per token, 2690.47 tokens per second) 1.45.751.393 I slot print_timing: id 0 | task 3240 | eval time = 3706.52 ms / 256 tokens ( 14.54 ms per token, 68.80 tokens per second) 1.45.751.394 I slot print_timing: id 0 | task 3240 | total time = 4090.84 ms / 1290 tokens 1.45.751.395 I slot print_timing: id 0 | task 3240 | graphs reused = 3414 1.45.751.429 I slot release: id 0 | task 3240 | stop processing: n_tokens = 1331, truncated = 0 1.45.757.943 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679535892420 1.45.758.018 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 675.033 MiB) 1.45.913.656 I slot launch_slot_: id 0 | task 3499 | processing task, is_child = 0 1.49.259.886 I slot print_timing: id 0 | task 3499 | n_gen = 208, tg = 68.76 t/s, tg_3s = 69.10 t/s 1.49.956.130 I slot print_timing: id 0 | task 3499 | prompt eval time = 335.95 ms / 943 tokens ( 0.36 ms per token, 2806.97 tokens per second) 1.49.956.132 I slot print_timing: id 0 | task 3499 | eval time = 3706.51 ms / 256 tokens ( 14.54 ms per token, 68.80 tokens per second) 1.49.956.133 I slot print_timing: id 0 | task 3499 | total time = 4042.46 ms / 1199 tokens 1.49.956.133 I slot print_timing: id 0 | task 3499 | graphs reused = 3667 1.49.956.165 I slot release: id 0 | task 3499 | stop processing: n_tokens = 1240, truncated = 0 1.49.963.660 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679540097156 1.49.963.732 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 675.971 MiB) 1.50.114.597 I slot launch_slot_: id 0 | task 3758 | processing task, is_child = 0 1.53.449.325 I slot print_timing: id 0 | task 3758 | n_gen = 207, tg = 68.65 t/s, tg_3s = 68.98 t/s 1.54.159.618 I slot print_timing: id 0 | task 3758 | prompt eval time = 333.76 ms / 907 tokens ( 0.37 ms per token, 2717.49 tokens per second) 1.54.159.621 I slot print_timing: id 0 | task 3758 | eval time = 3711.24 ms / 256 tokens ( 14.55 ms per token, 68.71 tokens per second) 1.54.159.621 I slot print_timing: id 0 | task 3758 | total time = 4045.00 ms / 1163 tokens 1.54.159.622 I slot print_timing: id 0 | task 3758 | graphs reused = 3920 1.54.159.656 I slot release: id 0 | task 3758 | stop processing: n_tokens = 1204, truncated = 0 1.54.167.880 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679544300648 1.54.167.923 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 681.723 MiB) 1.54.323.624 I slot launch_slot_: id 0 | task 4017 | processing task, is_child = 0 1.57.671.812 I slot print_timing: id 0 | task 4017 | n_gen = 208, tg = 68.73 t/s, tg_3s = 69.06 t/s 1.58.368.105 I slot print_timing: id 0 | task 4017 | prompt eval time = 336.23 ms / 942 tokens ( 0.36 ms per token, 2801.68 tokens per second) 1.58.368.107 I slot print_timing: id 0 | task 4017 | eval time = 3708.24 ms / 256 tokens ( 14.54 ms per token, 68.77 tokens per second) 1.58.368.107 I slot print_timing: id 0 | task 4017 | total time = 4044.46 ms / 1198 tokens 1.58.368.108 I slot print_timing: id 0 | task 4017 | graphs reused = 4173 1.58.368.139 I slot release: id 0 | task 4017 | stop processing: n_tokens = 1239, truncated = 0 1.58.375.565 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679548509130 1.58.375.637 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 681.723 MiB) 1.58.522.414 I slot launch_slot_: id 0 | task 4276 | processing task, is_child = 0 2.01.870.029 I slot print_timing: id 0 | task 4276 | n_gen = 208, tg = 68.78 t/s, tg_3s = 69.11 t/s 2.02.566.302 I slot print_timing: id 0 | task 4276 | prompt eval time = 337.88 ms / 907 tokens ( 0.37 ms per token, 2684.41 tokens per second) 2.02.566.304 I slot print_timing: id 0 | task 4276 | eval time = 3705.99 ms / 256 tokens ( 14.53 ms per token, 68.81 tokens per second) 2.02.566.305 I slot print_timing: id 0 | task 4276 | total time = 4043.87 ms / 1163 tokens 2.02.566.305 I slot print_timing: id 0 | task 4276 | graphs reused = 4426 2.02.566.335 I slot release: id 0 | task 4276 | stop processing: n_tokens = 1204, truncated = 0 2.02.575.117 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679552707326 2.02.575.191 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 681.723 MiB) 2.02.724.152 I slot launch_slot_: id 0 | task 4535 | processing task, is_child = 0 2.06.119.229 I slot print_timing: id 0 | task 4535 | n_gen = 208, tg = 68.75 t/s, tg_3s = 69.08 t/s 2.06.816.615 I slot print_timing: id 0 | task 4535 | prompt eval time = 384.14 ms / 1034 tokens ( 0.37 ms per token, 2691.73 tokens per second) 2.06.816.617 I slot print_timing: id 0 | task 4535 | eval time = 3708.30 ms / 256 tokens ( 14.54 ms per token, 68.76 tokens per second) 2.06.816.617 I slot print_timing: id 0 | task 4535 | total time = 4092.44 ms / 1290 tokens 2.06.816.618 I slot print_timing: id 0 | task 4535 | graphs reused = 4679 2.06.816.653 I slot release: id 0 | task 4535 | stop processing: n_tokens = 1331, truncated = 0 2.06.825.324 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679556957645 2.06.825.397 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 681.723 MiB) 2.06.977.119 I slot launch_slot_: id 0 | task 4794 | processing task, is_child = 0 2.10.372.972 I slot print_timing: id 0 | task 4794 | n_gen = 208, tg = 68.75 t/s, tg_3s = 69.08 t/s 2.11.070.334 I slot print_timing: id 0 | task 4794 | prompt eval time = 385.04 ms / 1034 tokens ( 0.37 ms per token, 2685.44 tokens per second) 2.11.070.337 I slot print_timing: id 0 | task 4794 | eval time = 3708.16 ms / 256 tokens ( 14.54 ms per token, 68.77 tokens per second) 2.11.070.337 I slot print_timing: id 0 | task 4794 | total time = 4093.20 ms / 1290 tokens 2.11.070.338 I slot print_timing: id 0 | task 4794 | graphs reused = 4932 2.11.070.376 I slot release: id 0 | task 4794 | stop processing: n_tokens = 1331, truncated = 0 2.11.077.632 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 679561211368 2.11.077.706 W srv alloc: - making room for prompt cache entry, removing oldest entry (size = 681.723 MiB) 2.11.240.470 I slot launch_slot_: id 0 | task 5053 | processing task, is_child = 0 2.14.586.987 I slot print_timing: id 0 | task 5053 | n_gen = 208, tg = 68.77 t/s, tg_3s = 69.10 t/s 2.15.283.340 I slot print_timing: id 0 | task 5053 | prompt eval time = 336.42 ms / 941 tokens ( 0.36 ms per token, 2797.07 tokens per second) 2.15.283.342 I slot print_timing: id 0 | task 5053 | eval time = 3706.43 ms / 256 tokens ( 14.54 ms per token, 68.80 tokens per second) 2.15.283.342 I slot print_timing: id 0 | task 5053 | total time = 4042.85 ms / 1197 tokens 2.15.283.343 I slot print_timing: id 0 | task 5053 | graphs reused = 5185 2.15.283.378 I slot release: id 0 | task 5053 | stop processing: n_tokens = 1238, truncated = 0 2.41.609.149 I srv operator(): operator(): cleaning up before exit...