Files
calculet-npu-research-archive/history/llama.cpp/topics/08-server-api-scheduling.tsv
T

940 lines
165 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng tag: v0.2.1 server: fix max_seq_len
ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 2026-04-09T10:36:31+08:00 wangbomeng server: comment circle print
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T02:01:23+08:00 wangbomeng rm llama-server_old.cpp
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 2026-03-12T16:36:07+08:00 Bomeng Wang tag: v0.0.1 server: correct the max_seq_len judgment
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
48bd26501b08a3f0bff1249db47f313641f7bebb 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 2025-11-03T15:38:23+02:00 Georgi Gerganov server : add props.model_alias (#16943)
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784)
e4a71599e5846110159955dec0008eb4aa24222b dd5e8cab512c7752392b6e51a6f118f348fb3f16 2025-11-01T17:14:54+01:00 Pascal webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757)
c22473b580807929fd9e3a3344a48e8cfbe6c88f 0f715b4e759acceccb9f437cfd2a988fff85514a 2025-10-31T10:54:19+02:00 Georgi Gerganov server : don't print user inputs to console (#16871)
0f715b4e759acceccb9f437cfd2a988fff85514a d2d931f173b8a736b08999436e9259aafddec718 2025-10-31T09:51:26+01:00 Daniel Bevenius server : fix typos in server.cpp comments [no ci] (#16883)
16724b5b6836a2d4b8936a5824d2ff27c52b4517 b52edd25586fabb70f0c21b274473b307cf14499 2025-10-30T14:22:23-04:00 chansikpark server : bump request URI max length to 32768 (#16862)
b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818)
8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847)
3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820)
338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808)
85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812)
ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800)
5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748)
0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 dd62dcfab97e420949519fd0eac9fca7bf97e635 2025-10-23T21:30:17+02:00 Johannes Gäßler server: add memory breakdown print (#16740)
8cf6b42d467d05fa7d9776d2bcc69974ecce6900 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 2025-10-23T11:32:24+02:00 matteo server : send partial stop string when <EOG> is reached (#15007)
63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
13f2cfad4170c096c51a02c24a6a158cb47f1480 06332e28672356b964d6dfc2ba4657e20581cd43 2025-10-20T12:41:13+02:00 Aleksander Grygier Enable per-conversation loading states to allow having parallel conversations (#16327)
41386cf365d894134ee0813d15e2f5d76f6a4d8e 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 2025-10-17T18:02:52+03:00 Radoslav Gerganov rpc : report actual free memory (#16616)
466c1911ab736f0b7366127edee99f8ee5687417 0cb7a0683b0529172472d74d21f05470a607f297 2025-10-15T22:24:51+03:00 safranowith cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083)
f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 2025-10-15T16:22:20+02:00 Aleksander Grygier Add server-driven parameter defaults and syncing (#16515)
17304cbcc1dd24de7741cbe57925d58e90a98ac1 3e3cb19f6449f9168a128eaeae01f8f41b049acc 2025-10-15T16:53:12+03:00 Georgi Gerganov server : fix img token logs (#16595)
554fd578a5ed78a10f371f5850c6a69aa83df15a fa882fd2b1bcb663de23af06fdc391489d05b007 2025-10-15T12:51:27+03:00 Georgi Gerganov server : fix mtmd checkpoints (#16591)
7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545)
bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 e60f241eacec42d3bd7c9edd37d236ebf35132a8 2025-10-14T08:48:50+03:00 Georgi Gerganov server : dynamic token limit for prompt cache (#16560)
81d54bbfd599811b354c39f04550888168be7780 c7be9febcbafa9af7d1b9443f86475c59c9c5f87 2025-10-12T18:06:41+02:00 Pascal webui: remove client-side context pre-check and rely on backend for limits (#16506)
31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 97870e64975b26c5e06a3540a8dc0ff601351e86 2025-10-11T21:39:04+08:00 Yann Follet server / ranking : add sorting and management of top_n (#16403)
e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501)
68ee98ae181a5c83a5cc6261daeee69a1f588c15 cdb6da468cc33323955a523738d2e1675aeb5e9a 2025-10-10T17:11:07+03:00 Radoslav Gerganov server : return HTTP 400 if prompt exceeds context length (#16486)
cdb6da468cc33323955a523738d2e1675aeb5e9a 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e 2025-10-10T13:22:27+03:00 Radoslav Gerganov server : log requests to /v1/completions (#16495)
1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 1deee0f8d494981c32597dca8b5f8696d399b0f2 2025-10-09T22:54:57+02:00 Pascal webui: updated the chat service to only include max_tokens in the req… (#16489)
d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391)
12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394)
d2ee056e1df0fdf646270fb5621e9f92084b59a7 b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 2025-10-08T17:20:18+09:00 issixx server : fix cancel pending task (#16467)
7fdd16b432d247121fe5fe7b21f8805f85266c85 74b8fc17f92ada295a648e3c5eb28f46bca7d892 2025-10-08T10:57:29+03:00 Georgi Gerganov server : improve context checkpoint logic (#16440)
df1b612e29ba97a2e67db339b1e8c7465702b7e8 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 2025-10-07T15:57:14+03:00 Georgi Gerganov server : add `/v1/health` endpoint (#16461)
c61ae20d05bd4fdd8551311325a2845336449426 0123ff38f53d34752f29239a29d0e40a6dc4110f 2025-10-07T09:59:13+03:00 Radoslav Gerganov rpc : update documentation (#16441)
c5fef0fcea3b978a2318b1af170209ecec7c37b4 ca71fb9b368e3db96e028f80c4c9df6b6b370edd 2025-10-06T03:53:31-04:00 Oleksandr Kuvshynov server: update readme to mention n_past_max metric (#16436)
898acba6816ad23b6a9491347d30e7570bffadfd e29acf74fea996014380d59d31aa504ae8964258 2025-10-04T12:49:16+03:00 Radoslav Gerganov rpc : add support for multiple devices (#16276)
f6dcda390004b627ef30af378d0c01ad2519289e 606a73f53175077429484b23dcf799f69a31d0bd 2025-10-03T13:34:51-05:00 ddh0 server : context checkpointing for hybrid and recurrent models (#16382)
ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401)
77233277c912d495d1069543ca540c21a2f9e5b4 e308efda8e54e3f07578937a45a5d83624eb7970 2025-10-03T11:30:39+02:00 Aleksander Grygier Capture model name only after first token (streaming) or completed request (#16405)
136bda78c5679b266362b39c58338fff46fd2592 5113efd34ceda709292de26c72716c49e024fb32 2025-10-03T09:11:34+02:00 Aleksander Grygier webui : Fix messages payload sent to chat completions (#16402)
2be72c2b121ee99f33927149265ce6073ade9e59 95ce0985449c52fb9d6849b95563f7cf933ea0e3 2025-10-02T15:16:25+08:00 Neo Zhang Jianyu SYCL: Update to oneAPI 2025.2 (#16371)
aa9538a63aef35f0224b2502f13b19d650a8ce04 e74c92e84236b2bab3f3c77bee4ead94928be360 2025-10-01T07:40:26+02:00 Aleksander Grygier webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363)
16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed 2025-09-30T19:18:54+02:00 Pascal Chatapi ignore empty sampling (#16330)
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
2811c65286ae954bec87049f75b86dc022006dcc d8359f5fde480da030bf75c7711573c7c4d993ba 2025-09-28T12:04:46+01:00 Imad Saddik Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297)
234e2ff8ed09716fb553437596779399bee31b11 3f81b4e91c1d5f098148af117e3f13cf4b077f52 2025-09-27T18:17:08+02:00 Adrien Gallouët server : remove old LLAMA_SERVER_SSL (#16290)
1a189278944d030211f336e103e96b65f976c361 e0539eb6aed346d4b25a6ea019044e88771e7690 2025-09-26T18:35:42+02:00 Aleksander Grygier Allow viewing conversations even when llama server is down (#16255)
d0991da39d3c39b3980c24cdfccb9a4c95a46870 aa719c2f886c445b78113bf1e5849f1fce4124a7 2025-09-25T11:36:47+02:00 Daniel Bevenius server : add support for external server for tests (#16243)
c498fc82fe5b83fc8c6e1627286bdc1f93caddbf e7a5130a20cf45a3358308356c249734ca982143 2025-09-25T10:20:02+03:00 Radoslav Gerganov rpc : use ggml logging facilities
4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
5c6106a696af2b00ce01d14ba525979d5a32b199 ec65fb52f0cc890e5085a6c5995ab08a156265fb 2025-09-22T10:58:02+03:00 Georgi Gerganov contrib : update roles (#16113)
1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059)
459c0c2c1a400f960d7b8e8d94d31a8426f80986 be79d9fdd95ab8955527c4aaa67b90e8b9516718 2025-09-20T07:56:30+02:00 Benni server: fix SSE and OpenAI compatibility for error messages when streaming (#16109)
be79d9fdd95ab8955527c4aaa67b90e8b9516718 f432d8d83e7407073634c5e4fd81a3d23a10827f 2025-09-19T15:15:21-07:00 ssweens llama-bench: add --devices and --list-devices support (#16039)
246c0d9c795fb25da8268625d597580155a3672f 3edd87cd055a45d885fa914d879d36d33ecfc3e1 2025-09-18T23:07:18+02:00 Adrien Gallouët cmake : fix static linking for OpenMP on Unix-like systems (#16031)
4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 703f9e32c4eb3166f8d63007c26e31a1466c21af 2025-09-18T16:22:50+01:00 Eric Curtin Add resumable downloads for llama-server model loading (#15963)
2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 e58174cecbc45bf79bf653cd2c984395940c6ef4 2025-09-18T13:36:57+03:00 Radoslav Gerganov server : include usage statistics only when user request them (#16052)
0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 a7a98e0fffed794396b3fbad4dcdbbc184963645 2025-09-17T20:38:12+03:00 Georgi Gerganov metal : refactor + optimize v2 (#15995)
8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 77475530b8bbea3bf578632507e1284cdfe2c8c0 2025-09-16T16:17:08+02:00 jacekpoplawski llama-bench: add --n-cpu-moe support (#15952)
b907255f4bd169b0dc7dca9553b4c54af5170865 28c39da7c645185ade5436767929d7ec33006033 2025-09-15T19:51:35+03:00 yael-works SYCL: Add COUNT_EQUAL operator support (#15991)
6c019cb04e86e2dacfe62ce7666c64e9717dde1f 9dcd200d57bc6f05a59a6a8df361d5d183af4124 2025-09-14T21:17:04+02:00 Sigbjørn Skjæret server : only attempt to enable thinking if using jinja (#15967)
50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 2025-09-13T07:49:49-07:00 Diego Devesa llama : allow using iGPUs with --device (#15951)
4bf5549269d99bac936a65892da2312cc71b2421 f4e664f838cc65d89fa845c48c372e43852112e4 2025-09-12T16:31:50+01:00 Eric Curtin Add docker protocol support for llama-server model loading (#15790)
f088b6a84f6aed0abb619dbb9d375e726fc888a6 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 2025-09-12T17:02:55+03:00 Georgi Gerganov server : adjust prompt similarity thold + add logs (#15913)
304ac5693d1e2124f83e0584bc5eea6311d3d3b4 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 2025-09-12T13:24:21+02:00 Ruben Ortlam Vulkan iGPU device selection overhaul and PCI ID API support (#15947)
e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850)
88021565f08e0b7c4e07ac089a15ec16fae9166c 56920f56651908d5cce7a310dabf54ac4f6fbb7f 2025-09-08T10:59:48-04:00 Jesse chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533)
56920f56651908d5cce7a310dabf54ac4f6fbb7f b0d52998b962bd2681c34bf52af993af79f178b8 2025-09-08T21:50:05+07:00 Xuan-Son Nguyen server : bring back timings_per_token (#15879)
3b15924d71237a43bb5ad71f5b885ee66a821342 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a 2025-09-07T10:19:45+02:00 Daniel Bevenius ggml WebGPU: remove userdata from request adapter callback (#15527)
3c3635d2f20424d557b5b0605a2a356214ffe048 61bdfd5298a78593be649a1035ee2a120b13c4f0 2025-09-06T19:45:24+07:00 Xuan-Son Nguyen server : speed up tests (#15836)
61bdfd5298a78593be649a1035ee2a120b13c4f0 01806e77714ae8a78130d432945b959a0956c56f 2025-09-06T18:35:04+07:00 Xuan-Son Nguyen server : implement prompt processing progress report in stream mode (#15827)
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404)
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763)
a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c badb80cadbc40e047b30c43611aba575fc8d6845 2025-09-04T11:50:23+02:00 Xuan-Son Nguyen server: add exceed_context_size_error type (#15780)
8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761)
0d161f021aa33ec0e90cce96f5d1a88925557327 4efd5a83163ff383285b3a4c2106feabf5c69557 2025-08-31T20:11:58+03:00 Georgi Gerganov server : enable /slots by default and make it secure (#15630)
d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 3d16b29c3bb1ec816ac0e782f20d169097063919 2025-08-30T00:12:53+02:00 Sergey Alirzaev server : removed obsolete doc (#15670)
792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 81017865ee444cf49ce0136f2be1e41a0270ff91 2025-08-29T19:25:40+02:00 ExtReMLapin server : add documentation for `parallel_tool_calls` param (#15647)
c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638)
84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693)
fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 da54f9f1a2db07aaae390024ac466e7867685d94 2025-08-27T20:58:09+02:00 Johannes Gäßler server: higher timeout for tests (#15621)
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557)
611f419cff11e4952228162a1c44cb35dff2274a b1afcab804e3281867a5471fbd701e32eb32e512 2025-08-23T13:16:17-05:00 Jeff Bolz vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281)
4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108)
cd36b5e5c7fed2a3ac671dd542d579ca40b48b54 3f196be84b1376945737163e35a91e29e3e24d2f 2025-08-21T19:13:45+03:00 Georgi Gerganov llama : remove deprecated llama_kv_self API (#15472)
245be739df942861ddc52331b095b40f18e2a3f1 b2caf67db1208fd38a0570785c39f7370d906d8a 2025-08-21T11:47:52+02:00 Copilot ci : add copilot-instructions.md (#15286)
1b0db8f6e08951969e2447c2d18bf638effb8f75 29f538ac630d6544406a0702476e36808a6bd1b3 2025-08-21T07:19:22+02:00 stduhpf server : fix webui (#15462)
1bc664a26a1d93a48baf2483a7ff95291ca8bcb8 13aeb7aef284daed4ad07dc14b4b3e2a42b5ea97 2025-08-21T07:10:08+09:00 teo server: fix OpenAI API compatibility for usage statistics in chat streams (#15444)
1a99c2d948209d9ea5eac8b6dc0a297107244540 37f10f955f70e0158d50343d0b9a3f92d194daae 2025-08-20T18:32:05+08:00 xiaobing318 cmake : fix target include directories (#15450)
d2fcd91cf96b46f4485ce46b4e3a32bf0df37715 a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 2025-08-19T16:46:37+03:00 Georgi Gerganov server : disable context shift by default (#15416)
9d262f4bad0d37838100133537aaf0a83835ed12 f0d3c7405c323784a60f14ddddfbac3f7404d417 2025-08-19T08:45:26+03:00 Georgi Gerganov server : remove swa_full warning (#15399)
d1d82416006e7ff41780cb0e9b5f28d30a267497 618575c5825d7d4f170e686e772178d2aae148ae 2025-08-18T16:51:42+02:00 davidef server : fix incoming tasks not process in order (#15395)
e5155e698645242d4f019267ecc40ea9bad81b09 21c17b5befc5f6be5992bc87fc1ba99d388561df 2025-08-17T18:28:58-04:00 Oleksandr Kuvshynov server : export max observed n_past value (#15361)
de2192794f4e8e04f2e8167ef2424905145e88fc 2e2b22ba6607414a5d619ac6d2f034b5b02214e5 2025-08-16T04:18:31-05:00 Jeff Bolz vulkan: Support mul_mat_id with f32 accumulators (#15337)
ff27f80a74bbe5303acd511a6781a1de6d619b3c d3248d9b6557c75d59954c594bb53cf517591e91 2025-08-15T21:11:22+08:00 Aaron Teo ggml: initial IBM zDNN backend (#14975)
5ba36f61033d2819be27e2abb70e9a3bd20c0fde b204a5a234f4cf0b3f449476da639a5510c6d157 2025-08-14T16:23:56+02:00 uvos HIP: Cleanup hipification header (#15285)
b204a5a234f4cf0b3f449476da639a5510c6d157 646944cfa8961afd914dd6637739b3cda9a72e11 2025-08-14T09:23:11-05:00 Aldehir Rojas gpt-oss: implement harmony parsing (#15181)
d32e03f4495d3efa1c5126f53b449f1d429c5664 3973163bff40f7f5161b0f08a0011729e2b0406a 2025-08-14T14:59:50+03:00 Georgi Gerganov server : add SWA checkpoints (#15293)
b3e16665e14032d1276f9d0263acef8321b6f518 c24f4e26883a91219af5acfaf1471ca7ef582683 2025-08-13T15:43:00+02:00 Sigbjørn Skjæret server : enable -td and -tbd parameters (#15172)
e885445bc1719d2e289a9b2e11714e0f994e68be 648ebcdb739abfb5a9be14f4c5c0fd19ff268ef0 2025-08-13T05:28:21-05:00 Aldehir Rojas server : filter out harmony thought messages (#15278)
07aa869a91837d95fcb5612c65a188763ac38647 00f35d509e5367bf19ccaf4b4adddc38db4811c6 2025-08-13T11:30:45+02:00 Sigbjørn Skjæret ci : add more python requirements to copilot-setup-steps (#15289)
6028bf74351d35a06bd98498624f8c2f029f7d1a bc5182272c373267352bc689e5fca276934bea2d 2025-08-13T10:04:46+02:00 Oliver Simons CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132)
53d0a1265826f40c5dbc01d06aeab9e14fcbd69b 27093afe78912494073eb043fec93a007e49653c 2025-08-11T14:48:41+02:00 Xuan-Son Nguyen server : allow specifying reasoning_format in HTTP request (#15238)
cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a 50e81bdf5db563ab57a9a722b08f96fa8a76c927 2025-08-11T11:21:19+02:00 Daniel Bevenius kv-cache : log (debug) all streams in find_slot (#15176)
4850b52aedceeb70bb4fe49f2d7cd1df6ee98682 cd6983d56d2cce94ecb86bb114ae8379a609073c 2025-08-08T23:04:36+02:00 Johannes Gäßler server-bench: external OAI servers, sqlite (#15179)
36d3f00e142696f708ab297b9f8f1c825594712d 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 2025-08-07T05:31:48+02:00 Daniel Bevenius requirements : fix PyTorch uint64 compatibility (#15134)
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
f906275537d14c8fc7c6976d944233771fd6672c a9f7541ec25c4c8547daf5ff48700ad2836e2b7d 2025-08-02T10:12:41+02:00 Johannes Gäßler server: enable token array inputs for OAI API (#15001)
94933c8c2eeaa9a7983e3f6c08af76bd86724094 c1dacaa99b4ead6edbac928cd2da59436573f6b0 2025-07-31T05:25:23-07:00 g2mt server : implement universal assisted decoding (#12635)
a9f77a8be348deeb11fb3d54d412bf583003c90d 8a4a85627702b569d7d2810f2de06a4321656e9d 2025-07-31T14:08:23+02:00 Lukas Straub server : add openai-style logit_bias support (#14946)
41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964)
00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961)
bbd0f917797e9d524680f1b30d34a46eb06d7651 0a5036bee9cfb946870689db4400e9e0d17844c9 2025-07-29T10:40:50+02:00 Johannes Gäßler server-bench: make seed choice configurable (#14929)
c556418b600ad5792440942079d93e393595688b db16e2831c0f344f041af3d067db81c42b16eb22 2025-07-28T18:59:04+03:00 Radoslav Gerganov llama-bench : use local GPUs along with RPC servers (#14917)
f1a4e72de5950ab7136aeadddd675caf30dd6b3f 4762ad7316dcdec20016ab5985fb46a27902204d 2025-07-27T04:05:34-05:00 Jeff Bolz vulkan: skip empty set_rows to avoid invalid API usage (#14860)
793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743)
c12bbde37258c6d053322d1cedd4a9672109ae58 3f4fc97f1d745f1d5d3c853949503136d419e6de 2025-07-25T01:07:26-07:00 Diego Devesa sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855)
3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498)
adef81781a15083f218eae6c488b95cdad781971 48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245 2025-07-22T09:24:22+08:00 Molly Sophia server : allow setting `--reverse-prompt` arg (#14799)
b4efd77f8ab407836ca73a5176f041650c5b2411 2be60cbc2707359241c2784f9d2e30d8fc7cdabb 2025-07-21T09:24:51+02:00 IsaacDynamo server : add parse_special option to /tokenize endpoint (#14783)
2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 2025-07-18T17:33:41+03:00 Georgi Gerganov parallel : add option for different RNG seeds (#14757)
086cf81e88fb75287b71ff19c08a206b7bc2e02f d9b691081c04ec5fb0daa9d2b979f915c142963d 2025-07-17T09:22:11+02:00 Tarek Dakhran llama : fix parallel processing for lfm2 (#14705)
225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 ab140198211385b85eeeb0abd549a4bbe259e10d 2025-07-16T16:35:42+03:00 Georgi Gerganov llama : add high-throughput mode (#14363)
6ffd4e9c442e99afac3d138543ebf86d5fc5ee03 e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 2025-07-16T14:04:12+03:00 Georgi Gerganov server : pre-calculate EOG logit biases (#14721)
e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 538cc77f7f44dfa047dba6a06d90c86dda69cf1d 2025-07-16T19:12:22+09:00 Shunta Saito llama : fix parallel processing for plamo2 (#14716)
538cc77f7f44dfa047dba6a06d90c86dda69cf1d 5cae76654113160f691f581930b69fc5535e8159 2025-07-16T12:13:57+03:00 Georgi Gerganov server : fix handling of the ignore_eos flag (#14710)
5cae76654113160f691f581930b69fc5535e8159 4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 2025-07-16T09:33:28+02:00 Johannes Gäßler scripts: synthetic prompt mode for server-bench.py (#14695)
79e0b68c178656bb0632cb8602d2940b755077f8 c81f4192f91a1e209c1eec7a84fe5371ef9175da 2025-07-16T12:00:42+08:00 Min-Hua llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708)
494c5899cb76859f32ddd913534f2685fd684a3d 0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e 2025-07-14T13:14:30+02:00 Johannes Gäßler scripts: benchmark for HTTP server throughput (#14668)
0c1df14b5f8d992805cb22d0b77b44092a18aeab b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 2025-07-12T06:21:02-04:00 Douglas Hanley server : fix pooled embedding output (#14645)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
04655063c47af6cbced295c8c7ad369402b15300 20b7bf8a32259ad9189a4797fd3e3a859c537b99 2025-07-09T12:03:49+04:00 ibrahim khadraoui model : add support for Falcon-H1 family (#14534)
17a1f0d2d407040ee242e18dd79be8bb212cfcef 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 2025-07-08T11:47:33+03:00 Alawode Oluwandabira server: Add ability to mount server at prefix (#14544)
ddef99522d1ba74193b7394e803fab8db5c78bae 668168814601d2aef6161ce49ab186bc74177ae7 2025-07-05T09:17:14+02:00 Sigbjørn Skjæret server : fix assistant prefilling when content is an array (#14360)
a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 9067487c4411efb20400103fcccfdd389c80d428 2025-07-03T10:53:35+03:00 Georgi Gerganov kv-cache : use ggml_set_rows (#14285)
c839a2da1a0d4275c3a98f70c3a7627487573a46 e9b6350e61d592634263a14b3d77ecbf6c1fb096 2025-06-30T17:48:24+08:00 xiaobing318 cmake : Remove redundant include path in CMakeLists.txt (#14452)
caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 83790b0e7e09ab17238b16452a33053a71dbdfad 2025-06-29T20:02:53+02:00 matteo server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196)
83790b0e7e09ab17238b16452a33053a71dbdfad f47c1d7106e49062279bcc57fc1077c0db61e278 2025-06-29T19:29:57+02:00 Renat server : fix appearance of the chats list context menu for Safari (#14322)
bd9c981d7226107f18deb8344c3301450311bb8b 27208bf657cfe7262791df473927225e48efe482 2025-06-29T02:43:36-05:00 Jeff Bolz vulkan: Add fusion support for RMS_NORM+MUL (#14366)
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
1b809cee225222094a0ff5be8467240487ce4ae4 abf241045d09cad70dc797b0fba393ad09ee2cbe 2025-06-24T08:59:11Z Nigel Bosch server : move no API key doc to /health (#14352)
901e20bbe571fbde48d13eb188f4e7cdc7562fb6 0142961a2e67909e33cdf410274b56c08c5dce7a 2025-06-24T02:17:58-04:00 Bartowski jinja : Add Mistral-Small-3.2-24B-Instruct-2506.jinja (#14349)
8308f98c7fb778e54bf75538f5234d8bd20915e9 6369be07359d03723f38c0a4a014ff0f698a0738 2025-06-20T15:07:21+02:00 Nicolò Scipione sycl: add usage of enqueue_functions extension (#14244)
d67341dc18fc5cc63362880ab2f8f9ecfc7932e7 456af35eb70177b8dd5779b6d4c21bb020f9cebd 2025-06-19T16:01:03+03:00 aa956 server : add server parameters for draft model cache type (#13782)
edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979)
89fea80d298184d1cd93564f48e060d9f541f4b4 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 2025-06-16T22:33:27+03:00 Georgi Gerganov server : fix incorrect usage of llama_get_embeddings() (#14225)
d3e64b9f490cee41b7b9aa275dae2f6568ae3054 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb 2025-06-16T14:14:00+03:00 Georgi Gerganov llama : rework embeddings logic (#14208)
cd355eda7df1898d25d433b4bdaa4b4b479e0bad 30e5b01de2a0bcddc7c063c8ef0802703a958417 2025-06-15T23:36:22+02:00 Eric Curtin server : When listening on a unix domain socket don't print http:// and port (#14180)
c311ac664d68d10781a3e7b9f02d9d9520837d80 b9912ac570de8945ae9383c9ca8291027bf287dd 2025-06-15T10:08:58+03:00 Georgi Gerganov cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188)
3cb203c89f60483e349f841684173446ed23c28f 2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f 2025-06-14T18:25:15+02:00 Piotr llama-chat : Do not throw when tool parsing fails (#14012)
ffad04397399ea1650fda6560c7c753059804876 0889eba570126f8a2f5a0e88fde776bbc91cca66 2025-06-13T11:18:25+03:00 Georgi Gerganov server : fix SWA condition for full context reprocess (#14163)
c61285e7396c8e526fe7794c19e8d4f1c99bfc51 09cf2c7c655c90e53e100f29b830a788bab0653d 2025-06-13T08:45:37+01:00 Ewan Crawford SYCL: Bump oneMath commit (#14152)
7d516443dd7766569110b38e6374649bee6eb1c4 f6e1a7aa8787b5c00acba6370cb70a0beff48b1e 2025-06-12T11:51:38+03:00 Georgi Gerganov server : re-enable SWA speculative decoding (#14131)
2baf07727f921d9a4a1b63a2eff941e95d0488ed 7ae2932116a4de3141cbc8c488f7f6e4e06d8171 2025-06-11T06:43:43-04:00 Taylor server : pass default --keep argument (#14120)
1f7d50b2936023b26eb218e944e62834b80a2ce0 4c763c8d1b4d4de20bf364ec1837430783cba984 2025-06-11T00:19:25-05:00 Jeff Bolz vulkan: Track descriptor pools/sets per-context (#14109)
dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834)
2bb0467043258bdc58dbaefb33786f1731b38937 b8e2194efc529378be45ab9b27d6648a5b81458a 2025-06-10T02:41:01-04:00 Isaac McFadyen rpc : nicer error messages for RPC server crash (#14076)
87d34b381d5868e75586210ec17b5ef5deddc276 b460d16ae858c6624fd37aec316622a4060ca325 2025-06-09T12:57:58+03:00 Georgi Gerganov server : fix LRU check (#14079)
228f34c9ceefa3ea4f4d6933edd858121e8106cb 0974ad7a7cd4bca846b15c484ff3be890135a52c 2025-06-07T18:58:20+05:30 Akarshan Biswas SYCL: Implement few same quantized type copy kernels (#13739)
745aa5319b9930068aff5e87cf5e9eef7227339b 487a5e0401423bba02cd6e97e4d45131bb20b22b 2025-06-06T14:11:15+03:00 Georgi Gerganov llama : deprecate llama_kv_self_ API (#14030)
7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748 3a077146a4761fdbd24bdd8eb098f46b8adc4dda 2025-06-05T15:29:22+03:00 Georgi Gerganov memory : migrate from llama_kv_cache to more generic llama_memory (#14006)
363757628848a27a435bbf22ff9476e9aeda5f40 ea394d7ab1f8101716d48ce9421c94c71b93a00f 2025-06-02T21:34:40+03:00 Georgi Gerganov server : disable speculative decoding for SWA models (#13970)
c9bbc77931d223ed7e7cbcf1cb057bc02fd0db19 bfd322796cd838f906535ff3352624fc46338894 2025-06-02T10:15:44-07:00 Olivier Chafik `server`: update deepseek reasoning format (pass reasoning_content as diffs) (#13933)
c04621711a893cbd09cff6c927cb005bc6749e36 0fc16b42e8793364918e830c234c1f3caec29dae 2025-06-01T11:42:16+03:00 Georgi Gerganov parallel : fix n_junk == 0 (#13952)
e15898d1c7e87f1b3d14e0a3c385eeb424b085fe 803f8baf4f741d2f0465c46c33f285886b97a071 2025-05-31T08:26:10-07:00 Olivier Chafik server: allow unclosed thinking tags (#13931)
12d0188c0dc6146ffde6d277a93f232ccbe699f8 eb3949938e82a128855bc0676220bb2ce6e4228d 2025-05-31T10:24:04+03:00 Georgi Gerganov kv-cache : refactor + add llama_memory_state_i (#13746)
dd665cc9d4b378626cde11ea0c4c91f514fdc994 df0c0c7d02f951dc639d48fd536f79200460ac83 2025-05-30T19:38:07+03:00 Georgi Gerganov parallel : increase the variability of the prompt lengths (#13927)
53f925074de02c5304b00c14b4d6d8910c58667d db38704f0133be7832123495fa8fc2601ea999d4 2025-05-30T16:25:45+03:00 Georgi Gerganov sync : vendor (#13901)
10961339b26bd2eff01d5479e8879f435da261b7 d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef 2025-05-28T22:35:22+02:00 Xuan-Son Nguyen mtmd : move helpers to dedicated library (⚠️ breaking change) (#13866)
c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
952f3953c1b61cc70e79e536c42ddce6a5ea5ea7 81713121ee56755ba4a147d1a1e3fa248ec31a66 2025-05-27T04:05:18-07:00 Diego Devesa ggml : allow CUDA graphs when using pipeline parallelism (#13814)
cdf94a18023c92f41808ec874ba577d914674717 a26c4cc11ec7c6574e3691e90ecdbd67deeea35b 2025-05-26T14:34:27-07:00 Olivier Chafik server: --offline mode (#13804)
03f582ae8fccecff225c30a2802461b44761e822 88c125f2acce0e25e5fc8481ab0681415fc64a10 2025-05-26T08:03:57-07:00 Olivier Chafik server: fix streaming crashes (#13786)
d74e94c1b3ac02db01e47008e1f8d371029d81ac f13847cfb560d92492b480cca2c5d6aa9473cde3 2025-05-26T06:56:49-07:00 Olivier Chafik `server`: fix format of streamed tool call deltas (diff name, fix id location) (#13800)
f13847cfb560d92492b480cca2c5d6aa9473cde3 79c137f77677b3c8ee3c60a7da033721b938399a 2025-05-26T06:16:37-07:00 Olivier Chafik server: fix regression on streamed non-chat completion w/ stops (#13785)
e121edc4324a640be11b7e567edd39b721b0f8e4 2f099b510f460374acd52742b494595e3e3442d3 2025-05-26T00:30:51+01:00 Olivier Chafik `server`: add `--reasoning-budget 0` to disable thinking (incl. qwen3 w/ enable_thinking:false) (#13771)
de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac c508256db2de2b032e19c8ed833f4683c827c9a1 2025-05-25T16:34:36+03:00 Georgi Gerganov kv-cache : rework kv_cell (#13706)
d785f9c1fd1a1929c6d0e2a0b12cae5db867908b 4032ca406632212b075e3c61c2a4476128321410 2025-05-25T10:45:49+01:00 Olivier Chafik server: fix/test add_generation_prompt (#13770)
f5cd27b71da3ac375a04a41643d14fc779a8057b a2d02d5793fd9af7a7224773456501691b95fd02 2025-05-25T01:48:08+01:00 Olivier Chafik `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
9ecf3e66a38f20e41d221f62f05b17f70d040839 faaaff5f947064d13ef8b98659d81a1384c3e57b 2025-05-23T11:03:47+02:00 Xuan-Son Nguyen server : support audio input (#13714)
797990c4bca0dca5be295c63e3fb2800dc0a69c2 ab86335760ebb441574eb47f886fa1ee302e2131 2025-05-22T20:42:48+02:00 Xuan-Son Nguyen mtmd : add ultravox audio input (#13623)
cc74d5be990e37f201591fd868a92e64abdbf902 5be24af73d77ea23d399726f1d2a01a70ee86331 2025-05-22T16:33:39+03:00 Georgi Gerganov server : pad small embedding batches (#13692)
5fbfe384d4659f81c47a477eb8ee97692c7ffef9 c76532e7ba128bb097bf6836bf0f5592e1b56b76 2025-05-21T19:46:56+03:00 Georgi Gerganov server : improve error reporting (#13680)
c76532e7ba128bb097bf6836bf0f5592e1b56b76 2aa777d86d3f7bb80b93e226f1c25e47825f6a83 2025-05-21T19:40:35+03:00 antichristHater convert : add qwen2vl support for unsloth merges (#13686)
0d5c74216170ef97e5e7511563837263f2d1a496 42158ae2e8ead667a83f07247321ce85f32ace66 2025-05-21T15:15:27+02:00 Robin Davidsson server : Add the endpoints /api/tags and /api/chat (#13659)
42158ae2e8ead667a83f07247321ce85f32ace66 797f2ac0625b22edeff03cc30e0f988da6b6b068 2025-05-21T16:07:57+03:00 Dorin-Andrei Geman server : fix first message identification (#13634)
a4090d1174aed22dde5cacce2a4c27656b987a2f b69f1647f9953cb3773266d2c83a92fd0e7e6d66 2025-05-20T16:13:16+03:00 Georgi Gerganov llama : remove llama_kv_cache_view API + remove deprecated (#13653)
e298d2fbd082a52c0f6ed02729f94e9bf630cf17 f0adb80bf7c2c0d80abb04f4533b5513622d9964 2025-05-20T08:05:46+03:00 Georgi Gerganov kv-cache : add SWA support (#13194)
f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c d30cb5a7fa17362c47e94a023276f169916e0d03 2025-05-19T11:46:09+01:00 Alberto Cabrera Pérez ci : upgraded oneAPI version in SYCL workflows and dockerfile (#13532)
6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9 2025-05-17T17:59:48-04:00 Isaac McFadyen server : added --no-prefill-assistant flag (#13608)
518329b2d4434d0683c30b741b4f4cf5734b5f99 2f5a4e1e09567e09be8b84a5f976334de9539d17 2025-05-17T12:58:55+03:00 Georgi Gerganov parallel : add option for non-shared and larger prompts (#13598)
6aa892ec2aa7fe0c93e87c4b970d83a942fb9454 aea9f8b4e73876739bf88fb705502f291294e469 2025-05-16T21:50:00+02:00 Xuan-Son Nguyen server : do not return error out of context (with ctx shift disabled) (#13577)
3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
c753d7bed0dc2cc2d5c42dfa9806cba91748392e b2838049ccf50859cea4c390e81405c2fb01e820 2025-05-15T08:40:58+02:00 Piotr Wilkin (ilintar) server : proper error handling for missing elements in messages array (OpenAI compatible backend) (#13540)
aa48e373f256df9608395ee6881e7010840d6202 e3a9421b78da5c810d812e6348a405f5acc39f34 2025-05-15T02:39:51+01:00 Olivier Chafik `server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802)
053174436f3b3cbb01077f26ff17809537b832c7 360a9c98e13d35f322b4c5b1309aab0cc90ed82b 2025-05-14T15:42:10+03:00 Georgi Gerganov server : passthrough the /models endpoint during loading (#13535)
360a9c98e13d35f322b4c5b1309aab0cc90ed82b 09d13d94fb169093095416ac6323551c37b75339 2025-05-14T13:35:07+02:00 Xuan-Son Nguyen server : fix cache_tokens bug with no cache_prompt (#13533)
d486dd3e8ecfba0170f8632a1530540de560f4a3 21ca987fba504d273ea28ebc4d3e5b3736a11c8e 2025-05-14T10:07:31+02:00 Luca Stefani webui: Allow pasting file from clipboard (#13526)
71bdbdb58757d508557e6d8b387f666cdfb25c5e f0995d28ce3d15095b6845d94ce4465e46575873 2025-05-13T17:07:21+02:00 Xuan-Son Nguyen clip : clip.h become private API (⚠️ breaking change) (#13510)
91159ee9df84edb72ccf874e353d2414f3a8c60d 22cdab343b63edd0906f1c132616746085f81983 2025-05-12T18:56:42+07:00 Anudit Nagar server : allow content to be null in oaicompat_completion_params_parse (#13477)
9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1 09232370fc6426aa5dd9be01a8271b9c28f5af3a 2025-05-11T11:08:26-04:00 Anthony Umfer tools : fix uninitialized llama_batch in server (#13436)
3b24d26c22b9d92b5aa39930988700c84e524cf4 43dfd741a5da77982e0a94d1e522a2481dfb914d 2025-05-10T18:44:49+02:00 Xuan-Son Nguyen server : update docs (#13432)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
b486ba05bf973aae3652b3fd593e0b257d3a41d4 02115dcd9a6d0c03b527d5bee8c1493ab819ddbd 2025-05-09T10:31:07+03:00 Radoslav Gerganov rpc : add rpc_msg_set_tensor_hash_req (#13353)
d9c4accaff30926e8a5fd8a2429e549158a845e0 15e03282bb432631193464100c2237a3b6bcfe4c 2025-05-09T09:06:37+02:00 Xuan-Son Nguyen server : (webui) rename has_multimodal --> modalities (#13393)
ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 8c83449cb780c201839653812681c3a4cf17feed 2025-05-08T18:51:45+02:00 Xuan-Son Nguyen server : (webui) fix a very small misalignment (#13387)
8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365)
233461f8121455f957a47e6a22a77b3bc88277b0 b34c859146630dff136943abc9852ca173a7c9d6 2025-05-05T17:12:19-03:00 oobabooga sampling : Integrate Top-nσ into main sampling chain (and add it to the server) (#13264)
b34c859146630dff136943abc9852ca173a7c9d6 9b61acf06041dcbaff6afa5f28940e93297f8520 2025-05-05T17:03:31+03:00 igardev server : Webui - change setText command from parent window to also send the message. (#13309)
27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184)
fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 dcf886007de4b8e5200f461a13233315f897fb9d 2025-05-02T09:48:31+03:00 Georgi Gerganov server : add cache reuse card link to help (#13230)
e2e1ddb93a01ce282e304431b37e60b3cddb6114 d9d398f84f96d16c308d4976f5e90222ecc2a492 2025-04-29T20:33:10+02:00 matteo server : Prefilling assistant message in openai compatible API (#13174)
43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069)
77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba d5fe4e81bd447124836ecfb47d794f8768665b9f 2025-04-26T22:05:31+08:00 SXX ggml: move fp16/bf16 conversion optimizations to CPU backend + export conversion APIs (#13107)
ab47dec3d37aa1927c2ec590e166b76141374ed3 7b53389c24a507564be39e1ea82746a39749059b 2025-04-22T16:16:10+03:00 Georgi Gerganov security : add note about RPC and server functionality (#13061)
35370ba94593c3abc9550328377d461fc4f822b7 8d6600576318dfc6b091fca744b0fd36a5e5255f 2025-04-18T19:58:12+02:00 Xuan-Son Nguyen server : use std::move whenever possible (#12936)
b9154ecff93ff54dc554411eb844a2a654be49f2 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2025-04-18T10:04:51+02:00 Xuan-Son Nguyen mtmd : add methods to access `mtmd_image_tokens` (#12906)
2db9ba1464f3de0aceb2b5289963e69fc369cb66 2f74c354c0f752ed9aabf7d3a350e6edebd7e744 2025-04-18T10:13:42+03:00 Radoslav Gerganov rpc : add RPC_CMD_HELLO (#12955)
c94085df2871d2cad11f6411304d7798d7dd4cdd e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca 2025-04-11T23:37:41+03:00 Georgi Gerganov server : add VSCode's Github Copilot Chat support (#12896)
e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca b6930ebc421e20399663bbd3bc7b7266d5236d06 2025-04-11T13:04:14-07:00 yuri@FreeBSD rpc : Set cache directory in rpc-server.cpp on FreeBSD (#12903)
578754b3157d662c2fdd51eaa62b6c1f43d3172c b2034c2b55b36b2192bdefb3b295db2a911370f5 2025-04-11T15:32:14+02:00 Ewan Crawford sycl: Support sycl_ext_oneapi_limited_graph (#12873)
8b9cc7cdd8a0dcf0176c60c755322c95b5965299 64eda5deb9859e87a020e56bab5d2f9ca956f1de 2025-04-10T22:57:16+02:00 Xuan-Son Nguyen llava : introduce libmtmd (#12849)
64eda5deb9859e87a020e56bab5d2f9ca956f1de fe5b78c89670b2f37ecb216306bed3e677b49d9f 2025-04-10T17:24:44+02:00 Xuan-Son Nguyen convert : ability to lazy-load safetensors remotely without downloading to disk (#12820)
a19b5cef16d885c44c635da4a5c97113c1577de8 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2025-04-08T19:54:51+03:00 Georgi Gerganov llama : fix FA when KV cache is not used (i.e. embeddings) (#12825)
78a1ba0a4f2bfed5b8b8e312592143d22e531698 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 2025-04-08T18:37:06+02:00 Xuan-Son Nguyen server : fix thread.join() on exit (#12831)
8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 656babd6c21a3b9b3622324cfcc80a2ab78da25b 2025-04-08T14:14:59+05:00 characharm server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785)
b7723942970b70412793f1926a35cfb93d5c157c 23106f94ea2bc3da929afb7330655fd5515d08dc 2025-04-04T09:09:52-05:00 Nauful Shaikh server : webui : Upgrade daisyui, tailwindcss. (#12735)
a10b36c91a091f4606710fba4e9327fd71e0e738 83a88bd6affbe148a622ac730952ac5b8b585979 2025-04-02T14:32:59+03:00 Georgi Gerganov llama : refactor kv cache guard (#12695)
3891e183c61c1e25c2c61afe68d7b95019ea3f89 af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 2025-03-20T07:02:18+01:00 Daniel Bevenius examples : command.wasm updates (whisper/2904)
5d01670266859444366e4f333ade5e0e5e2ae63d ef03229ff423dd1991f4f44ef1352f03334d86eb 2025-03-28T01:05:44-07:00 Benson Wong server : include speculative decoding stats when timings_per_token is enabled (#12603)
2099a9d5dbdcd2841d02dd396a71d0de70bf4490 296901983700f3c37449bcb555d85d27150a679d 2025-03-27T23:41:04+01:00 Piotr server : Support listening on a unix socket (#12613)
77f9c6bbe55fccd9ea567794024cb80943947901 18b663d8e4ef352a9a15ff15d695fc3258801d60 2025-03-23T19:30:26+01:00 Marius Gerdes server : Add verbose output to OAI compatible chat endpoint. (#12246)
517b5ddbf002b91fd6d6daf5d8db8c88a0173039 a9b59288e222f39fc0311dc66944ed5a86c815fa 2025-03-20T01:22:06+05:30 Gaurav Garg CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183)
810e0af3f50379682dd46b7967c4aadf3f8286f6 eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c 2025-03-18T12:05:42+02:00 Georgi Gerganov server : fix warmup draft cache type (#12446)
7dfad387e3f6ac98d383ded2d175eb59736a3993 60c902926c928f9c2cd6390ce411876f92feeaf3 2025-03-18T07:27:50+08:00 Molly Sophia llama: Add support for RWKV v7 architecture (#12412)
b1b132efcba216c873715c483809730bb253f4a1 01e8f2138b2e40902afe2983ecbf503a08d74b1d 2025-03-17T23:55:13+05:30 Gaurav Garg cuda : enable CUDA Graph on CUDA Toolkit < 12.x (#12394)
8fcb563613e20a04dd9791f0a9b8a41086428c09 add2a3aa5a1571211aa5c7303b8e80c8d1824b91 2025-03-14T13:47:05+01:00 fairydreaming Load all MoE experts during warmup (#11571)
add2a3aa5a1571211aa5c7303b8e80c8d1824b91 c522ce4143a2b5c277f1e5f65cd570dbd0626466 2025-03-14T11:21:17+01:00 Victor server: fix "--grammar-file" parameter (#12285)
2048b5913d51beab82dfe29955f9008130b936c0 f08f4b3187b691bb08a8884ed39ebaa94e956707 2025-03-13T06:10:05-04:00 Ishaan Gandhi server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
4e39a3c332f84b890e91353ec448502cb8373a6f be421fc429795d135786f5a0e489709220a9c43a 2025-03-10T10:59:03Z Olivier Chafik `server`: extract <think> tags from qwq outputs (#12297)
1e2f78a00450593e2dfa458796fcdd9987300dfc 0fd7ca7a210bd4abc995cd728491043491dbdef7 2025-03-09T19:08:20+02:00 Georgi Gerganov server : add speculative decoding presets for FIM (#12287)
7ab364390f92b0b8d83f69821a536b424838f3f8 7c7f3b7f435f41f2508e0e3010f0013cd8335156 2025-03-07T20:54:30+02:00 Georgi Gerganov server : infill gen ends on new line (#12254)
8fad3c7a7c54a25a1ca38dfb08244df55288e675 7cf64f6beecf54c6ac71503181f154667fd4228a 2025-03-07T11:15:33+01:00 Sigbjørn Skjæret server : Log original chat template parsing error (#12233)
06a92a193a07afe445929607be9d5e4d033956fb a057897ad4e48e3df0354256e0cc80dadcb57595 2025-03-05T15:25:45+08:00 Clauszy server : fix cache reuse logic (#12161)
1a24c4621f0280306b0d53a4fa474fc65d3f1b2e becade5de77674696539163dfbaf5c041a1a8e97 2025-03-04T06:24:07Z Olivier Chafik `server`: fix deadly typo in response_format.json_schema.schema handling (#12168)
2679c3b55d1c9c3fed56dea00fea713622e42594 c43af9276b119dae7436b7878d59671d0f6b1a97 2025-03-03T16:17:36+01:00 Daniel Bevenius ci : set GITHUB_ACTION env var for server tests (#12162)
9660ffef582ca275092b621c87085a6eea136a90 c950a1f69269bff416d74349a82d78181ce6f0f8 2025-03-03T20:54:08+08:00 ag2s20150909 ggml : fix kleidiai build (#12159)
70680c48e5f77d2d3138712a6582bd8c1e548922 c43a3e7996e585e2addde1e44057a4f3cdbadef8 2025-02-28T05:41:47-08:00 William Tambellini ggml : upgrade init_tensor API to return a ggml_status (#11854)
d7cfe1ffe0f435d0048a6058d529daf76e072d9c a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552 2025-02-25T18:52:56Z Olivier Chafik docs: add docs/function-calling.md to lighten server/README.md's plight (#12069)
401af80b546005a06854827b732e3b46979ae028 c132239bfbc1aae3a96dfee3350afcb491f64ade 2025-02-25T11:52:52Z rhjdvsgsgks server: handle echo=false on /v1/completions (#12060)
0b52745649062c04b546aab662cfdb220f4f0621 4d1051a40ffc2fdff80bc532eea5b9568b85c156 2025-02-25T10:40:22Z Olivier Chafik server: support add_generation_prompt query param (#12062)
3e9a2860e996657fc10db8393cf65adc40703082 58d07a8043a1395177cf77b3e4f388e34182ae64 2025-02-25T01:29:33-08:00 Vitali Lovich llama : expose llama_model_n_head_kv in the API (#11997)
7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794)
cf756d6e0a314e0fe25ff944341d79ea8c94cc96 d70908421ff22b013e8209f2d12e5c750663c620 2025-02-22T12:46:31+02:00 Georgi Gerganov server : disable Nagle's algorithm (#12020)
c392e5094deaf2d1a7c18683214f007fad3fe42b c5d91a74006c49376590ef2b67420bc7ce206397 2025-02-21T03:43:22+09:00 momonga server (webui): Fix Premature Submission During IME Conversion (#11971)
d07c621393fab6cf32f3add2aa65e4d5331d4a67 abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 2025-02-19T12:29:52+01:00 Daniel Bevenius common : add llama.vim preset for Qwen2.5 Coder (#11945)
b58934c1836b5ea51dbacbe899eee125775e77c9 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 2025-02-19T00:01:44+02:00 igardev server : (webui) Enable communication with parent html (if webui is in iframe) (#11940)
63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 63ac12856303108ee46635e6c9e751f81415ee64 2025-02-18T18:03:23Z Olivier Chafik tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900)
63ac12856303108ee46635e6c9e751f81415ee64 5137da7b8c3eaa090476a632888ca178ba109f8a 2025-02-18T14:21:41+01:00 Xuan-Son Nguyen server : add TEI API format for /rerank endpoint (#11942)
09aaf4f1f5b69b5173b7fcd24eab96729f6b242a 73e2ed3ce3492d3ed70193dd09ae8aa44779651d 2025-02-18T17:12:49+08:00 xiaobing318 docs : Fix duplicated file extension in test command (#11935)
c4d29baf3236b011730b6ccaae6852e781fb1b91 2eea03d86a2d132c8245468c26290ce07a27a8e8 2025-02-17T11:25:12+01:00 Antoine Viallon server : fix divide-by-zero in metrics reporting (#11915)
0f2bbe656473177538956d22b6842bcaa0449fab fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf 2025-02-16T18:11:22+01:00 Xuan-Son Nguyen server : bump httplib to 0.19.0 (#11908)
f3552296924e704c11ca936907b9cad7873db8e2 fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88 2025-02-15T10:11:36Z Olivier Chafik server: fix type promotion typo causing crashes w/ --jinja w/o tools (#11880)
c1f958c0381e797135b7d42a677542133264193c c48f630d1c1942fce08aa7cb18a53ace443cd611 2025-02-13T17:22:44+01:00 Reza Rahemtola server : (docs) Update wrong tool calling example (#11809)
c48f630d1c1942fce08aa7cb18a53ace443cd611 bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 2025-02-13T14:46:59+01:00 Daniel Bevenius llama : add --completion-bash option (#11846)
c7f460ab882065ec5696e3d51e24dbf67b539287 27e8a23300e30cd6ff6107ce262acf832ca60597 2025-02-13T10:05:16Z Olivier Chafik `server`: fix tool-call of DeepSeek R1 Qwen, return reasoning_content (Command 7RB & DeepSeek R1) unless `--reasoning-format none` (#11607)
e4376270d971cff7992bdb6c5412a739195b1459 3e693197724c31d53a9b69018c2f1bd0b93ebab2 2025-02-13T01:25:34-05:00 Oleksandr Kuvshynov llama.cpp: fix warning message (#11839)
a394039db004c6ee00098250d160b5aa018c2314 be3bbd62153820ff6d358c817360927f429105c4 2025-02-13T01:02:38+01:00 Diego Devesa ggml-cpu : add chunking support to mul_mat_id (#11666)
31afcbee0eebbc998ab311aa314e389d60aa2127 5c4284d57bbc613121e90de5271f1cbc95d55872 2025-02-12T22:47:11Z Woof Dog server : (webui) Give copy button back to all message bubbles (#11814)
a18f481f99962638092d6f1c98b1d34d3e3256de b9ab0a4d0b2ed19effec130921d05fb5c30b68c5 2025-02-11T14:06:45+01:00 Daniel Bevenius server : use common_token_to_piece instead of common_detokenize (#11740)
507f9174fe856772b6c7c17e81be442de7ee6d1e 19b392d58dc08c366d0b29bd3b9c6991fa4e1662 2025-02-10T21:23:17+01:00 Xuan-Son Nguyen server : (webui) introduce conversation branching + idb storage (#11792)
0893e0114e934bdd0eba0ff69d9ef8c59343cbc3 d7b31a9d84297b493a61c9a8ee3a458e7ccc64a7 2025-02-10T18:03:28+01:00 Xuan-Son Nguyen server : correct signal handler (#11795)
55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 e6e658319952f7ad269dc11275b9edddc721fc6d 2025-02-08T21:54:50+01:00 Xuan-Son Nguyen server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759)
e6e658319952f7ad269dc11275b9edddc721fc6d aaa55053076f3d5d7da4d9a877cb77e112dabed4 2025-02-08T19:09:55Z Woof Dog server : (webui) increase edit textarea size (#11763)
aaa55053076f3d5d7da4d9a877cb77e112dabed4 bdcf8b6a56f4d49d3420ae5b21cdf9a116040551 2025-02-08T18:08:43+02:00 Georgi Gerganov server : minor log updates (#11760)
0cf867160ca9d492e06c0bc688b337cffd1eb187 d2fe216fb2fb7ca8627618c9ea3a2e7886325780 2025-02-08T10:42:34+01:00 Xuan-Son Nguyen server : (webui) fix numeric settings being saved as string (#11739)
2d219b389e8c8c40bce547b08c8aa7add60fde1f 333820d7491cd31c707a340ff23b984a84e40154 2025-02-07T08:55:47-05:00 Christian Fillion vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
7ee953a64a40c09438b2064539becdbc577cefd0 ec3bc8270bc67b58955748d40a3e558a05b2d8f2 2025-02-07T04:33:27-05:00 Christian Fillion llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727)
b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677)
1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19 2fb3c32a1634488a5265d1304ab37628eeb5480d 2025-02-06T09:29:13-05:00 Patrick Peng rpc: fix known RCE in rpc-server (ggml/1103)
2fb3c32a1634488a5265d1304ab37628eeb5480d 9ab42dc722ad19a12af80f38a06474d498f96da3 2025-02-06T17:32:29+01:00 Xuan-Son Nguyen server : (webui) migrate project to ReactJS with typescript (#11688)
902368a06b915b860236cfc97ff885b2aceae256 c3db0480bb820e120249014b380e1f4badf2a1c1 2025-02-05T19:52:31-06:00 Charles Duffy metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690)
3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e 1bef571f6a23c36a26dabacba631763f9a893b83 2025-02-04T18:25:42+01:00 Xuan-Son Nguyen server : add try..catch to places not covered by set_exception_handler (#11620)
db288b60cb49eab69703f995379b8d75c18bf5b3 106045e7bb8db481bb2ebbc60e3b53cb27ada117 2025-02-04T15:48:53Z Olivier Chafik `tool-call`: command r7b fix for normal responses (#11608)
f117d84b48104992ba16961b35a96fa93efbb355 534c46b53c23613628d72e93c63ea01ea4d1e2ac 2025-02-04T19:15:24+08:00 Jhen-Jie Hong swift : fix llama-vocab api usage (#11645)
b3451785aca16fbf4214eeba7e4612676cdf8ccb 1d1e6a90bcf485ad2dee309c31cf19bd802465e5 2025-02-04T00:10:52+01:00 Xuan-Son Nguyen server : (webui) revert hacky solution from #11626 (#11634)
1d1e6a90bcf485ad2dee309c31cf19bd802465e5 5598f475be3e31430fbe17ebb85654ec90dc201e 2025-02-03T22:16:27Z Woof Dog server : (webui) allow typing and submitting during llm response (#11626)
5598f475be3e31430fbe17ebb85654ec90dc201e 8ec05832fa8409c49b3bbd13f957c6ae8486e618 2025-02-03T16:45:38+01:00 Daniel Bevenius server : remove CPPHTTPLIB_NO_EXCEPTIONS define (#11622)
d92cb67e37abc23b1c6f7b0ef27a9889da8537e3 6eecde3cc8fda44da7794042e3668de4af3c32c6 2025-02-03T09:42:55Z mashdragon server : (webui) Fix Shift+Enter handling (#11609)
bfcce4d693617ec843d0b2510f6ee16e6bc6720d 69804487e0b10f2c5c06316f0ac0eb6ada68433f 2025-02-02T09:25:38Z Olivier Chafik `tool-call`: support Command R7B (+ return tool_plan "thoughts" in API) (#11585)
ff227703d6d6e1888bdc7af6138514092ffcdb96 0cec062a638700495673f5494d200b74340538be 2025-02-01T23:55:32-08:00 Michał Moskal sampling : support for llguidance grammars (#10224)
a83f528688324a21484a97af1d1be5e1bc8d4c8e b1bcd309fc8ac929cbd4a6207b3a19886bda031f 2025-01-31T14:15:25Z Olivier Chafik `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539)
4a2b196d03d52da31236390e9f5694a88d43d11d 1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f 2025-01-31T08:12:40Z Olivier Chafik server : fix --jinja when there's no tools or schema (typo was forcing JSON) (#11531)
a2df2787b32e0846205f7151dfad88ceab592beb 553f1e46e9e864514bbd6bf4009146db66be0541 2025-01-31T06:04:53+01:00 Daniel Bevenius server : update help metrics processing/deferred (#11512)
4314e56c4f8c5091f45732f39bd94c0c6c323798 496e5bf46bab757d05e18227cb4e17055ae42f42 2025-01-30T11:05:00+01:00 Daniel Bevenius server : use lambda instead of std::bind (#11507)
496e5bf46bab757d05e18227cb4e17055ae42f42 7919256c57f05c09b0b50ec9abb37ff62dab7251 2025-01-30T04:11:53-05:00 Isaac McFadyen server : (docs) added response format for /apply-template [no ci] (#11503)
e0449763a4f335cca374254a72892141f41eaa59 eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 2025-01-30T05:48:14+01:00 Daniel Bevenius server : update json snippets in README.md [no ci] (#11492)
eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 66ee4f297cff3c7ce98b31dbc0ce909d41b9e408 2025-01-29T12:45:44-06:00 Nigel Bosch server : add /apply-template endpoint for additional use cases of Minja functionality (#11489)
e51c47b401f8cb5f21630a05171e2529cde4d186 2711d0215ff6a1ecb2202ac8c1f135bceed7057b 2025-01-29T16:34:18+01:00 Daniel Bevenius server : update auto gen files comments [no ci] (#11484)
cf8cc856d7d02165bd08593b4757e1256a62d501 d0c08040b6c8bebeade7b8d5764df6cf901678d5 2025-01-28T16:03:42-07:00 peidaqi server : Fixed wrong function name in llamacpp server unit test (#11473)
49b0e3cec4b67dc9f4debe3a16acd4c819f751d6 20a758155bc5f37290b20ea44d76ba99c4e7f2cb 2025-01-25T16:36:44+01:00 Xuan Son Nguyen server : fix cleaning up stream task (#11418)
c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4 564804b79b78df1469ec8646869972de5e885ec4 2025-01-24T09:02:38+01:00 stduhpf server : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364)
58456616408c828a1ce6d2481940fd1c97bce3b5 f211d1dc10332b7e89a4abd1041903fa63bfed27 2025-01-23T13:56:05+01:00 Xuan Son Nguyen server : add more clean up when cancel_tasks is called (#11340)
12c2bdf2de34f747d13b270fc9d3b52490bf194f c64d2becb13f2a7c0145b516a05f028d949a046b 2025-01-22T17:44:40+01:00 Diego Devesa server : fix draft context not being released (#11354)
6171c9d25820ccf676b243c172868819d882848f e28245f35f2faaf249dd352998b3693a8cc28c51 2025-01-21T13:18:51Z Olivier Chafik Add Jinja template support (#11016)
f30f099228f774209aa3010b78dfbe5d262e69aa f26c87417999209e7f4576b4f3ecf7a5b9c66a29 2025-01-18T14:12:05+01:00 Xuan Son Nguyen server : implement cancellable request (#11285)
0ccd7f3eb2debe477ffe3c44d5353cc388c9418d f446c2cf6a56a750b67c967505e717a996d2f2fd 2025-01-15T05:44:38+01:00 Daniel Bevenius examples : add embd_to_audio to tts-outetts.py [no ci] (#11235)
c5bf0d1bd7eb8762edca47e0a95f64e6fbfaf5b1 091592d758cb55af7bfadd6c397f61db387aa8f3 2025-01-14T14:09:33+03:30 ebraminio server : Improve code snippets direction between RTL text (#11221)
504af20ee4eae72080a56d59d744f6774f7901ce 84a44815f704aaed8e8edec7a39e846a975c7ba9 2025-01-13T22:53:31+03:30 ebraminio server : (UI) Improve messages bubble shape in RTL (#11220)
437e05f714cdd67757405221578d3f95f8228b63 ca001f6656c1c3d29ef479b3aa5d669453e63be5 2025-01-13T17:16:39+03:30 ebraminio server : (UI) Support for RTL text as models input or output (#11208)
afa8a9ec9b520137bbd1ca6838cda93ee39baf20 c05e8c9934f94fde49bc1bc9dc51eed282605150 2025-01-12T11:32:42+02:00 Georgi Gerganov llama : add `llama_vocab`, functions -> methods, naming (#11110)
8eceb888d7b7f5e93d20a4f85ca6511022b87040 f8feb4b01af374ad2fce302fd5790529c615710b 2025-01-09T11:28:29+01:00 Daniel Bevenius server : add tooltips to settings and themes btn (#11154)
53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f 017cc5f446863316d05522a87f25ec48713a9492 2025-01-07T18:01:58+01:00 Johannes Gäßler GGUF: C++ refactor, backend support, misc fixes (#11030)
e6e7c75d94adf4d39e846d30807c531ff22865e7 09186fabbe05236f2b9446ba6c643cb737540d10 2025-01-06T15:36:08+02:00 Georgi Gerganov server : fix extra BOS in infill endpoint (#11106)
6369f867a410416239d9f20ec27c2b1d6a9fee52 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 2025-01-06T10:28:17+01:00 Daniel Bevenius llama : rename missed batch params/vars to ubatch (#10059)
47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 2025-01-06T10:55:18+02:00 Georgi Gerganov llama : update llama_model API names (#11063)
2f0ee84b9b02d2a98742308026f060ebdc2423f1 0da5d860266c6928b8c9408efbd264ae59fedda6 2025-01-02T18:06:12+01:00 Pierrick Hymbert server: bench: minor fixes (#10765)
0da5d860266c6928b8c9408efbd264ae59fedda6 a45433ba209ee0b33d02c7dc4c31f29894ad83a6 2025-01-02T15:05:18+01:00 Xuan Son Nguyen server : allow using LoRA adapters per-request (#10994)
45095a61bfd164e87563a0dc0fbd7b0e9891590b 5896c65232c7dc87d78426956b16f63fbf58dcf6 2024-12-31T15:22:01+01:00 Xuan Son Nguyen server : clean up built-in template detection (#11026)
5896c65232c7dc87d78426956b16f63fbf58dcf6 bc7b1f86324279a3dabb705c04ad754a2b27df16 2024-12-31T12:34:13+01:00 Xuan Son Nguyen server : add OAI compat for /v1/completions (#10974)
f865ea149d71ef883e3780fced8a20a1464eccf4 16cdce7b68218959e0658e2f95b4572573d5008e 2024-12-28T10:09:19-05:00 Isaac McFadyen server: added more docs for response_fields field (#10995)
16cdce7b68218959e0658e2f95b4572573d5008e d79d8f39b4da6deca4aea8bf130c6034c482b320 2024-12-28T15:08:54Z Alexey Parfenov server : fix token duplication when streaming with stop strings (#10997)
9ba399dfa7f115effc63d48e6860a94c9faa31b2 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 2024-12-24T21:33:04+01:00 Reza Kakhki server : add support for "encoding_format": "base64" to the */embeddings endpoints (#10967)
09fe2e76137dde850b13313f720e7ffa17efdefa 30caac3a68a54de8396b21e20ba972554c587230 2024-12-24T19:39:49+03:00 NeverLucky server: allow filtering llama server response fields (#10940)
14b699ecde8f1e9e251ebff9eca39ebc5603b83b 485dc01214f266afff7004bc702498b491abc404 2024-12-23T12:52:25+01:00 Xuan Son Nguyen server : fix missing model id in /model endpoint (#10957)
485dc01214f266afff7004bc702498b491abc404 86bf31cfe684849157f0875b4f0ebccac7034547 2024-12-23T12:02:44+01:00 Xuan Son Nguyen server : add system_fingerprint to chat/completion (#10917)
86bf31cfe684849157f0875b4f0ebccac7034547 b92a14a841fb4dfaf27b29d982ec8ba5289a3bff 2024-12-23T10:39:30+02:00 Radoslav Gerganov rpc-server : add support for the SYCL backend (#10934)
0ca416c91aea4549d9c77e3efeca403e15aa6c75 21ae3b9be83820565d1a720999b7f63ce95b4920 2024-12-20T14:12:06+01:00 Xuan Son Nguyen server : (UI) fix copy to clipboard function (#10916)
57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e a3c33b1dce2d4f25040b75f66629104bd1e40128 2024-12-19T15:40:08+01:00 Xuan Son Nguyen server : fix logprobs, make it OAI-compatible (#10783)
0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784)
7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 152610eda91217ac409342cd976d05f5114ad39f 2024-12-18T04:00:07-10:00 Gaetan Bisson server: avoid overwriting Authorization header (#10878)
152610eda91217ac409342cd976d05f5114ad39f 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 2024-12-18T13:01:41+02:00 Georgi Gerganov server : output embeddings for all tokens when pooling = none (#10861)
0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 46828872c31b25df16169cbbf5c2225fa9cb0675 2024-12-18T11:05:29+02:00 Georgi Gerganov server : add "tokens" output (#10853)
46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872)
d62b532c52e0118323277eaa5f442e11ce6505ed 081b29bd2a3d91e7772e3910ce223dd63b8d7d26 2024-12-17T17:24:22-05:00 DAN™ Use model->gguf_kv for loading the template instead of using the C API. (#10868)
05c3a444b8b017b01b366b725ba22c740aae6b38 382bc7f2e8ffd0b89f23e840d097e21f301197ba 2024-12-17T16:00:24Z krystiancha server : fill usage info in embeddings and rerank responses (#10852)
227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 7b1ec53f56bb72c49e4c8434157895f94d3709c2 2024-12-17T09:52:09+01:00 Xuan Son Nguyen server : (UI) fix missing async generator on safari (#10857)
5478bbcd173e7027af7689493c7421719f5c43df b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 2024-12-15T05:55:54-06:00 Vinesh Janarthanan server: (UI) add syntax highlighting and latex math rendering (#10808)
89d604f2c87af9db657d8a27a1528bc4b7579c29 e52aba537a34d51a65cddec6bc6dafc9031edc63 2024-12-14T22:29:45Z Michelle Tan server: Fix `has_next_line` in JSON response (#10818)
a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
5555c0c1f66d766c544c30699190dec0285bcbfc 973f328b1e92a6406030442dfd15b29449e89747 2024-12-11T22:40:40Z CentricStorm docs: update server streaming mode documentation (#9519)
973f328b1e92a6406030442dfd15b29449e89747 235f6e14bf0ed0211c51aeff14139038ae1000aa fb18934a97425c42c8b32a1baaa94f0080eb051d 2024-12-11T23:14:46+02:00 Georgi Gerganov Merge pull request #10788 from ggerganov/gg/gguf-py-0.11.0
235f6e14bf0ed0211c51aeff14139038ae1000aa 1a31d0dc00ba946d448e16ecc915ce5e8355994e 2024-12-11T20:52:14+01:00 Xuan Son Nguyen server : (UI) add tok/s, get rid of completion.js (#10786)
4b4d92b0986e3b627b9a9ef4782973108bf47691 43041d2eb32623d5b6ca734313327abe96f73146 2024-12-11T10:47:43Z CentricStorm docs: fix server documentation formatting (#10776)
b685daf3867c54e42a9db484d7b92619021d4510 dafae66cc242eb766797194d3c85c5e502625623 2024-12-10T14:23:17-06:00 Jeff Bolz vulkan: request round-to-even for fp16 in im2col/rope_head (#10767)
750cb3e246f7e544124cf18cb0c5e0c8b7e38738 a86ad841f103e471ac0fd7ee8852d1eb5015ce89 2024-12-10T18:23:24+01:00 Andreas Kieslinger CUDA: rename macros to avoid conflicts with WinAPI (#10736)
a86ad841f103e471ac0fd7ee8852d1eb5015ce89 a05e2afcc241c1ecd38ec5cb4c579d90cdf3f918 2024-12-10T17:22:34Z Yüg server : add flag to disable the web-ui (#10762) (#10751)
ce8784bdb153ff7794dde5a50b0ebfa51baa6171 e52522b8694ae73abf12feb18d29168674aa1c1b 2024-12-08T23:04:29+01:00 Xuan Son Nguyen server : fix format_infill (#10724)
e52522b8694ae73abf12feb18d29168674aa1c1b 06d70147e6480c021e493c442ae0f0d83ae366de 2024-12-08T20:38:51+01:00 Xuan Son Nguyen server : bring back info of final chunk in stream mode (#10722)
3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 d9c3ba2b7749c00df477599aa141a98b4521aa2c 2024-12-07T20:21:09+01:00 Xuan Son Nguyen server : (refactor) no more json in server_task input (#10691)
ce4a7b849388b67d45ad420bdd82d5efcd55647a 19d8762ab61df8286367588a80b9c7db4cb568db 2024-12-07T18:02:05+02:00 Georgi Gerganov server : various fixes (#10704)
19d8762ab61df8286367588a80b9c7db4cb568db c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 2024-12-07T13:37:50+01:00 Djip007 ggml : refactor online repacking (#10446)
c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 3df784b3050f657ea681f804187ce5bddb433e88 2024-12-07T11:52:44+02:00 Georgi Gerganov server : fix free of spec context and batch (#10651)
f162d45a21b27f7613f14539f9a4932d6ff3ca48 6c5bc0625fae6909cb40def15bc4bb45db6f7f4d 2024-12-06T13:29:05+01:00 Xuan Son Nguyen common : bring back --no-warmup to server (#10686)
6c5bc0625fae6909cb40def15bc4bb45db6f7f4d 7736837d62efed1dbebfe579472fca041eda12d6 2024-12-06T11:14:32+01:00 Xuan Son Nguyen server : (refactoring) do not rely on JSON internally (#10643)
7736837d62efed1dbebfe579472fca041eda12d6 c9c6e01daedac542b174c235872569fce5385982 2024-12-05T23:36:41+02:00 Plamen Minev fix(server) : not show alert when DONE is received (#10674)
1da7b765692764a8b33b08da61cbee63812a7bd9 59f4db10883a4f3e855cffbf2c3ab68430e95272 2024-12-04T22:38:20+02:00 Georgi Gerganov server : fix speculative decoding with context shift (#10641)
91c36c269bca75b2d08119c653512cd20b4ea2ba 1cd3df46bd49a0c1c78da8b68c956448a73b7476 2024-12-03T19:38:44+01:00 Xuan Son Nguyen server : (web ui) Various improvements, now use vite as bundler (#10599)
efb6ae963031709fc331e6e48cc4606ac8f9c3a7 667d70d1704dfa6977505f5d01d4638669b90dce 2024-12-02T19:27:24+01:00 PAB feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019)
3b4f2e33e2cbfca621e623c4b92b88da57a8c2f4 82bca2257b3cec72676abb26011f1b99fcdab29d 2024-12-03T12:54:30+01:00 Xuan Son Nguyen llama : add missing LLAMA_API for llama_chat_builtin_templates (#10636)
70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e 2024-12-03T11:20:00+02:00 Georgi Gerganov server : fix default draft model parameters (#10586)
642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e 8648c521010620c2daccfa1d26015c668ba2c717 2024-12-02T22:10:19+01:00 Xuan Son Nguyen llama : add enum for built-in chat templates (#10623)
64ed2091b24b2f9747148fdf49a34ed5938762c3 991f8aabeec89d801300bb179e52013fb0eb0584 2024-12-02T21:45:54+08:00 haopeng server: Add "tokens per second" information in the backend (#10548)
86dc11c5bcf34db2749d8bd8d4fa07a542c94f84 6acce3971098772a8aacb10fe8550b4119110581 2024-12-01T12:33:12+01:00 alek3y server : bind to any port when specified (#10590)
b782e5c7d453b3f1fa8dc6c34cde7e2fa946af93 3a8e9af402f7893423bdab444aa16c5d9a2d429a 2024-11-29T21:48:56+01:00 Xuan Son Nguyen server : add more test cases (#10569)
f095a649ec390e04dfab1b04e646ae8549dafaef 678d7994f4da0af3d29046be99950ac999ee9762 2024-11-29T00:18:02-06:00 Jeff Bolz vulkan: get the first command buffer submitted sooner (#10499)
6c595676899013102fdb0aa4b06a49954300c94a 890719311b6535e572f15965c6d7ec4ac2537f60 2024-11-28T19:17:49+01:00 Xuan Son Nguyen server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568)
45abe0f74ee281aea6e5283c1e738061256cfcae 0bbd2262a3263f37385297b30de37941836e57f7 2024-11-26T16:20:18+01:00 Xuan Son Nguyen server : replace behave with pytest (#10416)
7db3846a94ce7683b3e8120abe427457edf840c9 c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2 2024-11-26T13:05:20+01:00 Diego Devesa ci : publish the docker images created during scheduled runs (#10515)
84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 811872a59daefb25fc0c4326bcb6d8ae893c2f7c 2024-11-26T13:36:40+02:00 Georgi Gerganov server : fix parallel speculative decoding (#10513)
9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 47f931c8f9a26c072d71224bc8013cc66ea9e445 2024-11-25T22:28:27+02:00 Georgi Gerganov server : add more information about error (#10455)
47f931c8f9a26c072d71224bc8013cc66ea9e445 106964e3d266740f571b5aad7b57545b4a901ac9 2024-11-25T21:50:07+02:00 Georgi Gerganov server : enable cache_prompt by default (#10501)
a9a678a6b2264e5895533217b0cf8f250534cc58 9ca2e677626fce759d5d95c407c03677b9c87a26 2024-11-25T08:11:55-08:00 brucepro Add download chat feature to server chat (#10481)
9ca2e677626fce759d5d95c407c03677b9c87a26 5931c1f233c616083d64e41a228249d58e039aa5 2024-11-25T16:31:38+02:00 Georgi Gerganov server : add speculative decoding support (#10455)
5a8987793f3e7c1fbfa6806bfcd17d578071b6c9 d9d54e498d38ec99bbc0031022f9c92711e97bbc 2024-11-25T17:31:10+08:00 Neo Zhang Jianyu [SYCL] Fix building Win package for oneAPI 2025.0 update (#10483)
6dfcfef0787e9902df29f510b63621f60a09a50b 599b3e0cd40432cd1975a8906f3db70bbe53b627 2024-11-22T17:44:08+08:00 蕭澧邦 ci: Update oneAPI runtime dll packaging (#10428)
bcdb7a23862b61aa307fc462fadfe1e2e653d010 f245cc28d4eb900efad0bc740145f58d713c6e4f 2024-11-16T18:26:54+05:00 MaggotHATE server: (web UI) Add samplers sequence customization (#10255)
9901068ac78838745e604fffb4601d315a610456 231f9360d94446cd083b6b116f63991b1328c484 2024-11-15T05:48:49-04:00 Xuan Son Nguyen server : (web UI) add copy button for code block, fix api key (#10242)
5a54af4d4f588f109f31e456483fdf77096399d9 1607a5e5b08f4e55f118af3d7de325949d8f1835 2024-11-15T04:09:12+01:00 Romain Biessy sycl: Use syclcompat::dp4a (#10267)
fb4a0ec0833c71cff5a1a367ba375447ce6106eb 5ea926dad7f62ebccff7b24784bd1e01a06d13ae 2024-11-13T20:00:35+02:00 Michael Podvitskiy llama : propagate the results of `graph_compute` (#9525)
ff7fb670d0a62897c5662536aeb53422c549fbe8 0e712a5acbbdd1593e5aeb86d4f6b896a11b438c 2024-11-13T11:16:30Z Alexey Parfenov server : add missing docs (#10269)
0e712a5acbbdd1593e5aeb86d4f6b896a11b438c a0ec17b32ec6077f5ca22fe833ebdc9b86795a4d 2024-11-13T19:15:23+08:00 Jhen-Jie Hong server : fix incorrect res in validate_model_chat_template (#10272)
b141e5f6efbab3a00633df88c4f9425bfe8b78ab 4b3a9212b602be3d4e2e3ca26efd796cef13c55e 2024-11-11T08:38:43+02:00 Georgi Gerganov server : enable KV cache defrag by default (#10233)
505f33274d60676320216b662a97672a76ec600e 160687b3ed002eee83a04de83a9cd752f928ced1 2024-11-11T00:42:25+05:00 MaggotHATE server : (web UI) Add back sampler settings (#10239)
76c6e7f10551960e4ec9e14e0535b72081f1c7ad a71d81cf8c1afb26b166f897c94ee1581f9fac7d 2024-11-07T18:44:38-04:00 Xuan Son Nguyen server : minor UI fix (#10207)
a71d81cf8c1afb26b166f897c94ee1581f9fac7d eec4d71737b32f312e0082b671629a0368e1a20d 2024-11-07T17:31:10-04:00 Xuan Son Nguyen server : revamp chat UI with vuejs and daisyui (#10175)
b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 2024-11-06T13:29:01+02:00 Georgi Gerganov server : remove hack for extra parallel slot (#10187)
9e0ecfb697d297355e43c20559d29bcc71beb0c3 6a066b9978533e2ab9890b7f4f8c0262d91798b3 2024-11-04T16:33:29+01:00 Xuan Son Nguyen server : clarify /slots endpoint, add is_processing (#10162)
42cadc74bda60afafb45b71b1a39d150ede0ed4d 45950415ed985830c59bf42cf9c9216b20cf08ef 2024-11-02T16:34:56Z sasha0552 server : fix slot selection by lru (#10126)
45950415ed985830c59bf42cf9c9216b20cf08ef 1926d6e39d6f6358bc1a4c52316a560178be7233 2024-11-02T18:34:00+02:00 Georgi Gerganov server : fix endpoint checks (#10135)
d865d1478cd4e403f82d793c2afcd0f943412f05 1804adb0cfee4811eaf633741503d683a46e4c77 2024-11-01T13:33:14Z sasha0552 server : fix smart selection of available slot (#10120)
e597e50794f07ec8dc24b9efb18f94ec6386fda0 85679d37f34f66783cc04664a06c405b28e8e035 2024-11-01T11:09:59+08:00 Zhenwei Jin build: fix build error in Windows env with OneAPI setup (#10107)
0a683e8088d849626e7471f9e2ed381f7dbdf2e9 dea5e86051aadcdf42f7db7a8855a78d8f5ff3d6 2024-10-31T06:02:35-07:00 Kevin Gibbons server : include scheme when printing URL (#10106)
8125e6cbfcf2b3b9066e4d923aca9295526730f5 8841ce3f439de6e770f70319b7e08b6613197ea7 2024-10-28T08:49:32+02:00 Georgi Gerganov server : don't overfill the batch during infill (#10018)
bc5ba007b2c83ac95875e68724dabfc12159fc61 958367bf530d943a902afa1ce1c342476098576b 2024-10-25T10:13:46+03:00 Georgi Gerganov server : check that the prompt fits in the slot's context (#10030)
958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023)
0a1c750c80147687df267114c81956757cc14382 190a37d7977eb5bd6a729299bd1e371208c87149 2024-10-23T13:27:51-06:00 wwoodsTM server : samplers accept the prompt correctly (#10019)
6b8447352df3d662b56280c8fc38d7f092885787 674804a99617b4f90292b4080ecab450ea3d30ba 2024-10-22T16:16:01+08:00 leo-pony [CANN] Adapt to dynamically loadable backends mechanism (#9970)
afd9909a6481402844aecefa8a8908afdd7f52f1 87421a23e8c60e00a7b227d501e8aab2a1aff7ce 2024-10-18T14:33:58+03:00 Radoslav Gerganov rpc : backend refactoring (#9912)
87421a23e8c60e00a7b227d501e8aab2a1aff7ce 60ce97c9d809f4b040e90b597468b839df5728d0 2024-10-18T06:46:16+01:00 Ouadie EL FAROUKI [SYCL] Add SYCL Backend registry, device and Event Interfaces (#9705)
60ce97c9d809f4b040e90b597468b839df5728d0 8901755ba328643c9ab071c20e1939ea52951a0e 2024-10-18T13:34:36+08:00 Ma Mingfei add amx kernel for gemm (#8998)
8901755ba328643c9ab071c20e1939ea52951a0e 6f55bccbb8835d42147add4ee48807450f5ff535 2024-10-18T07:32:19+03:00 Georgi Gerganov server : add n_indent parameter for line indentation requirement (#9929)
1f66b699c48cb5ab3265ed72c48e8549b1674291 0e41b300ed28f7fe185d938b2e3d56a0bf7411ed 2024-10-16T08:35:53Z Alexey Parfenov server : fix the disappearance of the end of the text (#9867)
223c25a72fcc3f65cdfd7f5d57edd5b44b550e18 fbc98b748e7b075e327bcf13237057f647678049 2024-10-15T16:28:55+03:00 Georgi Gerganov server : improve infill context reuse (#9894)
fbc98b748e7b075e327bcf13237057f647678049 dcdd535302fc9702a4709be25f56540d65163a44 2024-10-15T15:54:55+05:00 MaggotHATE sampling : add XTC sampler (#9742)
dcdd535302fc9702a4709be25f56540d65163a44 4c42f93b22146c83b763d8cbee5fafc512746649 2024-10-15T12:48:44+03:00 Georgi Gerganov server : update preact (#9895)
a89f75e1b7b90cb2d4d4c52ca53ef9e9b466aa45 13dca2a54a394757d56fdd652b9f0df08f44ea22 2024-10-14T15:04:36+08:00 VoidIsVoid server : handle "logprobs" field with false value (#9871)
d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4 c7181bd294757dd80a7904e3dd0fea2d0be914e7 2024-10-13T21:31:35+03:00 Georgi Gerganov server : accept extra_context for the infill endpoint (#9874)
c7181bd294757dd80a7904e3dd0fea2d0be914e7 92be9f12164f18ce845a5bab60cefa5f7fec6836 2024-10-13T18:52:48+03:00 Georgi Gerganov server : reuse cached context chunks (#9866)
edc265661cd707327297b6ec4d83423c43cb50a5 1bde94dd024b632f98428f4bf2ce483295130779 2024-10-12T16:14:27+03:00 Georgi Gerganov server : add option to time limit the generation phase (#9865)
1bde94dd024b632f98428f4bf2ce483295130779 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 2024-10-12T16:06:31+03:00 Georgi Gerganov server : remove self-extend features (#9860)
95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 11ac9800aff532715a5bc7991062c68ba3472e6e 2024-10-12T14:51:54+03:00 Georgi Gerganov server : remove legacy system_prompt feature (#9857)
11ac9800aff532715a5bc7991062c68ba3472e6e 943d20b4111c746bcd9dbc7e4771de313b08b50c 2024-10-12T08:21:51+03:00 Georgi Gerganov llama : improve infill support and special token detection (#9798)
0e9f760eb12546704ef8fa72577bc1a3ffe1bc04 cf8e0a3bb9c0e93e371773b282054cdbbb231038 2024-10-10T20:14:55+02:00 Diego Devesa rpc : add backend registry / device interfaces (#9812)
458367a90606448a9c0262b276947c9e536086e0 fa42aa6d8902cc4eaf31866b3b3b7b61b69da930 2024-10-08T13:27:04+02:00 Xuan Son Nguyen server : better security control for public deployments (#9776)
7254cdf7e8d6312840509ca8d766358c687c6266 cad341d88924788b940997c55e7bef000c99e784 2024-09-29T23:18:02+02:00 Johannes Gäßler ggml: fix gradient allocation logic (ggml/966)
f4d2b8846a6b34419ff9e9491aee6cd95e444bfc 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 2024-09-28T17:42:03+03:00 Georgi Gerganov llama : add reranking support (#9510)
1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 739842703e32cd43443c45e0b4f6647cc4e6b3d6 2024-09-28T14:32:46+02:00 slaren test-backend-ops : use flops for some performance tests (#9657)
95bc82fbc0df6d48cf66c857a4dda3d044f45ca2 7691654c68aa5316108f881136c59f815ccb6809 2024-09-26T17:38:31+08:00 Neo Zhang Jianyu [SYCL] add missed dll file in package (#9577)
afbbfaa537a96f562c34df4542930fa951b40d9e 3d6bf6919f7b10726421779cd344f2da05421c68 2024-09-25T14:05:13+02:00 Xuan Son Nguyen server : add more env vars, improve gen-docs (#9635)
3d6bf6919f7b10726421779cd344f2da05421c68 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 2024-09-25T01:06:52-06:00 Gabe Goodhart llama : add IBM Granite MoE architecture (#9438)
0aa15011e315659640504731d1d05663837130fa b0f27361f3539a81d983a8b045f3c61e682d9fc0 2024-09-23T23:04:39-07:00 StrangeBytesDev server : add newline after chat example (#9616)
0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 f0c7b5edf82aa200656fd88c11ae3a805d7130bf 2024-09-23T22:23:54+02:00 Xuan Son Nguyen server : add --no-context-shift option (#9607)
f0c7b5edf82aa200656fd88c11ae3a805d7130bf 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 2024-09-23T11:42:43-07:00 Max Krasnyansky threads: improve ggml_barrier scaling with large number of threads (#9598)
6026da52d6942b253df835070619775d849d0258 eca0fab44eb449ed34e17a9b651ae7398b494117 2024-09-19T12:44:53+03:00 Georgi Gerganov server : clean-up completed tasks from waiting list (#9531)
8a308354f6520df6bea851b435bd8054ee5617b4 f799155ab8279cfa668086ce584aa52ecc05f5e5 2024-09-18T01:50:34-05:00 Vinesh Janarthanan server : match OAI structured output response (#9527)
f799155ab8279cfa668086ce584aa52ecc05f5e5 faf67b3de4688f47c3b1019c89df255df2fd59b4 2024-09-18T14:28:20+08:00 Eric Zhang server : fix OpenSSL build (remove obsolete `LOG_INFO`) (#9529)
8b836ae731bbb2c5640bc47df5b0a78ffcb129cb 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 2024-09-17T09:35:38-04:00 Bert Wagner arg : add env variable for parallel (#9513)
0226613853133c081b55bb892a41bb5eacc0bc94 503147a9f9d195d6a14e7c998df23b6eb61f2bae 2024-09-17T01:19:46-07:00 Max Krasnyansky threadpool : skip polling for unused threads (#9461)
441b72b91f818fe69497e5816f87969e90c73c43 c4965a64f72ac9434c21cf0e1c3421d13e889155 2024-09-16T01:20:01-05:00 Vinesh Janarthanan main : option to disable context shift (#9484)
dcdcee3a744f39714503ee2b19c49b7c7b6209c9 1f4111e540bacec8d00ca9fd96417bf4c1339394 2024-09-14T17:36:44+08:00 VoidIsVoid server: add data: [DONE] to /chat/completions stream response (#9459)
feff4aa8461da7c432d144c11da4802e41fef3cf 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 2024-09-13T14:23:11+02:00 Xuan Son Nguyen server : add loading html page while model is loading (#9468)
0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 bd35cb0ae357185c173345f10dc89a4ff925fc25 2024-09-13T09:53:38+03:00 Georgi Gerganov llama : llama_perf + option to disable timings during decode (#9355)
78203641fee3b1f82abaff0c7f667e1b4a286390 e6b7801bd189d102d901d3e72035611a25456ef1 2024-09-12T22:30:11+02:00 Mathijs Henquet server : Add option to return token pieces in /tokenize endpoint (#9108)
8d300bd35fbe23b35a4e1ece0cf0fe8f43331029 49006c67b4c6cc2e7c75a875b4d6e161ebae287c 2024-09-10T22:40:59+02:00 matteo enable --special arg for llama-server (#9419)
bfe76d4a17228bfd1565761f203123bc4914771b 293bebe0773c907c0c866213856eeba41b035df1 2024-09-09T23:36:09+02:00 Xuan Son Nguyen common : move arg parser code to `arg.cpp` (#9388)
1b9ae5189cd279c6b45e36d43e4f9ccae628d02f e32d0816edfd247784f6780b0bb9ae0bceef5e47 2024-09-07T20:43:51+02:00 Xuan Son Nguyen common : refactor arg parser (#9308)
df270ef74596da8f1178f08991f4c51f18c9ee82 947538acb8617756a092042ff7e58db18dde05ec 2024-09-07T15:16:19+03:00 Georgi Gerganov llama : refactor sampling v2 (#9294)
9b2c24c0993487d3b34a873980e292da571481f3 134bc38ecf3e2c5460581badce289a1ffa680453 2024-09-06T23:21:29+02:00 Xuan Son Nguyen server : simplify state machine for slot (#9283)
4a1411b4f17b6569dc0a067e5914dcc0f738b370 8ebe8ddebd68526757c631cd019de009697c63c2 2024-09-06T14:06:04+02:00 Xuan Son Nguyen server : fix missing lock (#9334)
9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
32b2ec88bc44b086f3807c739daf28a1613abde1 1031771faaba28d07b4ec6a812cb21532efc8c31 2024-09-06T06:34:36+08:00 awatuna Update build.yml (#9184)
82e3b03c11826d20a24ab66d60f4de58f48ddcdb 9379d3cc1718e9ec6ab5ffcb60a06bbe048a61ee 2024-09-04T11:08:32+03:00 Radoslav Gerganov rpc : make RPC servers come first in the device list (#9296)
b69a480af4db8ffd6cbb2efe7ed8132bc7d39073 48baa61eccdca9205daf8d620ba28055c2347b64 2024-09-03T10:00:36+03:00 Georgi Gerganov readme : refactor API section + remove old hot topics
48baa61eccdca9205daf8d620ba28055c2347b64 f1485161e58d562099dd050f8ac3a9ea9f4cd765 2024-09-02T22:08:38+02:00 Xuan Son Nguyen server : test script : add timeout for all requests (#9282)
6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
42c76d1358021ccdbe8ba89109c143dd7ae166df 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 2024-08-29T19:20:53-04:00 Faisal Zaghloul Threadpool: take 2 (#8672)
9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 2024-08-27T18:28:06+08:00 Jan Boon server : fix crash when error handler dumps invalid utf-8 json (#9195)
a77feb5d71831c61e455541e8a655b9f0337ea8c 2e59d61c1b321431c597c1f12249273427d5640d 2024-08-27T11:07:01+02:00 Xuan Son Nguyen server : add some missing env variables (#9116)
e5edb210cd361689da41f032f1b36c45ff1bf9be 0c41e03ceba1aafaf469476a56347419d5785376 2024-08-26T12:16:57+03:00 Georgi Gerganov server : update deps (#9183)
a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526)
fc54ef0d1c138133a01933296d50a36a1ab64735 b40eb84895bf723c7b327a1e3bf6e0e2c41877f8 2024-08-21T11:04:34+02:00 Xuan Son Nguyen server : support reading arguments from environment variables (#9105)
18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 554b049068de24201d19dde2fa83e35389d4585d 2024-08-19T10:10:21+03:00 Radoslav Gerganov rpc : prevent crashes on invalid input (#9040)
8b3befc0e2ed8fb18b903735831496b8b0c80949 d565bb2fd5a2a58b9924a7a34e77a87c78c52137 2024-08-16T17:19:05+02:00 Xuan Son Nguyen server : refactor middleware and /health endpoint (#9056)
d565bb2fd5a2a58b9924a7a34e77a87c78c52137 ee2984bdaf10c14d440ad873a049bcc09b786d9b 2024-08-16T21:34:41+08:00 tc-mb llava : support MiniCPM-V-2.6 (#8967)
37501d9c79ed5897db4b73ea7502211d25b3f763 4af8420afba39de4968adf2695ce12fd42422a13 2024-08-15T15:28:05+08:00 Riceball LEE server : fix duplicated n_predict key in the generation_settings (#8994)
234b30676a97ce227b604c38beb9dcaca406dea9 5fd89a70ead34d1a17015ddecad05aaa2490ca46 2024-08-15T08:21:57+02:00 Jiří Podivín server : init stop and error fields of the result struct (#9026)
98a532d474c73d3494a5353024cb6a4fbbabbb35 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 2024-08-14T02:51:02-04:00 compilade server : fix segfault on long system prompt (#8987)
5ef07e25ac39e62297a67208c5bcced50835a2dd 4134999e01f31256b15342b41c4de9e2477c4a6c 2024-08-12T10:21:50+03:00 Georgi Gerganov server : handle models with missing EOS token (#8997)
7c3f55c10051c634546247387c5c359c9d499360 911b437f228e75aa3d235acec21bfddd23ecce2f 2024-08-10T11:43:26+02:00 fairydreaming Add support for encoder-only T5 models (#8900)
3071c0a5f218f107dabd13b73f6090af683ef5ec 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 2024-08-09T18:33:53+08:00 tc-mb llava : support MiniCPM-V-2.5 (#7599)
daef3ab233fc02e4c53afd9b07366379876f00d1 345a686d8271a24db20d31789c0d4b9ed51dcb0c 2024-08-09T08:32:02+02:00 Mathieu Geli server : add one level list nesting for embeddings (#8936)
1e6f6554aa11fa10160a5fda689e736c3c34169f 641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5 2024-08-06T17:33:39+02:00 Xuan Son Nguyen server : add lora hotswap endpoint (WIP) (#8857)
a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904)
978ba3d83d17b10fdf9807006048432b5b3769fc ecf6b7f23e664afd7ff856ec39034240ce438daa 2024-08-04T18:16:23Z ardfork Server: Don't ignore llama.cpp params (#8754)
ecf6b7f23e664afd7ff856ec39034240ce438daa 01aae2b4975b57a265ce8194928fd87f2d71027e 2024-08-04T03:55:03-07:00 Brian Cunnie batched-bench : handle empty `-npl` (#8839)
afbbcf3c04e3c6420cad3d72571478cd62ac176c ed9d2854c9de4ae1f448334294e61167b04bec2a 2024-07-31T18:59:09-05:00 Igor Okulist server : update llama-server embedding flag documentation (#8779)
01aec4a6310ab0160483196db0e726d78d4c94b6 41cd47caab88c442edc50e90c8d8d0ac3e82768d 2024-07-25T18:10:16-04:00 Yaiko server : add Speech Recognition & Synthesis to UI (#8679)
4b0eff3df58d8d86e47348fb73d54da3194d416d 8a4bad50a8ed24ed1e9df003521468dcc37320e8 2024-07-25T13:43:27+05:30 Ujjawal Panchal docs : Quantum -> Quantized (#8666)
b841d0740855c5af1344a81f261139a45a2b39ee 64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e 2024-07-23T17:37:42+03:00 Vali Malinoiu server : fix URL.parse in the UI (#8646)
938943cdbf4dd79005a394d732bc226f9e34e0ff 751fcfc6c33ea5f43cadd4d976f8fb176871df5e 2024-07-23T13:10:17+03:00 Georgi Gerganov llama : move vocab, grammar and sampling into separate files (#8508)
566daa5a5b38018b2727950bbd280239adb981b6 6f11a83e4e7700fdf353ed4a29599cb662c792f6 2024-07-22T15:44:53+02:00 Jiří Podivín *.py: Stylistic adjustments for python (#8233)
628154492a0b2dcc954a3af99e5c267097568eae 04bab6b7da0ed2b0a57174a57784d602aabb6c10 2024-07-22T16:02:09+08:00 Jan Boon server : update doc to clarify n_keep when there is bos token (#8619)
69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 07283b1a90e1320aae4762c7e03c879043910252 2024-07-20T22:25:26+02:00 Johannes Gäßler CUDA: MMQ code deduplication + iquant support (#8495)
be0cfb41752551a4680ee7dfd29f2a05b50db442 b57eb9ca4fb79f3163c6a69e154ff76157a4f716 2024-07-19T14:34:55+03:00 Georgi Gerganov readme : fix server badge
0d2c7321e9678e91b760ebe57f0d063856bb018b 672a6f101839a150180fc28891ebed379c8f2353 2024-07-18T18:43:49+08:00 Eric Zhang server: use relative routes for static files in new UI (#8552)
3807c3de04cde853418033c95e96642876545f3e e02b597be3702174e7b47b44cd03e1da1553284b 2024-07-18T16:06:22+08:00 RunningLeon server : respect `--special` cli arg (#8553)
f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 9104bc20edf47f74dc49379b7d61d0c6e85a4882 2024-07-15T08:04:56-04:00 M-A server: update README.md with llama-server --help output [no ci] (#8472)
4e24cffd8cccd653634e24ee461c252bd77b1426 6af51c0d96e6268769fc05c98d5b1a5e832c0017 2024-07-12T14:48:15+03:00 Georgi Gerganov server : handle content array in chat API (#8449)
c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420)
278d0e18469aacf505be18ce790a63c7cc31be26 dd07a123b79f9bd9e8a4ba0447427b3083e9347a 2024-07-10T20:08:17-04:00 Clint Herron Initialize default slot sampling parameters from the global context. (#8418)
dd07a123b79f9bd9e8a4ba0447427b3083e9347a f4444d992c16b6b9442f4770c7c3a10b19a08343 2024-07-10T12:35:18-04:00 Clint Herron Name Migration: Build the deprecation-warning 'main' binary every time (#8404)
0f1a39f3439825acf7e3a1663566d410be152170 83321c6958acf20747d288031174cc1bf8816e33 2024-07-10T07:14:51-05:00 Dibakar Gope ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780)
a59f8fdc85e1119d470d8766e29617962549d993 fd560fe680c72fd0a0af2bc8881add20ad919071 2024-07-09T18:26:40-04:00 Clint Herron Server: Enable setting default sampling parameters via command-line (#8402)
3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d a8db2a9ce64cd4417f6a312ab61858f17f0f8584 2024-07-07T15:04:39-04:00 compilade py : type-check all Python scripts with Pyright (#8341)
cb4d86c4d723af87d3d7e3177e9485f200391384 86e7299ef5dff0f388922dc6fcbce009e99d8005 2024-07-07T11:10:38+02:00 Bjarke Viksøe server: Retrieve prompt template in /props (#8337)
807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763)
a95631ee97bb24861af6bdeec380270459631e8e f3f65429c44bb195a9195bfdc19a30a79709db7b 2024-06-26T19:26:13+03:00 Georgi Gerganov readme : update API notes
f3f65429c44bb195a9195bfdc19a30a79709db7b 88540445615e77a0177fcca43aaa8e9d8eea6864 2024-06-26T18:33:02+03:00 Georgi Gerganov llama : reorganize source code + improve CMake (#8006)
6777c544bdd8c5d9de3220d6e2557957bbbf2a4f 163d50adaf8897d8b734d701ff332de6be63d484 2024-06-26T01:45:58+01:00 Olivier Chafik `json`: fix additionalProperties, allow space after enum/const (#7840)
dd047b476c8b904e0c25e5dbc5bee6ffde2f6e17 925c30956dd17723c3a25297bcd0a609aec60663 2024-06-25T19:20:06+02:00 slaren disable docker CI on pull requests (#8110)
925c30956dd17723c3a25297bcd0a609aec60663 c8ad35955ad2c68db172dcd0e857423ab128518d 2024-06-25T08:13:27-07:00 joecryptotoo Add healthchecks to llama-server containers (#8081)
48e6b92cc378c937e59719f2c0f482bf76c9ca81 3791ad219323389106dc3fd80814eb5bbb7b80de 2024-06-25T13:56:49+02:00 Xuan Son Nguyen Add chat template support for llama-cli (#8068)
3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950)
6a2f298bd784403c5c33eebb822217ec5d9b5590 11318d9aa1f668aa10407a5cb9614371af32f3ce 2024-06-23T18:03:08+03:00 Aarni Koskela server : fix JSON-Scheme typo (#7975)
b6b9a8e606da7764bd3649c2ea574979c85abd43 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc 2024-06-23T13:14:45+02:00 slaren fix CI failures (#8066)
ba5899315283eb1df3902363daf79bdc5eefe426 a7854743c5e6216a6178824a603aa9479728ddd5 2024-06-19T23:57:10Z sasha0552 server : fix smart slot selection (#8020)
e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084 a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f 2024-06-18T09:37:20+03:00 Georgi Gerganov whisper : use ggml_backend_sched (whisper/2239)
1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 963552903f51043ee947a8deeaaa7ec00bc3f1a4 2024-06-13T00:41:52+01:00 Olivier Chafik `build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809)
704a35b183748954013bd875bbbfdd9eaca14e62 dcf752707d96eb305f546526c7bc5d01f0831130 2024-06-12T14:42:29+03:00 Georgi Gerganov server : restore numeric prompts (#7883)
dcf752707d96eb305f546526c7bc5d01f0831130 f2b5764beb35583295e2475479c18f249b139b58 2024-06-12T17:05:35+08:00 Meng, Hengyu update intel docker oneapi-basekit to 2024.1.1-devel-ubuntu22.04 (#7894)
14f83526cd27f638c856ea6eff08110b9860eb2a 6fe42d073f0554eada93ac9d40574025aeedb703 2024-06-11T12:18:58-04:00 Deven Mistry fix broken link in pr template (#7880) [no ci]
fd5ea0f897ecb3659d6c269ef6f3d833e865ead7 c28a83902cf6ab6a9e085ad6d4cc2e95c4ccfe40 2024-06-10T14:18:41+02:00 slaren ci : try win-2019 on server windows test (#7854)
d9da0e4986f121c727bdd9579a6688097b11602c 1f0dabda8d5c131f9d4632aa41de74317cdd61fb 2024-06-10T14:59:55+03:00 Georgi Gerganov server : improve "prompt" handling (#7847)
57bf62ce7cb75cca589943e2050d29bff4026e76 3e2ee443159724e2d3a0741f6b167e599ec088aa 2024-06-09T11:24:29-04:00 Nicolás Pérez docs: Added initial PR template with directions for doc only changes and squash merges [no ci] (#7700)
3e2ee443159724e2d3a0741f6b167e599ec088aa 42b53d192f4e3abf1b7c8e424628424504ea5dc5 2024-06-09T12:50:35+02:00 mgroeber9110 server: do not remove whitespace at the start of a completion chunk (#7830)
fe1e3917cfa0f9397a765cfd0aef880674d938d5 d4d915d351d1f1270d56184bdd46672893e8a5d8 2024-06-09T01:43:39+02:00 slaren Revert "[SYCL] Update rpc-server.cpp to include SYCL backend (#7682)" (#7808)
7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f da799b41891e34aac86ce4e173f9c4c0afd4fab3 2024-06-08T07:50:31Z sasha0552 server : smart slot selection using Longest Common Prefix (#7728)
7027b27d765db95d4ac6b569d976e387a8715881 a5cabd76491f07494c5b8267f921c73f5e2bbfb4 2024-06-07T11:15:49+02:00 Johannes Gäßler server: update cache_prompt documentation [no ci] (#7745)
a5cabd76491f07494c5b8267f921c73f5e2bbfb4 d5c938cd7716b9a2ace49a43a469dfbffcff4d28 2024-06-07T15:09:45+08:00 woodx server : do not get prompt in infill mode (#7286)
ee459f40f65810a810151b24eba5b8bd174ceffe f83351f9a62a6262f1fc3d08f320033089cddfb5 2024-06-06T19:19:59+03:00 Georgi Gerganov server : fix --threads-http arg (#7801)
55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f 2024-06-06T10:07:06+01:00 Olivier Chafik grammars: x{min,max} repetition operator (#6640)
2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f d67caea0d6e6c303d31b01d0a010973e6c908dff 2024-06-06T07:19:49+02:00 slaren docker : build only main and server in their images (#7782)
1442677f92e45a475be7b4d056e3633d1d6f813b 554c247caffed64465f372661f2826640cb10430 2024-06-04T21:23:39+03:00 Georgi Gerganov common : refactor cli arg parsing (#7675)
6d1616944d9efd342ed2a4fd318722adfc9febcd bde7cd3cd949c1a85d3a199498ac98e78039d46f 2024-06-04T10:01:09+03:00 Georgi Gerganov ggml : prevent builds with -ffinite-math-only (#7726)
bde7cd3cd949c1a85d3a199498ac98e78039d46f a5735e4426b19a3ebd0c653ad8ac01420458ee95 2024-06-03T20:03:26+03:00 Radoslav Gerganov llama : offload to RPC in addition to other backends (#7640)
a5735e4426b19a3ebd0c653ad8ac01420458ee95 0b832d53ba0ffcc759c8d62ede3772dd62321f8e 2024-06-04T00:14:15+09:00 Masaya, Kato ggml : use OpenMP as a thread pool (#7606)
7c4e5b7eae26581869e782015d9deca947c34997 9422c5e34bbd302493b77a8f6d546154a1f4fe82 2024-06-02T13:39:08-04:00 Austin chore : add ignore rule for generated server themes (#7689)
9422c5e34bbd302493b77a8f6d546154a1f4fe82 e141ce624af57bdffbaf57014a044eb1d9689230 2024-06-02T19:13:54+10:00 nickp27 [SYCL] Update rpc-server.cpp to include SYCL backend (#7682)
2e666832e6ac78194edf030bd1c295e21bdb022c 2ac95c9d5678d05e253691fb1f26471675bff5ad 2024-06-01T21:31:48+02:00 Yazan Agha-Schrader server : new UI (#7633)
2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
a323ec60af14a33d560df98f2cc41b4112cb4f80 0515ad93f48df63bbff204eddb0cac75e8585c65 2024-05-31T22:23:04+03:00 Georgi Gerganov server : update js (#7670)
972b555ab935705f3437abd5909a5c46852811f6 3854c9d07f67de7f8cd6d86117bfaef47549b05a 2024-05-30T09:52:39+02:00 Johannes Gäßler README: explain parallel build [no ci] (#7618)
3854c9d07f67de7f8cd6d86117bfaef47549b05a eb57fee51f7b4d78039f003249873c2eb46f12f6 2024-05-30T14:19:08+08:00 Meng, Hengyu [SYCL] fix intel docker (#7630)
e2b065071c5fc8ac5697d12ca343551faee465cc 0548a4187f2e53b8fc6d9ff0f4c71988f708ff42 2024-05-28T17:53:37+08:00 Neo Zhang [SYCL]fix ggml_sycl_mul_mat_id() to match the change of api (#7436)
9335b969e86a222e247adacedf814d8abfff8847 c41767154eb82aa3fe7568fc816c3402b78eae94 2024-05-28T06:55:51+02:00 mgroeber9110 server: do not remove whitespace at the start of a completion chunk (#7524)
b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
27891f6db03de6e3fd5941983838c29bef253352 fbca2f27fc7fa9aa4a8ad0357478fdb908472908 2024-05-24T23:47:56+10:00 Brian docker.yml: disable light-intel and server-intel test (#7515)
fbca2f27fc7fa9aa4a8ad0357478fdb908472908 0df0aa8e43c3378975269a51f9b876c8692e70da 2024-05-24T14:31:13+02:00 fairydreaming Add support for ArcticForCausalLM (#7020)
3015851c5ac7334fb544a23a70a284c117b87044 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 2024-05-23T14:29:26+02:00 Daniel Bevenius llama : add getters for n_threads/n_threads_batch (#7464)
1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
201cc11afa0a1950e1f632390b2ac6c937a0d8f0 6369bf04336ab60e5c892dd77a3246df91015147 2024-05-22T04:28:32+08:00 liuwei-git llama : add phi3 128K model support (#7225)
d7e852c1bc8e85bf62a6f1aede08cd2de723404a 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 2024-05-21T14:39:48+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425)
917dc8cfa67a72fb7c8bf7392270da3bf4833af4 fabf30b4c4fca32e116009527180c252919ca922 2024-05-20T20:15:57+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (#7375)
3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb 2024-05-20T15:10:03+03:00 Georgi Gerganov server : fix temperature + disable some tests (#7409)
1cc0155d04918cb3017afa472acea51b77483c4a e932094d58f513d5996c3efc9f6fed8238894c57 2024-05-20T10:16:41+03:00 Georgi Gerganov server : tuning tests (#7388)
e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389)
1b01f06db0cff5f5f600bb754fc39fde565ed56a 41858392e17abead21735309bf17cb55183d8c31 2024-05-19T16:26:02+02:00 Johannes Gäßler server: add test for token probs (#7347)
41858392e17abead21735309bf17cb55183d8c31 6aade19ee74b896c59929676629340b36be3e22c 2024-05-19T16:06:33+02:00 Johannes Gäßler server: fix seed being reported back (#7382)
cb42c294279bc4a0a4e926a7b5a5568049f12fa7 d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc 2024-05-18T11:10:47+02:00 Johannes Gäßler server: correct --threads documentation [no ci] (#7362)
f4bd8b3d260bb09491ba63c77ab7012b744362ef 51e9d02599336e62948d29f1d6c05addeb921ac2 2024-05-17T17:25:44+03:00 Radoslav Gerganov rpc : set SO_REUSEADDR for the server socket (#7320)
d273c1402b25086fd91aef2467ac13f2e49fa0ea 27b040691cbe45314147c2745e891a38e9c048d4 2024-05-17T15:11:45+03:00 Aarni Koskela py : convert-hf-to-gguf-update improvements (#7340)
27b040691cbe45314147c2745e891a38e9c048d4 29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba 2024-05-17T13:24:38+02:00 fairydreaming llama : use n_embd_head_v when reshaping kqv (#7327)
ee94172d33399d2e814ca05c8a3ff8c523ebb093 934266c0e0b2aa9781fdba2deb112c161ff038a9 2024-05-17T10:00:17+03:00 Radoslav Gerganov server : add support for the RPC backend (#7305)
9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642 24ecb58168dce81646c2ed425690a106591c8c6d 2024-05-17T02:11:03+02:00 Leon Knauer [Server] Added --verbose option to README [no ci] (#7335)
24ecb58168dce81646c2ed425690a106591c8c6d 9afdffe70ebf3166d429b4434783bb0b7f97bdeb 2024-05-16T20:43:45+02:00 Pierrick Hymbert Revert "server bench: fix bench not waiting for model load (#7284)" (#7334)
583fd6b000ec9ad1b465b5c98524f4a0ae388077 9f773486ab78d65f5cca3f7e31c862b7043bf721 2024-05-15T08:44:16+02:00 Johannes Gäßler server bench: fix bench not waiting for model load (#7284)
4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 1265c670fd8e41e1947352c96c5179adda97fb2c 2024-05-14T10:11:24-04:00 Steve Grubb server: free sampling contexts on exit (#7264)
5e31828d3e35c76ecfee665bc23771a4bec1d130 541600201e6480f54ae09e58d16b154d4b4b331d 2024-05-14T14:27:19+03:00 Radoslav Gerganov ggml : add RPC backend (#6829)
541600201e6480f54ae09e58d16b154d4b4b331d efc8f767c8c8c749a245dd96ad4e2f37c164b54c 2024-05-14T09:33:42+02:00 slaren llama : disable pipeline parallelism with nkvo (#7265)
e586ee42595500c53938e937b6b6ad5353ad76dc cbf75894d256f1861f6409565db599365de3d4b8 2024-05-12T19:40:08-07:00 Benjamin Findley change default temperature of OAI compat API from 0 to 1 (#7226)
cbf75894d256f1861f6409565db599365de3d4b8 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 2024-05-13T08:04:29+08:00 Neo Zhang [SYCL] Add oneapi runtime dll files to win release package (#7241)
0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 dc685be46622a8fabfd57cfa804237c8f15679b8 2024-05-13T08:02:55+08:00 Neo Zhang [SYCL] update CI with oneapi 2024.1 (#7235)
988631335a20d06497f58be0b8ba13adb4323a22 f99e1e456eaf69cc38c1982a2693ce41c0f897ef 2024-05-11T04:13:02-04:00 Steve Grubb server : free llama_batch on exit (#7212)
5ae3426b0b64672991563d4c28b2018b9f961467 b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 2024-05-11T10:11:28+02:00 Johannes Gäßler server: fix reported top tokens for temperature 0 (#7203)
4e3880978f8b1bf546dd4e6f3b524d6b8739c49c f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 2024-05-10T07:01:08-04:00 Justine Tunney Fix memory bug in grammar parser (#7194)
d46dbc76f8770caec0175f1e57777173c70556a0 0961d866044143eefec5b525e991611f73fd4f6e 2024-05-09T16:40:42+03:00 Georgi Gerganov readme : add scheduled server workflow status badge
47345248827f426038098d016ed11975021b4919 07cd41d0965829463eff73eda3348aedbfd3a444 2024-05-09T17:34:37+08:00 Albert Jin opencl : alignment size converted from bits to bytes (#7090)
bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 26458af1d63c85195cd96cd1673051e332d06d30 2024-05-08T20:12:06+01:00 JohnnyB server : add themes + favicon (#6848)
911b3900dded9a1cfe0f0e41b82c7a29baf3a217 ad211edef5db1f1fb955874b7ca6a67bd0c88708 2024-05-08T14:27:58+02:00 Johan server : add_special option for tokenize endpoint (#7059)
1fd9c1741d864d01cd7ec6d67227b92d7bfabf22 4cd621c26de2095cd7c4464bdec5fe2e696ef3f3 2024-05-08T13:24:14+02:00 Xuan Son Nguyen clean up json_value & server_log (#7142)
3855416027cb25d9a708ffa5581cf503a87856a6 c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 2024-05-08T02:30:09-04:00 Justine Tunney ggml : introduce bfloat16 support (#6412)
af0a5b616359809ce886ea433acedebb39b12969 b6aa6702030320a3d5fbc2508307af0d7c947e40 2024-05-07T23:07:58+02:00 Johannes Gäßler server: fix incorrectly reported token probabilities (#7125)
260b7c65296fba0568eeb1ff05244ea0be206b54 53d6c52e227dedef347b21e28febcfb9caeecdad 2024-05-07T13:44:29-05:00 Kyle Mistele server : update readme with undocumented options (#7013)
8f8acc8683a00ce40fa5a81161a079d2167126e6 ca3632602091e959ed2ad4c09c67a7c790b10d31 2024-05-05T13:38:55+02:00 Sigbjørn Skjæret Disable benchmark on forked repo (#7034)
cf768b7e71cbcc9886c753ae963c2b68893d02e4 fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c 2024-05-04T13:10:15-03:00 Jeximo Tidy Android Instructions README.md (#7016)
03fb8a002df2e96104f9e06de9c78d2a8ed91e92 92139b90af4841d7fd060b526bdd443b621770ff 2024-05-04T12:06:40+03:00 maor-ps If first token generated from the server is the stop word the server will crash (#7038)
3ea0d36000e2314baba7e9fc6a97f08670a6f7e4 1613ef8d8eb2479ba55c4d598e08c8f3f18a0fed 2024-05-01T17:52:55+02:00 Johannes Gäßler Server: add tests for batch size, different seeds (#6950)
9c67c2773d4b706cf71d70ecf4aa180b62501960 952d03dbead16e4dbdd1d3458486340673cc2465 2024-04-30T12:16:08+03:00 Georgi Gerganov ggml : add Flash Attention (#5021)
8843a98c2ba97a25e93319a104f9ddfaf83ce4c4 b8c1476e44cc1f3a1811613f65251cf779067636 2024-04-30T00:52:50+01:00 Olivier Chafik Improve usability of --model-url & related flags (#6930)
b7368332e24c5b2c8038bf8267f43632783fcc35 928e0b7013c862cf10701957b3d654aa70f11bd8 2024-04-27T17:50:48+02:00 Pierrick Hymbert ci: server: tests python env on github container ubuntu latest / fix n_predict (#6935)
928e0b7013c862cf10701957b3d654aa70f11bd8 0c4d489e29e53589bf13a801fe7c94b7b546d8f6 2024-04-26T19:08:30+01:00 agray3 Reset schedule earlier to allow overlap with ggml graph computation on device (#6933)
0c4d489e29e53589bf13a801fe7c94b7b546d8f6 017e6999b5184234370b22a2f868e1be911e8d88 2024-04-26T20:06:33+02:00 Pierrick Hymbert quantize: add imatrix and dataset metadata in GGUF (#6658)
bbe3c6e76157a5d806fdc155451f0ca8936248ee 7f5ff558eed0f732af8f25c2ab0645610bdec80c 2024-04-26T12:27:25+02:00 Pierrick Hymbert ci: server: fix python installation (#6925)
7f5ff558eed0f732af8f25c2ab0645610bdec80c 9e4e077ec50fde6049b128662c72d37a3c28e34b 2024-04-26T12:15:30+02:00 Pierrick Hymbert server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638)
9e4e077ec50fde6049b128662c72d37a3c28e34b 83b72cb086ce46a33dececc86bfe4648b6120aa8 2024-04-26T11:11:51+02:00 Pierrick Hymbert ci: server: fix python installation (#6922)
83b72cb086ce46a33dececc86bfe4648b6120aa8 d4a9afc1009f0da88d04b2c5f672d81d5ae94675 2024-04-26T10:41:53+03:00 Georgi Gerganov Merge pull request from GHSA-p5mv-gjc5-mwqv
d4a9afc1009f0da88d04b2c5f672d81d5ae94675 7d641c26ac73956a54b204cabefe85c764823678 2024-04-26T09:27:49+02:00 Pierrick Hymbert ci: server: fix python installation (#6918)
7d641c26ac73956a54b204cabefe85c764823678 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 2024-04-26T09:26:59+02:00 Pierrick Hymbert ci: fix concurrency for pull_request_target (#6917)
5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 2024-04-26T09:26:16+02:00 Pierrick Hymbert bench: server add stop word for PHI-2 (#6916)
3fe847b5747676ee1bf90371c46ed0bc66b57240 37246b1031b1680c0dcaf20aef736d6b446203fa 2024-04-24T12:54:24+02:00 mgroeber9110 server : do not apply Markdown formatting in code sections (#6850)
37246b1031b1680c0dcaf20aef736d6b446203fa 28103f4832e301a9c84d44ff0df9d75d46ab6c76 2024-04-24T05:15:29-05:00 Kyle Mistele common : revert showing control tokens by default for server (#6860)
28103f4832e301a9c84d44ff0df9d75d46ab6c76 c0d1b3e03e27634ac2871761f5033cf9324d472d 2024-04-24T11:08:36+02:00 Johannes Gäßler Server: fix seed for multiple slots (#6835)
5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 40f74e4d739e9250431cf339ae7588b28d8d0663 2024-04-21T18:48:53+01:00 Olivier Chafik `build`: generate hex dump of server assets during build (#6661)
40f74e4d739e9250431cf339ae7588b28d8d0663 b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 2024-04-21T18:36:45+03:00 Georgi Gerganov llama : add option to render special/control tokens (#6807)
b8109bc0139f15a5b321909f47510b89dca47ffc aed82f6837a3ea515f4d50201cfc77effc7d41b4 2024-04-21T00:29:50+08:00 Jan Boon doc : server tests require llama to be built with curl enabled (#6788)
637e9a86c220718d008b54842dfd294aa96d3b7a 9958c81b798a5872087b30b360e4674871f2479e 2024-04-19T13:19:01+02:00 Pierrick Hymbert server: static: upstream upgrade (#6765)
3272896d79465fd2befef3425dac8e83933b7ea4 7fc16a2c32650d46e79b382ecc6720f58c82f31b 2024-04-15T14:18:47+02:00 Pierrick Hymbert server : revert "minor layout improvements" (#6684)
ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa fbbc030ba93561fac842af994c5c6c4c1147f13b 2024-04-12T19:43:38+01:00 Olivier Chafik JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555)
24ee66ed0d908d156bd0d1747b63a636a495cd7a 91c736015b66ba1d0b82cbae6313b6d5eaa61b68 2024-04-12T13:49:21+02:00 Pierrick Hymbert server : coherent log output for KV cache full (#6637)
cbaadc92942c50aab599a9e4c163afc1f44f7c26 1bbdaf6ecda6f0a360dfb307b256fcb6838c560b 2024-04-11T19:47:34+01:00 Olivier Chafik grammars: 1.5x faster inference w/ complex grammars (vector reserves / reuses) (#6609)
400d5d722d7edf7de0cf24a18c42b183c65047d2 5dc9dd7152dedc6046b646855585bd070c91e8c8 2024-04-09T01:31:47-07:00 Ed Lee server : detect search query to start webchat (#6554)
e3c337d87ca650972105a51c6ce302dd236c07ad beea6e1b16e783a0886e78dec01002a8c00db24d 2024-04-08T06:02:30-07:00 Rick G llama : support negative ith in llama_get_ API (#6519)
beea6e1b16e783a0886e78dec01002a8c00db24d 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 2024-04-08T20:43:30+08:00 Jan Boon llama : save and restore kv cache for single seq id (#6341)
b66aec675c1571a06b3570b858ae711246f96f84 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d 2024-04-03T22:57:20+02:00 Daniel Bevenius backend : fix typo in scheduler documentation (ggml/781)
57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d 75cd4c77292034ecec587ecb401366f57338f7c0 2024-04-06T10:31:33-04:00 Clint Herron Tests: Added integration tests for GBNF parser (#6472)
75cd4c77292034ecec587ecb401366f57338f7c0 a8bd14d55717754a1f48313a846a2b16fa998ad2 2024-04-06T05:40:47+02:00 Pierrick Hymbert ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495)
0a1d889e27d6aaa3293dd2c692b849a9bcf4b474 7dda1b727ef1730783a6077136d28b83e70dd397 2024-04-04T17:31:22+01:00 Ed Lepedus server: add cURL support to server Dockerfiles (#6474)
2e66913e5f56209f4c949f98e431925b78e7e84d 8120efee1d9931b514aeb5a047209d576f23286c 2024-04-04T11:03:00-04:00 Shakhar Dasgupta server: allow penalizing repetition of newlines on server webpage (#6431)
7a2c92637ae265654a68f62e6a7610b358255d3f 4bcd6b959ca3991084ad1d8464caf2a734e29b1d 2024-04-04T11:57:58+02:00 Pierrick Hymbert ci: bench: add more ftype, fix triggers and bot comment (#6466)
4399f13fb9462cd06f3f154d0aee738425000fea 1a43c7254ed5de91d09274b853db843c518f1b64 2024-04-04T09:34:58+03:00 Georgi Gerganov server : remove obsolete --memory-f32 option
1a43c7254ed5de91d09274b853db843c518f1b64 72d73af65132792a52433952ca4729b01c36cde2 2024-04-04T01:33:48-05:00 Xiao-Yong Jin server : add option to disable KV offload (#6468)
5fb1574c8112c757fc202fdae279da883f34e610 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 2024-04-03T13:22:57-07:00 Fattire A few small fixes to server's README docs (#6428)
60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 bb43cf7e9d86d69ffd9c7f008f75db890a35b45a 2024-04-03T20:09:52+02:00 JH23X server : handle exception on wrong type in request (#6452)
5d4f12e4624bf4435ba26753814bedd4e9b62803 154d4ee39c38e231fb5c3910df14d2fc920fdf1b 2024-04-03T18:56:37+01:00 Ed Lepedus server: add cURL support to `server.Dockerfile` (#6461)
226e819371eec0f298d9075198394a07b23ecfa9 c50a82ce0f71558cbb8e555146ba124251504b38 2024-04-01T12:36:40+02:00 Pierrick Hymbert ci: server: verify deps are coherent with the commit (#6409)
057400a3fd457f4f214684eeb171444663b47a23 b75c38166cf0c66793a32d5c3d6cb69929dd083d 2024-03-29T08:23:22+01:00 Daniel Bevenius llama : remove redundant reshape in build_kv_store (#6369)
28cb9a09c4d10a489be1238abe7a858dcd4d65f2 cfc4d75df6399b36153ef739f2c1abee4c114bb8 2024-03-28T11:27:56+01:00 Pierrick Hymbert ci: bench: fix master not schedule, fix commit status failed on external repo (#6365)
6902cb7f2e3479f364ee177118200fb7e4e9fc92 d2d8f389960a106b66313ff1621bdb1aaaaaa285 2024-03-28T16:50:48+08:00 Eric Zhang server : stop gracefully on SIGTERM (#6348)
a016026a3ac16d8c9b993a3573f19b9556d67de4 53c7ec53d5eca26b2c0c648605543a5fa6c12817 2024-03-27T20:26:49+01:00 Pierrick Hymbert server: continuous performance monitoring and PR comment (#6283)
1740d6dd4e00dedda87d6820b0e0d8e70dade340 0642b22cd12af278d6e7e459b73411947c169381 2024-03-27T08:08:59+01:00 Mateusz Charytoniuk readme : add php api bindings (#6326)
0642b22cd12af278d6e7e459b73411947c169381 a4f569e8a316cbd33d2b4de94b694d111507475a 2024-03-27T13:55:29+08:00 Eric Zhang server: public: use relative routes for static files (#6325)
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
3d032ece8e6973441273601ca2981130608e287d e190f1fca6f60d80944f9e8709d343a025c4d245 2024-03-26T16:47:43+08:00 Jan Boon server : add `n_discard` parameter (#6300)
ad3a0505e3b6cd777259ee35e61d428357ffc565 95ad616cddda50273e955bfe192328acd9aa4896 2024-03-25T09:42:17+01:00 Xuan Son Nguyen Server: clean up OAI params parsing function (#6284)
ddf65685105a39a57b1e7f80c3aa502a6313af24 d03224ac9840351023ff8abcf4aa0542258a53df 2024-03-24T12:04:25+08:00 Meng, Hengyu [SYCL] offload op (#6217)
f482bb2e4920e544651fb832f2e0bcb4d2ff69ab 1997577d5e121568ae39f538021733ccd4278c23 2024-03-23T18:07:00+01:00 Pierrick Hymbert common: llama_load_model_from_url split support (#6192)
1997577d5e121568ae39f538021733ccd4278c23 476b0251b27fb64c575507024a671e639d675594 2024-03-23T18:00:38+01:00 Pierrick Hymbert server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254)
1b26aebe4de4f048ac99996efd8a2c9af150904d 50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652 2024-03-23T13:18:45+01:00 Pierrick Hymbert server: flush stdout after logging in both text and json layout (#6253)
72114edf068a9b2f54d3b09e9a198f611be397e8 2f0e81e053b41ca28e73a841e7bdbf9820baaa57 2024-03-22T13:07:44Z Olivier Chafik json-schema-to-grammar : fix order of props + non-str const/enum (#6232)
6b8bb3a31d260a01020497c5f01025c34222fcb9 68e210b3543e0cc71268bee0920441747679ee13 2024-03-22T19:12:05+08:00 Jan Boon server : fix n_keep always showing as 0 in response (#6211)
68e210b3543e0cc71268bee0920441747679ee13 b3e94f26bab8e3b5338b5902e5af5bb01894cb4a 2024-03-22T13:08:28+02:00 Georgi Gerganov server : enable continuous batching by default (#6231)
be07a03217376c53b1d95e5f658adbbbb2831555 d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f 2024-03-22T06:41:24+08:00 Jan Boon server : update readme doc from `slot_id` to `id_slot` (#6213)
f372c49ccdc561ab96fb3c7d2b7cbc0f89a4b359 924ce1dce7fdf54894b462d03e7b608a6e574c32 2024-03-21T11:52:35-06:00 semidark Corrected typo to wrong file (#6199)
5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 1943c0198125a0da1a200390e82cf461f9080d99 2024-03-21T11:50:43Z Olivier Chafik json-schema-to-grammar improvements (+ added to server) (#5978)
91f8ad167dcd24b54615b468d9dd764ebe1d37ad 6b7e76d28cdf4361740054140708c71828453522 2024-03-20T13:30:36+01:00 Xuan Son Nguyen Server: version bump for httplib and json (#6169)
bc0baab2ea8f806961dd3fb9f534cfeb59a2e1fc d795988d9e09f75412efe2134512914c42780ad5 2024-03-20T14:14:32+02:00 Georgi Gerganov server : allow to override -ngl in tests (#6170)
47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 bd60d82d0cc8b6852ec535495a5042dbdf05de24 2024-03-20T16:32:34+05:30 Karthick Server: Handle n_keep parameter in the request (#6174)
bd60d82d0cc8b6852ec535495a5042dbdf05de24 6c0b287748327741b113d7d6018b68c63039b1c5 2024-03-20T01:33:49-04:00 Jared Van Bortel server tests : more pythonic process management; fix bare `except:` (#6146)
a56d09a4407f29c21e149b44fd5308f83aa1cb09 d84c48505f60bcd358b82a751d40418c4d235643 2024-03-16T13:20:53+01:00 Pierrick Hymbert ci : close inactive issue with workflow (#6053)
877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 12247f4c69a173b9482f68aaa174ec37fc909ccf 2024-03-15T13:43:02-07:00 Theia Vogel llama : add support for control vectors (#5970)
12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033)
4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae 2024-03-15T22:31:05+08:00 Ting Lou llava : change API to pure C style for Rust FFI bindgen (#6079)
43241adf22e8231ffaf3827d2c9310cc0ffd5ac5 a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 2024-03-14T12:15:39+01:00 Pierrick Hymbert server: disable debug release type sanitizer, simplify trigger (#6047)
76a936c8939c249a7c3e8e66dfefbab13eae194f 463628372d5fe3a0c1e5864aa5fc57deb7387039 2024-03-13T20:33:56+02:00 Georgi Gerganov readme : update API changes and hot topics
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
99b71c068f624521ad977e08e41589e2971fa1c7 306d34be7ad19e768975409fc80791a274ea0230 2024-03-13T11:39:11+01:00 Xuan Son Nguyen Server: Use multi-task for embeddings endpoint (#6001)
05b06210c954491cf0f12034b0a62bd4d69ce78b 83796e62bc9f6caae6228168e359890f51e60fee 2024-03-11T17:49:47+02:00 Georgi Gerganov llama : more consistent names of count variables (#5994)
83796e62bc9f6caae6228168e359890f51e60fee 828defefb66fc8a25404f5de845897145bf34061 2024-03-11T17:47:47+02:00 Georgi Gerganov llama : refactor unicode stuff (#5992)
828defefb66fc8a25404f5de845897145bf34061 caa106d4e05a0ab94225c220b81f9e2cd522339b 2024-03-11T14:40:42+01:00 Jakub N Update server docker image URLs (#5997)
caa106d4e05a0ab94225c220b81f9e2cd522339b 3202361c5b1ba15e695b31209567ef42c22c5c32 2024-03-11T10:56:41+01:00 Xuan Son Nguyen Server: format error to json (#5961)
332bdfd7980718abf664bfa5460f2288a3314984 ecab1c75de68de7c41c254e2ae170d3b07bee6d4 2024-03-11T17:09:32+09:00 Minsoo Cheong server : maintain chat completion id for streaming responses (#5988)
fa8a809a9119411bc9c3f00026550d0343f4d9b7 bcebd7dbf62fd7b293d5ed089023e4e733269c71 2024-03-10T18:17:47+01:00 Pierrick Hymbert server: ci: windows build and tests (#5968)
621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 2024-03-09T23:41:49+01:00 Pierrick Hymbert server: benchmark: chat/completions scenario and other llm servers comparison (#5941)
77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 d894f352bf433157232dc8dc54eacd50014e898e 2024-03-09T22:04:00+02:00 Georgi Gerganov server : print chat template info
d894f352bf433157232dc8dc54eacd50014e898e 098dbaab449f5309a54871ba7e5acef72ae696de 2024-03-09T19:55:54+01:00 slaren perplexity : support using multiple sequences to allow larger batch sizes (#5946)
58308a0ecce7cc261b802f4803c38d420063db21 5b09797321430f08caf0473143a962916ab2ea89 2024-03-09T17:34:15+02:00 Georgi Gerganov server : fix metrics init (#5964)
5b09797321430f08caf0473143a962916ab2ea89 97c09585d65a95864773b4d25d66d0f708baf38d 2024-03-09T15:53:59+02:00 Georgi Gerganov ggml : remove old quantization functions (#5942)
97c09585d65a95864773b4d25d66d0f708baf38d fb215c3832236fec7380c4fb618bd7154cb196ef 2024-03-09T15:47:47+02:00 Georgi Gerganov server : clarify some items in the readme (#5957)
fb215c3832236fec7380c4fb618bd7154cb196ef 2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89 2024-03-09T21:27:58+09:00 SeungWon Jeong server : normalize embeddings (#5956)
0db32beaf09d90b8959d3d0cc493ed1e45685353 8a3012a4ad08112bb3dc3f1399afec4e93780c44 2024-03-09T11:16:53Z Alexey Parfenov server : fix passing prompt as tokens (#5955)
9674aaf35cb81478eb38c3f3ebde713ec72fbb79 950ba1ab84db199f0bbdecdb2bb911f35261b321 2024-03-09T12:34:18+02:00 Georgi Gerganov server : simplify logic for empty prompts (#5953)
950ba1ab84db199f0bbdecdb2bb911f35261b321 e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea 2024-03-09T11:27:53+01:00 Xuan Son Nguyen Server: reorganize some http logic (#5939)
e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 2024-03-09T02:57:09-07:00 Gabe Goodhart server : add SSL support (#5926)
fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 c2101a2e909ac7c08976d414e64e96c90ee5fa9e 2024-03-09T10:30:04+01:00 Pierrick Hymbert server: tests: add truncated prompt tests, better kv cache size (#5933)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
76e868821a94072fbc87cb1fcca291694319eae8 e457fb3540e0aaec47cfde0abf784c213f9216ee 2024-03-08T12:25:04+01:00 Pierrick Hymbert server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937)
af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 581ed5c4fe3a8909aaa8313633ac443f471ba755 2024-03-08T12:40:02+02:00 Georgi Gerganov server : fix EOS token detection with disabled cache (#5938)
55a2a900ff4a02fc33708ac7858d595d289a3f2a 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 2024-03-07T19:42:39+09:00 Minsoo Cheong server : add `/v1/completions` endpoint (#5914)
2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796)
231ae28f078c3148d097b301f2145f1e3e816cc1 475df1d6cf817060028d3ff763cb8097d4ec40d6 2024-03-03T12:44:03+02:00 Georgi Gerganov readme : add API changes section
e6029348e86c3810d4435faee54ba822cb43e2ef 8ef969afcec1645d2d9c3ab1fc82263bba968989 2024-03-03T09:35:23+01:00 Pierrick Hymbert ci : schedule slow server tests only on Release or on demand (#5839)
8ef969afcec1645d2d9c3ab1fc82263bba968989 fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 2024-03-03T08:48:36+01:00 Pierrick Hymbert server : init http requests thread pool with --parallel if set (#5836)
9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832)
38d16b142624bdd7c41d9955752b7f7b59c5e048 c2224f003bf9cf558b1a3c57033563e11a4de9a5 2024-03-01T20:00:58+02:00 Georgi Gerganov server : remove api_like_OAI.py proxy script (#5808)
5cb02b4a012bb16c6c699c0c62c05ffa653eee0f 6ea0f010ff6967034528d9e0b8330b9b0f0b7c13 2024-03-01T10:08:08+01:00 Pierrick Hymbert server: allow to override threads server pool with --threads-http (#5794)
f105471ef6aa4727afac8240da398590d7277f45 38d152160898b0173ffe4dc7df5daadcbd2eceb0 2024-03-01T09:59:43+02:00 Georgi Gerganov server : fix newlines in help (#5785)
052051d8ae4639a1c3c61e7da3237bcc572469d4 d5ab29757ebc59a30f03e408294ec20628a6374e 2024-02-29T21:42:11+01:00 Xuan Son Nguyen Server: normalize naming (#5779)
08c5ee87e4cceb603ecceac90734fcdade57311b 78aacf36344df724cdca9f1e1af849b2d2519cb8 2024-02-28T18:43:38+02:00 Georgi Gerganov llama : remove deprecated API (#5770)
a693bea1e6762a17b78b6ddf4611e54136941ea2 adcb12a9bad87bc96f2f158c95892b3d04aa7ffb 2024-02-28T09:55:37+01:00 Xuan Son Nguyen server : hit Ctrl+C twice to exit (#5734)
efc72253f7987ed7bdc8bde9d9fa5c7cac2f6292 7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af 2024-02-28T01:39:15-07:00 Jorge A server : add "/chat/completions" alias for "/v1/...` (#5722)
b11a93df41921846a10628a7c306d5c82a549939 a33e6a0d2a66104ea9a906bdbf8a94d050189d91 2024-02-26T23:15:48+01:00 Xuan Son Nguyen fix server hangs on empty prompt (#5733)
4804215cb833841ffb15a710a16b77ca0a29eb4b 8a533f0d9078396ebaee9ba213038a1322976dee 2024-02-26T11:41:34+01:00 Pierrick Hymbert server: CI fix trailing space (#5728)
8a533f0d9078396ebaee9ba213038a1322976dee 269de86ba073b5dc9ce687c11a3bc4d7d873b962 2024-02-26T09:56:10+01:00 Pierrick Hymbert server: CI tests reduce build matrix (#5725)
e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 8b350356b28f782deab63d8b0e9ae103ceb25fcd 2024-02-25T22:48:33+01:00 Pierrick Hymbert server: tests - slow inference causes timeout on the CI (#5715)
8b350356b28f782deab63d8b0e9ae103ceb25fcd bf08e00643fd529f748f0a858fd79f3061e3fa18 2024-02-25T21:46:29+01:00 Pierrick Hymbert server: docs - refresh and tease a little bit more the http server (#5718)
f7625019c51ca437a5840576d92362cfa710e4a2 abbabc5e51d0d4656b438aec10b7fae9479ef37d 2024-02-25T13:43:50-05:00 compilade server : fix crash when system prompt is bigger than batch size (#5714)
930b1780269a69948d106e2d1b838ab7661f679a d52d7819b8ced70c642a88a59da8c78208dc58ec 2024-02-25T13:50:32+01:00 Pierrick Hymbert server: logs - unified format and --log-format option (#5700)
d52d7819b8ced70c642a88a59da8c78208dc58ec 12894088170f62e4cad4f8d6a3043c185b414bab 2024-02-25T13:49:43+01:00 Pierrick Hymbert server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708)
9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699)
525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566)
fd43d66f46ee3b5345fb8a74a252d86ccd34a409 54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea 2024-02-23T19:31:54Z AlpinDale server : add KV cache quantization options (#5684)
a46f50747b2028f7f9c9883b26bfba12bf92556e c5688c6250430d2b8e0259efcf26c16dfa4c1f46 2024-02-22T09:33:24+01:00 Xuan Son Nguyen server : fallback to chatml, add AlphaMonarch chat template (#5628)
c5688c6250430d2b8e0259efcf26c16dfa4c1f46 4ef245a92a968ba0f18a5adfd41e51980ce4fdf5 2024-02-22T08:27:32Z Alexey Parfenov server : clarify some params in the docs (#5640)
1ecea255ebb70750b52688393f37a63606b90e3f a00a35cef93e057eace8351a667d14d152a91ebc 2024-02-21T15:47:48+01:00 Pierrick Hymbert server: health: fix race condition on slots data using tasks queue (#5634)
6560bed3f066c876682464762cad90f1e28e3f1b 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df 2024-02-20T11:07:22-08:00 CJ Pais server : support llava 1.6 (#5553)
9c405c9f9a7cfd23511fd6b2de05dc72481119b4 5207b3fbc500f89dfe528693e96540956dbaed96 2024-02-20T15:58:27+01:00 Xuan Son Nguyen Server: use llama_chat_apply_template (#5593)
c0a8c6db371cb3e4379900867b948879f5842201 b9111bd209c7b11b0592450a6ed2e0ca545b2c84 2024-02-20T08:48:19+01:00 Pierrick Hymbert server : health endpoint configurable failure on no slot (#5594)
5ee99c32f5e47c8d32634eff9a47fb32a24c276b c145f8a132b2fe1d1e65987faddbd9a40bef7a12 2024-02-18T11:11:16-08:00 Robey Holderith common, server : surface min_keep as its own parameter (#5567)
c145f8a132b2fe1d1e65987faddbd9a40bef7a12 689a091bbe0537ee9abff3e15a1d74f5f3561165 2024-02-18T18:39:57+01:00 Pierrick Hymbert server : slots monitoring endpoint (#5550)
e75c6279d1c8e7abb82a331f5de7124eed402de2 36376abe05a12a8cb3af548a4af9b8d0e2e69597 2024-02-18T17:31:28+01:00 Pierrick Hymbert server : enhanced health endpoint (#5548)
36376abe05a12a8cb3af548a4af9b8d0e2e69597 66c1968f7a2e895675425e875b6589f1233a1b52 2024-02-18T17:30:09+01:00 Pierrick Hymbert server : --n-predict option document and cap to max value (#5549)
66c1968f7a2e895675425e875b6589f1233a1b52 1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e 2024-02-18T08:23:16-08:00 Daniel Hiltgen server : graceful server shutdown (#5244)
6dcc02d2444c779c18d49c364c5d5c5728b6b484 5f5808ca7b7f23a1fa7a77241842bb84a0e55108 2024-02-16T11:33:25Z Alexey Parfenov server : add "samplers" param to control the samplers order (#5494)
5f5808ca7b7f23a1fa7a77241842bb84a0e55108 f486f6e1e5e9d01603d9325ab3e05f1edb362a95 2024-02-16T11:00:56+01:00 Rőczey Barnabás server : fix system prompt cli (#5516)
f486f6e1e5e9d01603d9325ab3e05f1edb362a95 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 2024-02-16T01:31:07-08:00 bmwl ggml : add numa options (#5377)
0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491)
aa2341298924ac89778252015efcb792f2df1e20 f5ca054855dea83f424003162f26de376e5643f6 2024-02-14T08:38:35+01:00 John llava : support v1.6 (#5267)
684780141a08200ec98eba3e982dbafd1d0b5000 85910c5b30f6e268321be8df044f5528a6efac52 2024-02-11T13:38:14Z Alexey Parfenov server : allow to specify tokens as strings in logit_bias (#5003)
907e08c1109f498b01036367804cff3082c44524 f026f8120f97090d34a52b3dc023c82e0ede3f7d 2024-02-11T11:16:22+01:00 Xuan Son Nguyen server : add llama2 chat template (#5425)
7c777fcd5dd4af7079e33390cf6a19c328a2666f e5ca3937c685d6e012ac4db40555d6ec100ff03c 2024-02-09T02:49:49-08:00 Riley Stewart server : fix prompt caching for repeated prompts (#5420)
0ef46da632c32faa1a538e5dc180994e8bbb46e1 ee1628bdfea8b0079fed0140ac2f00ef1b465b57 2024-02-07T02:17:25-06:00 Xiao-Yong Jin llava-cli : always tokenize special tokens (#5382)
f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d f68664ac241a6b5c233d8f1051eef20929b06008 2024-02-07T01:15:19-05:00 Justin Parker server : update `/props` with "total_slots" value (#5373)
213d1439fadefe182f69c5f7e8dd3b4b6572ebcb 17c97fb0620448b37516a3f53fea6c482b0a30a4 2024-02-06T18:08:38Z Alexey Parfenov server : remove model.json endpoint (#5371)
8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be 31e790322133a4b1d0684527ea446e765e8a96cf 2024-02-06T04:20:59-05:00 Justin Parker server : include total "num_slots" in props endpoint (#5349)
31e790322133a4b1d0684527ea446e765e8a96cf 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 2024-02-06T04:20:00-05:00 Michael Coppola server : add `dynatemp_range` and `dynatemp_exponent` (#5352)
4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 906cff55c2848fda091d888a1585915ec0c9ea9e 2024-02-06T08:16:23Z Niall Coates server : various fixes for the prompt field in /completion (#5300)
a2d60c9158435ae9a6f14632f07f1acf7a3becef e6f81775323f6f4e4a30abf022a6028fa86b79ac 2024-02-05T08:10:22Z Alexey Parfenov server : allow to get default generation settings for completion (#5307)
4be04c8965578edc09194fab769b4b922b8444f5 5d55b0cd827bb0fcfedfa329a82bd5d6ef2c93ca 2024-02-05T10:43:57+03:00 Нияз Гарифзянов scripts : add non-interactive server-llm.sh (#5303)
e437b37fd0b2b97e6c6ff1045ec7f901faa6498a 2d40085c26794e29c434480b9e06738e89e5686f 2024-02-02T14:23:40+02:00 Georgi Gerganov scripts : parse wtype in server-llm.sh (#5167)
6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6 e805f0fa9951081ce0a86378a7aa52b6f636b82d 2024-02-02T08:56:31+01:00 Xuan Son Nguyen docker : add build for SYCL, Vulkan + update readme (#5228)
5cb04dbc16d1da38c8fdcc0111b40e67d00dd1c3 efb7bdbbd061d087c788598b97992c653f992ddd 2024-01-31T17:30:17+02:00 Georgi Gerganov llama : remove LLAMA_MAX_DEVICES and LLAMA_SUPPORTS_GPU_OFFLOAD (#5240)
e0085fdf7c758f0bc2746fc106fb29dd9df959de e6f291d15844398f8326940fe5ad7f2e02b5aa56 2024-01-30T21:19:26+02:00 Georgi Gerganov Revert "server : change deps.sh xxd files to string literals (#5221)"
e6f291d15844398f8326940fe5ad7f2e02b5aa56 4003be0e5feef320f3707786f22722b73cff9356 2024-01-30T20:17:30+02:00 Georgi Gerganov server : fix context shift (#5195)
4003be0e5feef320f3707786f22722b73cff9356 fea4fd4ba7f6b754ac795387b275e1a014a77bde 2024-01-30T12:15:05-06:00 JohnnyB server : change deps.sh xxd files to string literals (#5221)
813416991ab0d1caa0d12f93ac4e8a24a2add0a3 5589921ef84a4fb1c6d1c9c34d626a5a83033db6 2024-01-30T10:18:02+01:00 divinity76 main : allow empty --prompt-cache file (#5176)
6685cc41c237544623b4b5651eceb9c4280728cc ceebbb5b21b971941b2533210b74bf359981006c 2024-01-30T17:11:46+08:00 Wu Jian Ping server : improve README (#5209)
c82d18e863fcde91b4b1109b1d0c73ea4470c405 14fef85e2d5361e6b4dd7a9ecf22bb817362997d 2024-01-29T21:48:10+08:00 Wu Jian Ping server : embeddings compatibility for OpenAI (#5190)
2307523d322af762ae06648b29ec5a9eb1c73032 0f648573dde61c510560f68244f70ece7e60d8c1 2024-01-28T18:03:59+01:00 0cc4m ggml : add Vulkan backend (#2059)
39baaf55a160909bb9428bd981014218761a20cb 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 2024-01-28T01:55:31-06:00 Kyle Mistele docker : add server-first container images (#5157)
ec903c034131848da9222536ff18da07ec0882a0 a1d6df129bcd3d42cda38c09217d8d4ec4ea3bdd 2024-01-27T14:38:05+01:00 Maximilian Winter server : add self-extend support (#5104)
48c857aa10aea73210a4a72da3f1a6f99269e75d 413e7b0559f922bd4de5e9eec548829d111651b1 2024-01-26T13:42:20+01:00 Xuan Son Nguyen server : refactored the task processing logic (#5065)
2bed4aa3f37cb4e39e16e9ec7b595a7738fd5faf 125d03a5036a02a983c8e98c2cdc126e061afb8e 2024-01-23T08:11:39+01:00 Xuan Son Nguyen devops : add intel oneapi dockerfile (#5068)
125d03a5036a02a983c8e98c2cdc126e061afb8e 011e8ec577fd135cbc02993d3ea9840c516d6a1c 2024-01-23T01:51:27-05:00 Michael Coppola llama.vim : added api key support (#5090)
780e24a22eb595b705cbe8284771e9ceff1c4dd2 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea 2024-01-22T21:15:08+08:00 Reinforce-II ggml : parallelize FP32 conversion when using BLAS (#5045)
7dcbe39d36b76389f6c5cd3b151928472b7e22ff 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 2024-01-21T14:42:44+02:00 Kawrakow Add ability to evauate multiple choice tasks (#5047)
7051aacfac0057fa5fac9ea46c55bffc3892d810 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 2024-01-19T11:39:11+02:00 Kawrakow winogrande: evaluate log-probs in parallel (#5036)
821f0a271e7c9ee737945245dd7abfa22cc9b5b0 96d7f56d2918ffde1995dbb32392571deb76d7fc 2024-01-18T21:33:05+01:00 Xuan Son Nguyen server : defer tasks when "slot unavailable" (#5018)
3e945cc1e9c06d2001031360e4e303e9548fb02c ad19812cda4062c9f154ef16315df41fbe6a770a 2024-01-18T19:18:21+02:00 Kawrakow HellaSwag: speed up by parallelizing log-prob evaluation (#5020)
ad19812cda4062c9f154ef16315df41fbe6a770a 682986a08eb5cb04865d2e713449f17304d266d8 2024-01-18T15:33:01+02:00 Georgi Gerganov perplexity : faster HellaSwag via batching (#5017)
4feb4b33eeb1756e46084a4db9230b279af1a480 959ef0c0df725c013c7f712eaa7790b8e38a8e20 2024-01-16T18:41:42+01:00 Maximilian Winter examples : add complete parallel function calling example (#4974)
4be5ef556de830c5c4f6e45c05ef4427823fe607 0ea069b87bd296c556824e57455433b6c0357340 2024-01-13T20:45:45+02:00 Georgi Gerganov metal : remove old API (#4919)
0ea069b87bd296c556824e57455433b6c0357340 f172de03f11465dc6c5a0fc3a22f8ec254c6832c 2024-01-13T19:31:26+02:00 Georgi Gerganov server : fix prompt caching with system prompt (#4914)
356327feb3f66980ab687040495d722696d98970 ee8243adaa9a9f51ff449213383874e49efe368f 2024-01-13T09:20:46-05:00 Ziad Ben Hadj-Alouane server : fix deadlock that occurs in multi-prompt scenarios (#4905)
ee8243adaa9a9f51ff449213383874e49efe368f 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 2024-01-13T14:16:11Z makomk server : fix crash with multimodal models without BOS token (#4904)
e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766)
1d118386fea031f01550f8cd47a5c86296e5333f 7edefbd79cc6dea96640edc54c6b94b2b2496d8b 2024-01-11T23:23:49+02:00 Georgi Gerganov server : fix infill when prompt is empty (#4833)
4330bd83feb39683de4bd7a34cfcf672ff8ac3e4 27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 2024-01-11T19:02:48+01:00 Laura server : implement credentialed CORS (#4514)
27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 eab67950068e4b125007d027232c47d2a5831cd0 2024-01-11T12:51:17-05:00 Michael Coppola server : support for multiple api keys (#4864)
eab67950068e4b125007d027232c47d2a5831cd0 d8d90aa343c22fe01429d3540e47ded87e9dcb9d 2024-01-11T12:41:39-05:00 Behnam M server : add `LOG_INFO` when model is successfully loaded (#4881)
43f76bf1c362c067fce46bb8dcda0b64af8a9533 2f043328e3116724d15b915b5c6078e2df860a69 2024-01-11T16:14:52Z pudepiedj main : print total token count and tokens consumed so far (#4874)
2f043328e3116724d15b915b5c6078e2df860a69 2a7c94db5fb67b2f8882d2d16a11bf5d8d12d397 2024-01-11T09:33:26-05:00 Isaac McFadyen server : fix typo in model name (#4876)
7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b 2024-01-11T02:12:05-05:00 Behnam M server : update readme to document the new `/health` endpoint (#4866)
5c1980d8d4c4e0c0af77359f81cc44d90b3f250b cd108e641dbdedd8c5641c4cec1762f751f38136 2024-01-11T09:10:34+02:00 Georgi Gerganov server : fix build + rename enums (#4870)
cd108e641dbdedd8c5641c4cec1762f751f38136 57d016ba2d46a6e22517a31a75cebb48f9e234b6 2024-01-10T14:56:05-05:00 Behnam M server : add a `/health` endpoint (#4860)
128de3585b0f58b1e562733448fc00109f23a95d 8c5833031857c9e9ada61948bae894ab9c785f86 2024-01-09T05:02:05-05:00 Behnam M server : update readme about token probs (#4777)
8c5833031857c9e9ada61948bae894ab9c785f86 18c2e1752c3b387689e9e73d7d8a1a3b1511ce23 2024-01-09T10:12:43+01:00 Zsapi server : add api-key flag to documentation (#4832)
67984921a70a7e680a24494aeb7575a66e90685d c75ca5d96f902564cbbbdd7f5cade80d53c288bb 2024-01-07T08:45:26+02:00 Georgi Gerganov server : fix n_predict check (#4798)
012cf349aec8ffb47c9def5dc018240fa3721e8b a91928014fcf51fe297823fcff0788de4f14206e 2024-01-04T19:56:33+02:00 Georgi Gerganov server : send token probs for "stream == false" (#4714)
e5804313a1edaf00726ed0b96ecced07accbf50c dc891b7f7a23158d54f9383790b92c79cc5906c1 2024-01-04T03:17:09-05:00 Michael Coppola server : fix options in README.md (#4765)
f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099 f3f62f0d835d559e80714bbeb05d03125574e3dd 2024-01-03T03:43:19-05:00 Justin Parker server : throw an error when `slot unavailable` (#4741)
f3f62f0d835d559e80714bbeb05d03125574e3dd 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 2024-01-02T21:07:47+02:00 Georgi Gerganov metal : optimize ggml_mul_mat_id (faster Mixtral PP) (#4725)
0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 540938f8904707dd74cb3be18495f853b312e72f 2024-01-02T15:48:49Z Phil H server : add token counts to html footer (#4738)
0040d42eeb237197054cc7790df5776eacfa608e 83e633c27efdf0eb0ba54249e784b0ea760b1007 2024-01-02T06:15:16-08:00 Marcus Dunn llama : replace all API facing `int`'s with `int32_t` (#4577)
5d7002d4372ebf107cfaf46fcd90df27b204f330 26f3071d714f0b27ad7f021a46a66a1085480258 2024-01-02T04:38:15-06:00 minarchist server : add --override-kv parameter (#4710)
58ba655af054715c0516ee270ad028ad9e74f357 edd1ab7bc34c10a780ee7f9a4499f7689cdad36d 2024-01-02T10:57:44+02:00 Georgi Gerganov metal : enable shader debugging (cmake option) (#4705)
9fbda719de18a9400a064c28759c39d55d687d3e 39d8bc71edcb8b6f99d46fa4216af7a15232e218 2023-12-30T23:24:42+02:00 Georgi Gerganov clip : refactor + bug fixes (#4696)
24a447e20af425fa44cf10feaa632b6bb596c80f a20f3c7465d6d1b33767757c2760643b799a81bf 2023-12-30T15:07:48+07:00 automaticcat ggml : add ggml_cpu_has_avx_vnni() (#4589)
db49ff8ed7f0bb201176703441cc02911b08ef2a 60f55e888c29cbd87c4238dd19e85d0eef87245d 2023-12-29T06:24:12-08:00 Justine Tunney server : replace sleep with condition variables (#4673)
60f55e888c29cbd87c4238dd19e85d0eef87245d b93edd22f55d3e5268263c3edcdae1818505c078 2023-12-29T22:22:44+08:00 SakuraUmi server : fix OpenAI server sampling w.r.t. penalty. (#4675)
b93edd22f55d3e5268263c3edcdae1818505c078 82d6eab224862a7044069fb9211dc4b29124264b 2023-12-29T06:22:10-08:00 Karthik Sethuraman server : allow to generate multimodal embeddings (#4681)
441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576)
65e5f6dadbba4b496bba27f573e473c66b446496 ea5497df5d138c83b2b0ca70aefdc4b1175c1001 2023-12-28T11:20:00-08:00 Justine Tunney Fix OpenAI server sampling w.r.t. temp and seed (#4668)
6123979952385847d8348e295d77d6e01da8aa84 b9ec82d262cb20d7f0a8a1157bfa9aace40e2625 2023-12-23T09:31:49Z Alexey Parfenov server : allow to specify custom prompt for penalty calculation (#3727)
31f27758faf4a4bd08101a57c7ec3a473f771f86 56fa50819f7a3ca2128f63b81c17c08a4454479e 2023-12-21T11:57:48-08:00 Marcus Dunn llama : allow getting n_batch from llama_context in c api (#4540)
2994f0c5a2e8c96955b422dedc93ec2595d16b82 b1306c439490c7fa4ec33594500d980d1e9e15e6 2023-12-17T19:39:02-05:00 Jared Van Bortel decode : fix logits_valid for legacy API (#4516)
0ffc92d2d23a789625f018840469af045be1e3c0 8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 2023-12-17T17:02:16+02:00 olexiyb server : disable llm logs if SERVER_VERBOSE is off (#3792)
8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 eb16dae7e70ca97396190698b29c0f9ee3388e88 2023-12-17T15:57:56+01:00 AdithyanI server : fix grammar being ignored (#4494)
eb16dae7e70ca97396190698b29c0f9ee3388e88 62bd52b7bf90819e75f427a95a484cd5eee0b3c7 2023-12-17T14:56:09Z Alexey Parfenov server : fix possible ambiguity in content type charset (#4501)
62bd52b7bf90819e75f427a95a484cd5eee0b3c7 5daa5f54fdcd2b5228add1a4c43a1897b2168f35 2023-12-17T15:54:37+01:00 mzcu server : allow requests larger than 8K (#4500)
88ae8952b65cbf32eb1f5703681ea592e510e570 ee4725a686643669a8587142fa068cbf29de3ce2 2023-12-15T13:49:01+02:00 ShadovvBeast server : add optional API Key Authentication example (#4441)
948ff137ec37f1ec74c02905917fa0afc9b97514 4d98d9a65665eee3838cef936641f640e3f5b649 2023-12-13T23:57:15+04:00 shibe2 server : fix handling of characters that span multiple tokens when streaming (#4446)
fecac45658a99eddc4d6e36ba0310ca8f87a77f0 9494d7c4774ab745490b5a19570ff7747a194143 2023-12-12T04:12:35-06:00 kalomaze server : tweak default sampling parameters (#4367)
d9d4cfef64ea416dd66632173787d03ffb180cc7 41a11aaf99feff4901e4c8dc48ad00766c5da4e9 2023-12-12T11:25:29+02:00 Vladimir Zorin server : fix local model name in server (#4420)
bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 81bc9214a389362010f7a57f4cbc30e5f83a2d28 2023-12-07T13:03:17+02:00 Georgi Gerganov llama : per-layer KV cache + quantum K cache (#4309)
05cd6e5036d72d0930de4d8f6be7bce09e8dda24 caa9249217c5fd524b900add5ddcbeaa20cbcb12 2023-12-06T20:21:59+02:00 Georgi Gerganov server : recognize cache_prompt parameter in OAI API (#4347)
23b5e12eb5a76489b4c3ee22213a081da68b1809 d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 2023-12-04T17:04:21+01:00 Daniel Bevenius simple : update error message for KV cache check (#4324)
33e171d1e9fc4903f9314b490d77fb8d58331b63 6949b50df56ee58a2d76d45487942cb211c08629 2023-12-03T01:10:43-08:00 Ed Lee server : fix OpenAI API `stop` field to be optional (#4299)
6949b50df56ee58a2d76d45487942cb211c08629 d7b800b8bc490a221acbd83c575206a907f2f6e2 2023-12-03T10:03:25+01:00 Rickard Edén py : add grammar to oai like api (#4294)
1d144112c0fbbb4ecc07dbcf4f05a380148bd6de f43f09366dfd018e4568e23a232aaa8c4f7cfc78 2023-11-30T17:25:49-05:00 Ziad Ben Hadj-Alouane server : add --log-disable to disable logging to file (#4260)
f43f09366dfd018e4568e23a232aaa8c4f7cfc78 d2809a3ba2780e00fce5a6149a7eda09f1c0e906 2023-11-30T17:25:04-05:00 Ziad Ben Hadj-Alouane server : add single-client multi-prompt support (#4232)
e2bd725f4b39bc5c6234858d158e01248f5ab5bd 1f5cd83275fabb43f2ae92c30033b384a3eb37b4 2023-11-30T20:50:40Z rhjdvsgsgks py : fix oai proxy (#3972)
af19d3573481d409b3c4e55494810eb1f65a9aae e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb 2023-11-25T11:29:06+02:00 Georgi Gerganov server : OAI API compatibility (#4198)
6b0a7420d03b9d13cb0e9439a01ce8476d8bf093 d103d935c0e75769a6a597f7a64cab72c6cc3e79 2023-11-23T19:07:56+02:00 Georgi Gerganov llama : KV cache view API + better KV cache management (#4170)
9d5949f04b1f8b76184818abbd99938c2020803f ff8238f71d56245f4a6dbea693f4ebd81263464d 2023-11-23T12:34:20+01:00 Daniel Bevenius examples : fix typo in parallel example doc comment (#4181)
936c79b2275a8f15f3512e63de615c676904d650 262005ad9ded375e9c544a02c18ef6254fe185a2 2023-11-19T11:54:10-05:00 SoftwareRenderer server : relay error messages (#4131)
9e87ef60e18d69338c5efea314aa7e718bf2040a c7cce1246e248124117ae5bc058923e3ade95f11 2023-11-17T16:24:07+01:00 Jannis Schönleber common : improve yaml log escaping (#4080)
4760e7cc0b68570d58f55e8dda469805d1759d0d bb50a792ec2a49944470c82694fa364345e95170 2023-11-13T14:16:23+02:00 Georgi Gerganov sync : ggml (backend v2) (#3912)
532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd e86fc56f7521ca4b18d1d9939e82abd40c2f1c01 2023-11-11T22:04:58-08:00 Richard Kiss Fix some documentation typos/grammar mistakes (#4032)
d96ca7ded77df764db797b68b4a29e34c5b56285 34b0a082074b073eb14c2bd93c0c070e20ddcd16 2023-11-11T05:48:21Z Alexey Parfenov server : fix crash when prompt exceeds context size (#3996)
4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf df9d1293defe783f42bc83af732d3c670552c541 2023-11-11T06:49:33+08:00 Jhen-Jie Hong server : allow continue edit on completion mode (#3950)
57ad015dc3011b046ed5a23186c86ea55f987c54 875fb42871a0f5a88fbe31a0b5edd697b84038e4 2023-11-09T04:00:34+02:00 Mihai server : add min_p param (#3877)
381efbf480959bb6d1e247a8b0c2328f22e350f8 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede 2023-11-06T22:36:23+01:00 Damian Stewart llava : expose as a shared library for downstream projects (#3613)
bb60fd0bf6bb270744d86dd45b3a95af01b7de45 132d25b8a62ea084447e0014a0112c1b371fb3f8 2023-11-05T23:15:27+07:00 Thái Hoàng Tâm server : fix typo for --alias shortcut from -m to -a (#3958)
50337961a678fce4081554b24e56e86b67660163 0e40806c1cb3bdf9955ed807ffbe212be85b4c67 2023-11-01T20:11:02+02:00 Georgi Gerganov llm : add llm_build_context (#3881)
f0e209324a7f663225791897877bf610f1af152d ca190bca8e844d171020d6147687e71472d71734 2023-11-01T11:29:07+02:00 Georgi Gerganov scripts : add server-llm.sh (#3868)
ca190bca8e844d171020d6147687e71472d71734 71e3718abdb2771b50c9606d3a7569623a0b0afe 2023-11-01T09:28:28Z Adrian Hesketh server : re-enable completion and embedded at the same time (#3876)
82a6646e0221216c41edcdf99f5a44bb051391f5 ba231e8a6dd8ad82acfe0e4d492ff7cef6b3f0a1 2023-10-28T15:43:01+03:00 Aarni Koskela metal : try cwd for ggml-metal.metal if bundle lookup fails (#3793)
34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798)
ad939626577cd25b462e8026cc543efb71528472 1717521cdb976a2219888b0e5cba36e210eee9df 2023-10-24T16:10:43-04:00 cebtenzzre server : add parameter -tb N, --threads-batch N (#3584) (#3768)
1717521cdb976a2219888b0e5cba36e210eee9df b2f7e04bd312eaf97eee0523aa09d950d585626b 2023-10-24T23:08:20+03:00 Georgi Gerganov server : do not block system prompt update (#3767)
5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce 6336701c9378c23c85d1c0e464b663ca2bbb8e60 2023-10-23T12:40:03-07:00 Marcus Dunn llama : remove token functions with `context` args in favor of `model` (#3720)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
d3956aea53369455008159cc405ed4c496976692 22c69a27945e7acf9690dd3210d316f22182751c 2023-10-22T20:09:51+02:00 vvhg1 main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623)
d1031cf49c3b958b915fd558e23453471c29ac33 8cf19d60dc93809db8e51fedc811595eed9134c5 2023-10-20T21:07:23+03:00 Georgi Gerganov sampling : refactor init to use llama_sampling_params (#3696)
a0edf73bda31c7c4e649e6f07c6fd30a729929cd f439e506e8ae8b01df2ae2156380f8156d7553e3 2023-10-20T13:06:10+03:00 Georgi Gerganov server : fix uninitialized sampling context (close #3685)
0e89203b517c95ec6675eda75d200a60d1e8921d c67fe68e417f766970fb1feaf2e66458aa24116a 2023-10-18T16:21:57+03:00 Georgi Gerganov speculative : add tree-based sampling example (#3624)
3ad1e3f1a10c1f66b4f1cd7510e0977fadbc0dfd 1142013da40e98946a109b141dd858f0ed996051 2023-10-17T18:51:02+02:00 coezbek server : documentation of JSON return value of /completion endpoint (#3632)
b016596d903641f8825cd94bb6742e1de0c21017 6b3ae4da92485f979a0f45774fcf68597634db0b 2023-10-12T15:51:53+09:00 Aarni Koskela server : add completion mode (no chat) (#3582)
57dd55e2c742bfc50e0f5c6fb95c14118cff44f6 b8fe4b5cc9cb237ca98e5bc51b5d189e3c446d13 2023-10-12T09:29:04+03:00 Georgi Gerganov server : fix kv cache management (#3588)
a8bdd65525ae86dea905e9866ad369b53e30ac14 70c29da118cdb02bfcbd0376c32b5b2236e48e48 2023-10-11T15:42:22-04:00 Michael Coppola server : add parameter -tb N, --threads-batch N (#3584)
11ea5c7d96f2c28e1c99659e08ec0a44574056e2 95bd60a0a69f57e9a2ff1269667ea484a1a9bb40 2023-10-10T09:31:21+02:00 vvhg1 infill. : fix tokenization (#3508)
8e6716a102e390e930594d51302730184dac83cc 9c38d181d40b9d27f8f42152c18e7c70bfffcf37 2023-10-08T03:55:58-07:00 Ryder Wishart api_like_OAI.py : compat with Microsoft Guidance (#2746)
9c38d181d40b9d27f8f42152c18e7c70bfffcf37 a1202a31ed8c35705bd09fe91c3e7410c619bd70 2023-10-08T06:52:57-04:00 arcrank api_like_OAI.py : simplify function (#2796)
cb13d73a720c42d1958bff79b6869d77b26b8cea 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 2023-10-06T21:39:33+03:00 Mihai server : docs fix default values and add n_probs (#3506)
9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 0c731ca4039ccff86ffab90eaae4ca98037c4496 2023-10-06T10:10:13-06:00 Kerfuffle kv cache slot search improvements (#3493)
a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416)
97af49fa395df77e4c18af0e1655b2fee67c9686 16820a5a0d885113f21021ce934f0b0027b9d69a 2023-10-06T07:44:24-05:00 Jhen-Jie Hong server : reuse llama_sample_token common util (#3494)
e8b8d32e8663ffc55a02c9721af3a5190382cbb0 8f3a642ec1d878b2d0a0d15e3a4277f522790d4c 2023-10-05T09:02:55-05:00 Jhen-Jie Hong server : fix incorrect num_tokens_predicted (#3480)
ac2219fef34eb5b713c286c34c6e4162c39c8f3b 48be797ffbd80b062f55778e09e97180eb25d2ab 2023-10-03T21:04:01+03:00 Georgi Gerganov llama : fix session saving/loading (#3400)
48be797ffbd80b062f55778e09e97180eb25d2ab f56e1baec361b5381e32ee6b6e56e4f00e002dfe 2023-10-03T10:09:28-07:00 Alex Klinkhamer llama : expose model's rope_freq_scale in the API (#3418)
c97f01c362ac102c6994edb80008f8608539553a f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0 2023-10-02T09:42:02+02:00 vvhg1 infill : add new example + extend server API (#3296)
7f1a0fe709ea1a861da2f3759f58a28bf8953c12 16bc66d9479edd5ee12ec734973554d4493c5dfa 2023-09-29T03:51:52+08:00 Qu Zongfu ggml : release the requested thread pool resource (#3292)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
dc6897404e141c74cbbf8030ecfebd74e1815411 527e57cfd8a9a26bf622c0510c21c2508a24be26 2023-09-27T17:48:33+02:00 Rickard Hallerbäck metal : reusing llama.cpp logging (#3152)
be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af be6beeb8d75294552c4918fce06d7b84eebf3d79 2023-09-07T15:45:01+02:00 Kawrakow metal : parallel RoPE on Metal (#3024)
e4386f417faf894f6706eec005e24d142b577fcb 35195689cd835464779c247b1c22ab9247418fd1 2023-09-04T10:28:55+02:00 Aarni Koskela server : add a subtle loading animation to the edit box (#2466)
571083f508266c4eb5cb5457d836df5dd3c173ce f04d0028444bc9b3d4225fba47e19d4c3aeb3741 2023-09-02T08:31:46+08:00 Jhen-Jie Hong server : avoid aniprompt in probabilities of final response (#2849)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
c1ac54b77aaba10d029084d152be786102010eb2 730d9c681e339b76407659344e5a2cd50af7d7d5 2023-08-26T16:11:45-07:00 Bruce MacDonald server : add `/detokenize` endpoint (#2802)
730d9c681e339b76407659344e5a2cd50af7d7d5 c7d92e6dfec3f54849f3a0ba373054d29f321ea2 2023-08-26T14:13:36-06:00 Kerfuffle convert.py : advanced option (#2753)
2ba83c8685177faea3399db9564f9c52df75c366 bae5c5f679e043371bc2b4dffff8d4964d6cb953 2023-08-26T13:45:53+02:00 klosax Fix spm whitespaces (#2806)
bae5c5f679e043371bc2b4dffff8d4964d6cb953 232caf3c1581a6cb023571780ff41dc2d66d1ca0 2023-08-26T10:07:43+02:00 lon examples : skip unnecessary external lib in server README.md how-to (#2804)
29674ab4e847fcaba60cc6558f0d46d5f74ae279 5439a0ab57c16b556ffa91a0953df5e46b1e7fb4 2023-08-25T18:32:45+08:00 Jhen-Jie Hong server : display token probabilities in the UI (#2489)
cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717)
b8ad1b66b23f9b2e6e4531e9a62753323036a556 f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 2023-08-23T02:12:12-05:00 Xiao-Yong Jin server : allow json array in prompt or content for direct token input (#2306)
46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea c63bb1d16a70c03440671b76954bb767513cead8 2023-08-22T23:10:42+02:00 goerch llama : fix whitespace escaping in tokenizer (#2724)
226255b44ef2c2794bfac48d101d35a9c2dbb965 930523c8e1cbbee5449c055daa894917fac6805e 2023-08-22T08:32:00+08:00 Jhen-Jie Hong server : fallback to default if client param is null (#2688)
6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398)
1f0bccb27929e261744c979bc75114955da49e98 f63564adfaa157ca387071d6b9a06cfaef0ef576 2023-08-19T00:45:36+03:00 Georgi Gerganov server : better default prompt (#2646)
f63564adfaa157ca387071d6b9a06cfaef0ef576 2d8b76a110d76ff6b5728ff0af8477531e4db60e 2023-08-19T05:41:32+08:00 Jhen-Jie Hong server : update xxd usage for older versions compatibility (#2649)
10151bee2e38b5711335c4a38f6ca93b50223acf 0992a7b8b18a89e29a205efb48ceb559c9a08203 2023-08-17T23:34:01Z staviq server : support for saving templates in browser LocalStorage (#2486)
3ebb00935f3f0522b75df49c2769ab1774b91380 d783f7982e0e823a2626a9956359c0d36c1a7e21 2023-08-15T06:14:14+08:00 Jhen-Jie Hong server : add missing /json-schema-to-grammar.mjs (#2616)
d75561df207d22790609ee0ad924302f66ac2599 348acf188c9fbe66396990f2dc83229df367969b 2023-08-14T15:36:42+02:00 Cheng Shao server : add --numa support (#2524)
2feb8934eb75ca63f3c42724229cce1df9579c8e 5517d6e69214cdead000a76983b9fe175c3f8329 2023-08-14T16:20:17+08:00 Jhen-Jie Hong server : fix default grammar by use empty string in the UI (#2604)
5517d6e69214cdead000a76983b9fe175c3f8329 f31b5397143009d682db90fd2a6cde83f1ef00eb 2023-08-14T15:16:54+08:00 Jhen-Jie Hong server : implement json-schema-to-grammar.mjs & add grammar param in the UI (#2588)
53dc399472d5bd35ee739b865e843b1996bd3814 9ca4abed893685692f90413e4d43153af12342d9 2023-08-12T06:35:14+08:00 Equim server: fixed wrong variable name in timing json (#2579)
1638757767072a4957f52b9e3594f0b67610631b 916a9acdd0a411426690400ebe2bb7ce840a6bba 2023-08-10T12:16:38+02:00 Martin Krasser Fix grammar-based sampling issue in server (#2566)
182af739c4ce237f7579facfe8f94dc53a1f573f 4329d1acb01c353803a54733b8eef9d93d0b84b2 2023-08-04T15:00:57-04:00 Cebtenzzre server: regenerate completion.js.hpp (#2515)
5f631c26794b6371fcf2660e8d0c53494a5575f7 415e99fec27be5a2e4283f1937afd17eb33fbd66 2023-08-04T06:37:24-05:00 Stephen Nichols Fixing race condition in server and partial stream handling in frontend. (#2391)
415e99fec27be5a2e4283f1937afd17eb33fbd66 ff966e7ca6af127c9405523cdb07ef8fa01bf6d6 2023-08-04T19:29:52+08:00 l3utterfly Stream save llama context data to file instead of allocating entire buffer upfront (#2488)
c574bddb368424b5996cbee2ec45ec050967d404 86aeb27734481751592abd85590020b40d9224c8 2023-08-01T20:54:28+08:00 Bono Lv fix a typo in examples/server/README.md (#2478)
86aeb27734481751592abd85590020b40d9224c8 1873ff586bd8499a18f763632711bf15d253585e 2023-08-01T01:56:23-07:00 ebraminio server : Support dark mode (#2414)
34ae1caf7fdea4c4c09087002e15e6230102e6a9 d91f3f0c55663719ea03b76311e8c36ed55eb0e2 2023-07-29T03:02:10+09:00 nhamanasu examples : server chat mode with llama2 (#2400)
d5512b782b27ff698007dcd175da18959d5f163f c798308e3a425eae050a1f249a576fa8c6433327 2023-07-25T11:36:17+02:00 slaren server: add rms_norm_eps parameter (#2380)
c798308e3a425eae050a1f249a576fa8c6433327 41c674161fb2459bdf7806d1eebead15bc5d046e 2023-07-25T10:27:34+03:00 Henri Vasserman [Server] Escape HTML in webchat (#2368)
b3f138d05849ccbce67303ac17b50ebbc268128a 5b2b2dc6ae8086bff7c9b3c17fb435cf319b7185 2023-07-24T17:54:22+03:00 Aarni Koskela Chat UI extras (#2366)
4f06592cc6b83979e4b442e8cb97b3948c857188 70d26ac3883009946e737525506fa88f52727132 2023-07-23T17:31:17-03:00 IgnacioFDM Add gqa parameter support to the server (#2351)
355c80f49e32b0b15c0a457f3bad380e57f5b9ac 83a00ce69bef9124c0702424a012ea799128b77d 2023-07-23T06:16:48-05:00 AustinMroz examples : simplify vim plugin (#2327)
24baa54ac1ff3d4156a2360deb1473af04a9b1a2 dd6c67d3cbb7b360747f776412bf01976aa32f4b 2023-07-22T12:34:51+02:00 whoreson examples : basic VIM plugin
9cf022a1889e50113fd348dc96b4557fc75a6296 e782c9e735f93ab4767ffc37462c523b73a17ddc 2023-07-21T09:42:21+02:00 Przemysław Pawełczyk make : fix embdinput library and server examples building on MSYS2 (#2235)
294f424554c1599784ac9962462fc39ace92d8a5 45a1b07e9b20c33d71d8c849ff27d693a75a0269 2023-07-19T15:06:40+08:00 Rinne llama : extend API to get max devices at runtime (#2253)
6e7cca404748dd4b1a3affd0d1296e37f4ac0a6f a6803cab946c817fb7aaf2a40b317f5d3e373bd1 2023-07-15T06:34:16-04:00 Xiao-Yong Jin llama : add custom RoPE (#2054)
3ec7e596b2ba3f43c22f441254ca2bcfa91102ba 917831c63a4138814d23da1917bf2b5d5b9faa6c 2023-07-12T01:12:35+09:00 Jinwoo Jeong docker : add '--server' option (#2174)
5656d10599bd756dc0f17284e418e704200b43f3 1d1630996920f889cdc08de26cebf2415958540e 2023-07-10T11:49:56-04:00 Evan Miller mpi : add support for distributed inference via MPI (#2099)
1d656d6360359cfdaaf5d64ed9690047b600dbcb 72421402834141df6cbdcf595fe46dbd11874dce 2023-07-08T00:24:01+08:00 Qingyou Meng ggml : change ggml_graph_compute() API to not require context (#1999)
31cfbb1013a482e89c72146e2063ac4362becae7 983b555e9ddb36703cee4d22642afe958de093b7 2023-07-05T16:51:13-04:00 Tobias Lütke Expose generation timings from server & update completions.js (#2116)
983b555e9ddb36703cee4d22642afe958de093b7 ec326d350c72afd23709a409944728a607188cc0 2023-07-05T18:03:19Z Jesse Jojo Johnson Update Server Instructions (#2113)
8567c76b5326e862be0755a8dc1dd988223fcae3 924dd22fd3ba93e097f8d19ba5cda919ca2fe2fb 2023-07-05T15:13:35Z Jesse Jojo Johnson Update server instructions for web front end (#2103)
f257fd255044decffad93dee2502875ce66ad80c 7ee76e45afae7f9a7a53e93393accfb5b36684e1 2023-07-05T03:06:12+09:00 jwj7140 Add an API example using server.cpp similar to OAI. (#2009)
7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998)
acc111caf93fc6681450924df9f99679c384c59e 23c7c6fc9182b041f006b86ea1e7f99911ecf344 2023-07-04T15:38:04+03:00 Henri Vasserman Allow old Make to build server. (#2098)
1cf14ccef12e19c5a5b0b17ab456242d1f8c7fdd cc45a7feb8412e84ff292207621412fffc0d3d51 2023-07-04T00:05:23+03:00 Henri Vasserman fix server crashes (#2076)
d7d2e6a0f0c74f7a570dae384dfff371ac744d2a 46088f72318981341a2d646f12f6eee6aec06d65 2023-07-03T05:38:44+08:00 WangHaoranRobin server: add option to output probabilities for completion (#1962)
b1ca8f36a9cdbcee5f5c425df717611a1040a897 b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf 2023-07-01T23:42:43+08:00 Qingyou Meng ggml : disable GGML_TASK_INIT and GGML_TASK_FINALIZE by default (#1995)
b853d456018b10820686362af41b2f2f75f1eec6 9225baef71407d799a6f7f563b77fd7f82791416 2023-06-26T13:57:59-04:00 zrm ggml : add NUMA support (#1556)
c2a08f87b8d180115d04b8688f383d1b2761b16d 66a2555ba6cab954c56d653b29c27bfbbacfbfb1 2023-06-25T08:48:36Z anon998 fix server sampling: top k sampler first (#1977)
527b6fba1d237befb324fd846bda7418c0fa394d d7b7484f74d486f77feb4c0b7af7e1718ed91651 2023-06-24T11:47:58+03:00 Didzis Gosko llama : make model stateless and context stateful (llama_state) (#1797)
20568fe60f00155fa25e92eb3a7f6b911d557967 18b35625c3c19c64b7818a12460ba5ddb006dfdc 2023-06-20T01:12:39+03:00 Henri Vasserman [Fix] Reenable server embedding endpoint (#1937)
fc45a81bc642b9ef33d9004f2b363d558438a6c9 794db3e7b982fee37e3995db9c3a216a57ff65e3 2023-06-17T17:13:05+05:00 Faez Shakil exposed modules so that they can be invoked by nix run github:ggerganov/llama.cpp#server etc (#1863)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
9dda13e5e1f70bdfc25fbc0f0378f27c8b67e983 37e257c48e350cf03c353c10d31e777f8d00123d 2023-06-15T18:36:38+01:00 Srinivas Billa readme : server compile flag (#1874)
4bfcc855abdb2c9fcc3c5a84747974521909fa41 6b8312e7979b852f6b6ac9d29cd51fda16c17948 2023-06-15T20:29:48+03:00 Georgi Gerganov metal : parallel command buffer encoding (#1860)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
17366df842e358768c0df7024484fffecfc7865b 44f906e8537fcec965e312d621c80556d6aa9bec 2023-06-06T21:33:23+02:00 Johannes Gäßler Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703)
7552ac586380f202b75b18aa216ecfefbd438d94 5d1830b99dfd85bb6279adb4dd94aa444afd5b5e 2023-05-29T19:31:44+03:00 Georgi Gerganov ggml : sync cgraph import / export API
1b78ed20818b72306edc7208b9bfb69a1a0d3297 337aea11390221bc925e4acb1f603f1649af2735 2023-05-28T11:48:57-06:00 Kerfuffle Only show -ngl option when relevant + other doc/arg handling updates (#1625)
0df7d63e5ba0ab8856476e121a03b985d6f15c9d 97c9b77c4fc5e2283755c4418759cfc5fc73ad05 2023-05-27T11:04:14-06:00 Kerfuffle Include server in releases + other build system cleanups (#1610)
7e4ea5beff567f53be92f75f9089e6f11fa5dabd 7780e4f479dc5af106287c164b8e186cd9b6215c 2023-05-21T11:51:18-06:00 Steward Garcia examples : add server example with REST API (#1443)
affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483)
ec2e10c4443209da56b431b24dd0845b60e757fb d2c59b8ba498ab01e65203dde6fe95236d20f6e7 2023-05-20T11:06:11+03:00 Georgi Gerganov llama : add llama_init_backend() API (close #1527)
7694b52b9a206b93d59139c3c7c9b55da0f5aa59 79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4 2023-05-19T10:24:59-07:00 Jason McCartney main : make reverse prompt option act as a stop token in non-interactive mode (#1032)
5ea43392731040b454c293123839b90e159cbb99 ee9654138ab0ae5f138f4abddf56ca234ea3c352 2023-05-18T19:31:01+02:00 Erik Scholz make kv_f16 the default for api users (#1517)
f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
dd7eff57d8491792010b1002b8de6a4b54912e5c 7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c 2023-04-29T08:34:41+03:00 Ivan Stepanov llama : new sampling algorithms (#1126)
c4fe84fb0d28851a5c10e5a633f82ae2ba3b7fae 1d78fecdab4087028a38517e86ed129f077174d8 2023-04-24T07:40:02+03:00 Georgi Gerganov llama : refactor get / set state + remove redundant kv cache API (#1143)
b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 2023-04-22T08:21:32+02:00 xaedes llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105)
a32f7acc9f54dba1c728cb1e596bd00bf3b4eb5f 43ffdefb7424f79a3d510c199e2ea86684b4f824 2023-04-14T15:37:11+02:00 Pavol Rusnak py : cleanup dependencies (#962)
95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653)
f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone:
e986f94829bae0b9e66b326acbbba179931c84f1 c0bb1d3ce21005ab21d686626ba87261a6e3a660 2023-04-02T12:23:04+02:00 Christian Falch Added api for getting/setting the kv_cache (#685)
f4f5362edb01b05c383b23f36d7b3489c77061b5 863f65e2e32dc1e6d23c96a4811bf382d6b2a548 2023-03-24T15:23:09Z Gary Mulder Update README.md (#444)
56e659a0b271436e24813a801640d015e7b05328 40ea807a972ec7b5a426f034ebfa593b5e7a06ed 2023-03-22T17:09:38+01:00 Erik Scholz fix perplexity after c-api refactor (#390)
f5a77a629bd0f37ae1696747633ab42a5530ec15 da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b 2023-03-22T07:32:36+02:00 Georgi Gerganov Introduce C-style API (#370)
5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 da5303c1ea68aa19db829c634f1e10d08d409680 2023-03-20T08:24:11Z Stephan Walter Add tqdm to Python requirements (#293)
7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9 ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d 2023-03-19T12:38:44-06:00 Suaj Carrot Improved quantize script (#222)