f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling 38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features. 99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng tag: v0.2.1 server: fix max_seq_len ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len 82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len 622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 2026-04-09T10:36:31+08:00 wangbomeng server: comment circle print ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time 398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T02:01:23+08:00 wangbomeng rm llama-server_old.cpp 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID 41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 2026-03-12T16:36:07+08:00 Bomeng Wang tag: v0.0.1 server: correct the max_seq_len judgment 583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq 0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev 48bd26501b08a3f0bff1249db47f313641f7bebb 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 2025-11-03T15:38:23+02:00 Georgi Gerganov server : add props.model_alias (#16943) cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736) 2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784) e4a71599e5846110159955dec0008eb4aa24222b dd5e8cab512c7752392b6e51a6f118f348fb3f16 2025-11-01T17:14:54+01:00 Pascal webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757) c22473b580807929fd9e3a3344a48e8cfbe6c88f 0f715b4e759acceccb9f437cfd2a988fff85514a 2025-10-31T10:54:19+02:00 Georgi Gerganov server : don't print user inputs to console (#16871) 0f715b4e759acceccb9f437cfd2a988fff85514a d2d931f173b8a736b08999436e9259aafddec718 2025-10-31T09:51:26+01:00 Daniel Bevenius server : fix typos in server.cpp comments [no ci] (#16883) 16724b5b6836a2d4b8936a5824d2ff27c52b4517 b52edd25586fabb70f0c21b274473b307cf14499 2025-10-30T14:22:23-04:00 chansikpark server : bump request URI max length to 32768 (#16862) b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818) 8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847) 3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820) 338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808) 85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812) ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800) 5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748) 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 dd62dcfab97e420949519fd0eac9fca7bf97e635 2025-10-23T21:30:17+02:00 Johannes Gäßler server: add memory breakdown print (#16740) 8cf6b42d467d05fa7d9776d2bcc69974ecce6900 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 2025-10-23T11:32:24+02:00 matteo server : send partial stop string when is reached (#15007) 63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547) 9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562) 13f2cfad4170c096c51a02c24a6a158cb47f1480 06332e28672356b964d6dfc2ba4657e20581cd43 2025-10-20T12:41:13+02:00 Aleksander Grygier Enable per-conversation loading states to allow having parallel conversations (#16327) 41386cf365d894134ee0813d15e2f5d76f6a4d8e 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 2025-10-17T18:02:52+03:00 Radoslav Gerganov rpc : report actual free memory (#16616) 466c1911ab736f0b7366127edee99f8ee5687417 0cb7a0683b0529172472d74d21f05470a607f297 2025-10-15T22:24:51+03:00 safranowith cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083) f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 2025-10-15T16:22:20+02:00 Aleksander Grygier Add server-driven parameter defaults and syncing (#16515) 17304cbcc1dd24de7741cbe57925d58e90a98ac1 3e3cb19f6449f9168a128eaeae01f8f41b049acc 2025-10-15T16:53:12+03:00 Georgi Gerganov server : fix img token logs (#16595) 554fd578a5ed78a10f371f5850c6a69aa83df15a fa882fd2b1bcb663de23af06fdc391489d05b007 2025-10-15T12:51:27+03:00 Georgi Gerganov server : fix mtmd checkpoints (#16591) 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545) bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 e60f241eacec42d3bd7c9edd37d236ebf35132a8 2025-10-14T08:48:50+03:00 Georgi Gerganov server : dynamic token limit for prompt cache (#16560) 81d54bbfd599811b354c39f04550888168be7780 c7be9febcbafa9af7d1b9443f86475c59c9c5f87 2025-10-12T18:06:41+02:00 Pascal webui: remove client-side context pre-check and rely on backend for limits (#16506) 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 97870e64975b26c5e06a3540a8dc0ff601351e86 2025-10-11T21:39:04+08:00 Yann Follet server / ranking : add sorting and management of top_n (#16403) e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501) 68ee98ae181a5c83a5cc6261daeee69a1f588c15 cdb6da468cc33323955a523738d2e1675aeb5e9a 2025-10-10T17:11:07+03:00 Radoslav Gerganov server : return HTTP 400 if prompt exceeds context length (#16486) cdb6da468cc33323955a523738d2e1675aeb5e9a 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e 2025-10-10T13:22:27+03:00 Radoslav Gerganov server : log requests to /v1/completions (#16495) 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 1deee0f8d494981c32597dca8b5f8696d399b0f2 2025-10-09T22:54:57+02:00 Pascal webui: updated the chat service to only include max_tokens in the req… (#16489) d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391) 12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394) d2ee056e1df0fdf646270fb5621e9f92084b59a7 b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 2025-10-08T17:20:18+09:00 issixx server : fix cancel pending task (#16467) 7fdd16b432d247121fe5fe7b21f8805f85266c85 74b8fc17f92ada295a648e3c5eb28f46bca7d892 2025-10-08T10:57:29+03:00 Georgi Gerganov server : improve context checkpoint logic (#16440) df1b612e29ba97a2e67db339b1e8c7465702b7e8 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 2025-10-07T15:57:14+03:00 Georgi Gerganov server : add `/v1/health` endpoint (#16461) c61ae20d05bd4fdd8551311325a2845336449426 0123ff38f53d34752f29239a29d0e40a6dc4110f 2025-10-07T09:59:13+03:00 Radoslav Gerganov rpc : update documentation (#16441) c5fef0fcea3b978a2318b1af170209ecec7c37b4 ca71fb9b368e3db96e028f80c4c9df6b6b370edd 2025-10-06T03:53:31-04:00 Oleksandr Kuvshynov server: update readme to mention n_past_max metric (#16436) 898acba6816ad23b6a9491347d30e7570bffadfd e29acf74fea996014380d59d31aa504ae8964258 2025-10-04T12:49:16+03:00 Radoslav Gerganov rpc : add support for multiple devices (#16276) f6dcda390004b627ef30af378d0c01ad2519289e 606a73f53175077429484b23dcf799f69a31d0bd 2025-10-03T13:34:51-05:00 ddh0 server : context checkpointing for hybrid and recurrent models (#16382) ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401) 77233277c912d495d1069543ca540c21a2f9e5b4 e308efda8e54e3f07578937a45a5d83624eb7970 2025-10-03T11:30:39+02:00 Aleksander Grygier Capture model name only after first token (streaming) or completed request (#16405) 136bda78c5679b266362b39c58338fff46fd2592 5113efd34ceda709292de26c72716c49e024fb32 2025-10-03T09:11:34+02:00 Aleksander Grygier webui : Fix messages payload sent to chat completions (#16402) 2be72c2b121ee99f33927149265ce6073ade9e59 95ce0985449c52fb9d6849b95563f7cf933ea0e3 2025-10-02T15:16:25+08:00 Neo Zhang Jianyu SYCL: Update to oneAPI 2025.2 (#16371) aa9538a63aef35f0224b2502f13b19d650a8ce04 e74c92e84236b2bab3f3c77bee4ead94928be360 2025-10-01T07:40:26+02:00 Aleksander Grygier webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363) 16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed 2025-09-30T19:18:54+02:00 Pascal Chatapi ignore empty sampling (#16330) 98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt 2811c65286ae954bec87049f75b86dc022006dcc d8359f5fde480da030bf75c7711573c7c4d993ba 2025-09-28T12:04:46+01:00 Imad Saddik Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297) 234e2ff8ed09716fb553437596779399bee31b11 3f81b4e91c1d5f098148af117e3f13cf4b077f52 2025-09-27T18:17:08+02:00 Adrien Gallouët server : remove old LLAMA_SERVER_SSL (#16290) 1a189278944d030211f336e103e96b65f976c361 e0539eb6aed346d4b25a6ea019044e88771e7690 2025-09-26T18:35:42+02:00 Aleksander Grygier Allow viewing conversations even when llama server is down (#16255) d0991da39d3c39b3980c24cdfccb9a4c95a46870 aa719c2f886c445b78113bf1e5849f1fce4124a7 2025-09-25T11:36:47+02:00 Daniel Bevenius server : add support for external server for tests (#16243) c498fc82fe5b83fc8c6e1627286bdc1f93caddbf e7a5130a20cf45a3358308356c249734ca982143 2025-09-25T10:20:02+03:00 Radoslav Gerganov rpc : use ggml logging facilities 4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915) 5c6106a696af2b00ce01d14ba525979d5a32b199 ec65fb52f0cc890e5085a6c5995ab08a156265fb 2025-09-22T10:58:02+03:00 Georgi Gerganov contrib : update roles (#16113) 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059) 459c0c2c1a400f960d7b8e8d94d31a8426f80986 be79d9fdd95ab8955527c4aaa67b90e8b9516718 2025-09-20T07:56:30+02:00 Benni server: fix SSE and OpenAI compatibility for error messages when streaming (#16109) be79d9fdd95ab8955527c4aaa67b90e8b9516718 f432d8d83e7407073634c5e4fd81a3d23a10827f 2025-09-19T15:15:21-07:00 ssweens llama-bench: add --devices and --list-devices support (#16039) 246c0d9c795fb25da8268625d597580155a3672f 3edd87cd055a45d885fa914d879d36d33ecfc3e1 2025-09-18T23:07:18+02:00 Adrien Gallouët cmake : fix static linking for OpenMP on Unix-like systems (#16031) 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 703f9e32c4eb3166f8d63007c26e31a1466c21af 2025-09-18T16:22:50+01:00 Eric Curtin Add resumable downloads for llama-server model loading (#15963) 2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 e58174cecbc45bf79bf653cd2c984395940c6ef4 2025-09-18T13:36:57+03:00 Radoslav Gerganov server : include usage statistics only when user request them (#16052) 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 a7a98e0fffed794396b3fbad4dcdbbc184963645 2025-09-17T20:38:12+03:00 Georgi Gerganov metal : refactor + optimize v2 (#15995) 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 77475530b8bbea3bf578632507e1284cdfe2c8c0 2025-09-16T16:17:08+02:00 jacekpoplawski llama-bench: add --n-cpu-moe support (#15952) b907255f4bd169b0dc7dca9553b4c54af5170865 28c39da7c645185ade5436767929d7ec33006033 2025-09-15T19:51:35+03:00 yael-works SYCL: Add COUNT_EQUAL operator support (#15991) 6c019cb04e86e2dacfe62ce7666c64e9717dde1f 9dcd200d57bc6f05a59a6a8df361d5d183af4124 2025-09-14T21:17:04+02:00 Sigbjørn Skjæret server : only attempt to enable thinking if using jinja (#15967) 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 2025-09-13T07:49:49-07:00 Diego Devesa llama : allow using iGPUs with --device (#15951) 4bf5549269d99bac936a65892da2312cc71b2421 f4e664f838cc65d89fa845c48c372e43852112e4 2025-09-12T16:31:50+01:00 Eric Curtin Add docker protocol support for llama-server model loading (#15790) f088b6a84f6aed0abb619dbb9d375e726fc888a6 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 2025-09-12T17:02:55+03:00 Georgi Gerganov server : adjust prompt similarity thold + add logs (#15913) 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 2025-09-12T13:24:21+02:00 Ruben Ortlam Vulkan iGPU device selection overhaul and PCI ID API support (#15947) e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850) 88021565f08e0b7c4e07ac089a15ec16fae9166c 56920f56651908d5cce7a310dabf54ac4f6fbb7f 2025-09-08T10:59:48-04:00 Jesse chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533) 56920f56651908d5cce7a310dabf54ac4f6fbb7f b0d52998b962bd2681c34bf52af993af79f178b8 2025-09-08T21:50:05+07:00 Xuan-Son Nguyen server : bring back timings_per_token (#15879) 3b15924d71237a43bb5ad71f5b885ee66a821342 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a 2025-09-07T10:19:45+02:00 Daniel Bevenius ggml WebGPU: remove userdata from request adapter callback (#15527) 3c3635d2f20424d557b5b0605a2a356214ffe048 61bdfd5298a78593be649a1035ee2a120b13c4f0 2025-09-06T19:45:24+07:00 Xuan-Son Nguyen server : speed up tests (#15836) 61bdfd5298a78593be649a1035ee2a120b13c4f0 01806e77714ae8a78130d432945b959a0956c56f 2025-09-06T18:35:04+07:00 Xuan-Son Nguyen server : implement prompt processing progress report in stream mode (#15827) fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327) 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404) dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side 5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801) c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763) a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c badb80cadbc40e047b30c43611aba575fc8d6845 2025-09-04T11:50:23+02:00 Xuan-Son Nguyen server: add exceed_context_size_error type (#15780) 8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761) 0d161f021aa33ec0e90cce96f5d1a88925557327 4efd5a83163ff383285b3a4c2106feabf5c69557 2025-08-31T20:11:58+03:00 Georgi Gerganov server : enable /slots by default and make it secure (#15630) d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 3d16b29c3bb1ec816ac0e782f20d169097063919 2025-08-30T00:12:53+02:00 Sergey Alirzaev server : removed obsolete doc (#15670) 792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 81017865ee444cf49ce0136f2be1e41a0270ff91 2025-08-29T19:25:40+02:00 ExtReMLapin server : add documentation for `parallel_tool_calls` param (#15647) c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638) 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693) fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 da54f9f1a2db07aaae390024ac466e7867685d94 2025-08-27T20:58:09+02:00 Johannes Gäßler server: higher timeout for tests (#15621) 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev 5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557) 611f419cff11e4952228162a1c44cb35dff2274a b1afcab804e3281867a5471fbd701e32eb32e512 2025-08-23T13:16:17-05:00 Jeff Bolz vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281) 4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108) cd36b5e5c7fed2a3ac671dd542d579ca40b48b54 3f196be84b1376945737163e35a91e29e3e24d2f 2025-08-21T19:13:45+03:00 Georgi Gerganov llama : remove deprecated llama_kv_self API (#15472) 245be739df942861ddc52331b095b40f18e2a3f1 b2caf67db1208fd38a0570785c39f7370d906d8a 2025-08-21T11:47:52+02:00 Copilot ci : add copilot-instructions.md (#15286) 1b0db8f6e08951969e2447c2d18bf638effb8f75 29f538ac630d6544406a0702476e36808a6bd1b3 2025-08-21T07:19:22+02:00 stduhpf server : fix webui (#15462) 1bc664a26a1d93a48baf2483a7ff95291ca8bcb8 13aeb7aef284daed4ad07dc14b4b3e2a42b5ea97 2025-08-21T07:10:08+09:00 teo server: fix OpenAI API compatibility for usage statistics in chat streams (#15444) 1a99c2d948209d9ea5eac8b6dc0a297107244540 37f10f955f70e0158d50343d0b9a3f92d194daae 2025-08-20T18:32:05+08:00 xiaobing318 cmake : fix target include directories (#15450) d2fcd91cf96b46f4485ce46b4e3a32bf0df37715 a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 2025-08-19T16:46:37+03:00 Georgi Gerganov server : disable context shift by default (#15416) 9d262f4bad0d37838100133537aaf0a83835ed12 f0d3c7405c323784a60f14ddddfbac3f7404d417 2025-08-19T08:45:26+03:00 Georgi Gerganov server : remove swa_full warning (#15399) d1d82416006e7ff41780cb0e9b5f28d30a267497 618575c5825d7d4f170e686e772178d2aae148ae 2025-08-18T16:51:42+02:00 davidef server : fix incoming tasks not process in order (#15395) e5155e698645242d4f019267ecc40ea9bad81b09 21c17b5befc5f6be5992bc87fc1ba99d388561df 2025-08-17T18:28:58-04:00 Oleksandr Kuvshynov server : export max observed n_past value (#15361) de2192794f4e8e04f2e8167ef2424905145e88fc 2e2b22ba6607414a5d619ac6d2f034b5b02214e5 2025-08-16T04:18:31-05:00 Jeff Bolz vulkan: Support mul_mat_id with f32 accumulators (#15337) ff27f80a74bbe5303acd511a6781a1de6d619b3c d3248d9b6557c75d59954c594bb53cf517591e91 2025-08-15T21:11:22+08:00 Aaron Teo ggml: initial IBM zDNN backend (#14975) 5ba36f61033d2819be27e2abb70e9a3bd20c0fde b204a5a234f4cf0b3f449476da639a5510c6d157 2025-08-14T16:23:56+02:00 uvos HIP: Cleanup hipification header (#15285) b204a5a234f4cf0b3f449476da639a5510c6d157 646944cfa8961afd914dd6637739b3cda9a72e11 2025-08-14T09:23:11-05:00 Aldehir Rojas gpt-oss: implement harmony parsing (#15181) d32e03f4495d3efa1c5126f53b449f1d429c5664 3973163bff40f7f5161b0f08a0011729e2b0406a 2025-08-14T14:59:50+03:00 Georgi Gerganov server : add SWA checkpoints (#15293) b3e16665e14032d1276f9d0263acef8321b6f518 c24f4e26883a91219af5acfaf1471ca7ef582683 2025-08-13T15:43:00+02:00 Sigbjørn Skjæret server : enable -td and -tbd parameters (#15172) e885445bc1719d2e289a9b2e11714e0f994e68be 648ebcdb739abfb5a9be14f4c5c0fd19ff268ef0 2025-08-13T05:28:21-05:00 Aldehir Rojas server : filter out harmony thought messages (#15278) 07aa869a91837d95fcb5612c65a188763ac38647 00f35d509e5367bf19ccaf4b4adddc38db4811c6 2025-08-13T11:30:45+02:00 Sigbjørn Skjæret ci : add more python requirements to copilot-setup-steps (#15289) 6028bf74351d35a06bd98498624f8c2f029f7d1a bc5182272c373267352bc689e5fca276934bea2d 2025-08-13T10:04:46+02:00 Oliver Simons CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132) 53d0a1265826f40c5dbc01d06aeab9e14fcbd69b 27093afe78912494073eb043fec93a007e49653c 2025-08-11T14:48:41+02:00 Xuan-Son Nguyen server : allow specifying reasoning_format in HTTP request (#15238) cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a 50e81bdf5db563ab57a9a722b08f96fa8a76c927 2025-08-11T11:21:19+02:00 Daniel Bevenius kv-cache : log (debug) all streams in find_slot (#15176) 4850b52aedceeb70bb4fe49f2d7cd1df6ee98682 cd6983d56d2cce94ecb86bb114ae8379a609073c 2025-08-08T23:04:36+02:00 Johannes Gäßler server-bench: external OAI servers, sqlite (#15179) 36d3f00e142696f708ab297b9f8f1c825594712d 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 2025-08-07T05:31:48+02:00 Daniel Bevenius requirements : fix PyTorch uint64 compatibility (#15134) c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API f906275537d14c8fc7c6976d944233771fd6672c a9f7541ec25c4c8547daf5ff48700ad2836e2b7d 2025-08-02T10:12:41+02:00 Johannes Gäßler server: enable token array inputs for OAI API (#15001) 94933c8c2eeaa9a7983e3f6c08af76bd86724094 c1dacaa99b4ead6edbac928cd2da59436573f6b0 2025-07-31T05:25:23-07:00 g2mt server : implement universal assisted decoding (#12635) a9f77a8be348deeb11fb3d54d412bf583003c90d 8a4a85627702b569d7d2810f2de06a4321656e9d 2025-07-31T14:08:23+02:00 Lukas Straub server : add openai-style logit_bias support (#14946) 41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964) 00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961) bbd0f917797e9d524680f1b30d34a46eb06d7651 0a5036bee9cfb946870689db4400e9e0d17844c9 2025-07-29T10:40:50+02:00 Johannes Gäßler server-bench: make seed choice configurable (#14929) c556418b600ad5792440942079d93e393595688b db16e2831c0f344f041af3d067db81c42b16eb22 2025-07-28T18:59:04+03:00 Radoslav Gerganov llama-bench : use local GPUs along with RPC servers (#14917) f1a4e72de5950ab7136aeadddd675caf30dd6b3f 4762ad7316dcdec20016ab5985fb46a27902204d 2025-07-27T04:05:34-05:00 Jeff Bolz vulkan: skip empty set_rows to avoid invalid API usage (#14860) 793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743) c12bbde37258c6d053322d1cedd4a9672109ae58 3f4fc97f1d745f1d5d3c853949503136d419e6de 2025-07-25T01:07:26-07:00 Diego Devesa sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855) 3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498) adef81781a15083f218eae6c488b95cdad781971 48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245 2025-07-22T09:24:22+08:00 Molly Sophia server : allow setting `--reverse-prompt` arg (#14799) b4efd77f8ab407836ca73a5176f041650c5b2411 2be60cbc2707359241c2784f9d2e30d8fc7cdabb 2025-07-21T09:24:51+02:00 IsaacDynamo server : add parse_special option to /tokenize endpoint (#14783) 2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 2025-07-18T17:33:41+03:00 Georgi Gerganov parallel : add option for different RNG seeds (#14757) 086cf81e88fb75287b71ff19c08a206b7bc2e02f d9b691081c04ec5fb0daa9d2b979f915c142963d 2025-07-17T09:22:11+02:00 Tarek Dakhran llama : fix parallel processing for lfm2 (#14705) 225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 ab140198211385b85eeeb0abd549a4bbe259e10d 2025-07-16T16:35:42+03:00 Georgi Gerganov llama : add high-throughput mode (#14363) 6ffd4e9c442e99afac3d138543ebf86d5fc5ee03 e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 2025-07-16T14:04:12+03:00 Georgi Gerganov server : pre-calculate EOG logit biases (#14721) e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 538cc77f7f44dfa047dba6a06d90c86dda69cf1d 2025-07-16T19:12:22+09:00 Shunta Saito llama : fix parallel processing for plamo2 (#14716) 538cc77f7f44dfa047dba6a06d90c86dda69cf1d 5cae76654113160f691f581930b69fc5535e8159 2025-07-16T12:13:57+03:00 Georgi Gerganov server : fix handling of the ignore_eos flag (#14710) 5cae76654113160f691f581930b69fc5535e8159 4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 2025-07-16T09:33:28+02:00 Johannes Gäßler scripts: synthetic prompt mode for server-bench.py (#14695) 79e0b68c178656bb0632cb8602d2940b755077f8 c81f4192f91a1e209c1eec7a84fe5371ef9175da 2025-07-16T12:00:42+08:00 Min-Hua llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708) 494c5899cb76859f32ddd913534f2685fd684a3d 0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e 2025-07-14T13:14:30+02:00 Johannes Gäßler scripts: benchmark for HTTP server throughput (#14668) 0c1df14b5f8d992805cb22d0b77b44092a18aeab b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 2025-07-12T06:21:02-04:00 Douglas Hanley server : fix pooled embedding output (#14645) 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550) 4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531) 04655063c47af6cbced295c8c7ad369402b15300 20b7bf8a32259ad9189a4797fd3e3a859c537b99 2025-07-09T12:03:49+04:00 ibrahim khadraoui model : add support for Falcon-H1 family (#14534) 17a1f0d2d407040ee242e18dd79be8bb212cfcef 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 2025-07-08T11:47:33+03:00 Alawode Oluwandabira server: Add ability to mount server at prefix (#14544) ddef99522d1ba74193b7394e803fab8db5c78bae 668168814601d2aef6161ce49ab186bc74177ae7 2025-07-05T09:17:14+02:00 Sigbjørn Skjæret server : fix assistant prefilling when content is an array (#14360) a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 9067487c4411efb20400103fcccfdd389c80d428 2025-07-03T10:53:35+03:00 Georgi Gerganov kv-cache : use ggml_set_rows (#14285) c839a2da1a0d4275c3a98f70c3a7627487573a46 e9b6350e61d592634263a14b3d77ecbf6c1fb096 2025-06-30T17:48:24+08:00 xiaobing318 cmake : Remove redundant include path in CMakeLists.txt (#14452) caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 83790b0e7e09ab17238b16452a33053a71dbdfad 2025-06-29T20:02:53+02:00 matteo server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196) 83790b0e7e09ab17238b16452a33053a71dbdfad f47c1d7106e49062279bcc57fc1077c0db61e278 2025-06-29T19:29:57+02:00 Renat server : fix appearance of the chats list context menu for Safari (#14322) bd9c981d7226107f18deb8344c3301450311bb8b 27208bf657cfe7262791df473927225e48efe482 2025-06-29T02:43:36-05:00 Jeff Bolz vulkan: Add fusion support for RMS_NORM+MUL (#14366) 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following: 1b809cee225222094a0ff5be8467240487ce4ae4 abf241045d09cad70dc797b0fba393ad09ee2cbe 2025-06-24T08:59:11Z Nigel Bosch server : move no API key doc to /health (#14352) 901e20bbe571fbde48d13eb188f4e7cdc7562fb6 0142961a2e67909e33cdf410274b56c08c5dce7a 2025-06-24T02:17:58-04:00 Bartowski jinja : Add Mistral-Small-3.2-24B-Instruct-2506.jinja (#14349) 8308f98c7fb778e54bf75538f5234d8bd20915e9 6369be07359d03723f38c0a4a014ff0f698a0738 2025-06-20T15:07:21+02:00 Nicolò Scipione sycl: add usage of enqueue_functions extension (#14244) d67341dc18fc5cc63362880ab2f8f9ecfc7932e7 456af35eb70177b8dd5779b6d4c21bb020f9cebd 2025-06-19T16:01:03+03:00 aa956 server : add server parameters for draft model cache type (#13782) edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979) 89fea80d298184d1cd93564f48e060d9f541f4b4 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 2025-06-16T22:33:27+03:00 Georgi Gerganov server : fix incorrect usage of llama_get_embeddings() (#14225) d3e64b9f490cee41b7b9aa275dae2f6568ae3054 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb 2025-06-16T14:14:00+03:00 Georgi Gerganov llama : rework embeddings logic (#14208) cd355eda7df1898d25d433b4bdaa4b4b479e0bad 30e5b01de2a0bcddc7c063c8ef0802703a958417 2025-06-15T23:36:22+02:00 Eric Curtin server : When listening on a unix domain socket don't print http:// and port (#14180) c311ac664d68d10781a3e7b9f02d9d9520837d80 b9912ac570de8945ae9383c9ca8291027bf287dd 2025-06-15T10:08:58+03:00 Georgi Gerganov cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188) 3cb203c89f60483e349f841684173446ed23c28f 2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f 2025-06-14T18:25:15+02:00 Piotr llama-chat : Do not throw when tool parsing fails (#14012) ffad04397399ea1650fda6560c7c753059804876 0889eba570126f8a2f5a0e88fde776bbc91cca66 2025-06-13T11:18:25+03:00 Georgi Gerganov server : fix SWA condition for full context reprocess (#14163) c61285e7396c8e526fe7794c19e8d4f1c99bfc51 09cf2c7c655c90e53e100f29b830a788bab0653d 2025-06-13T08:45:37+01:00 Ewan Crawford SYCL: Bump oneMath commit (#14152) 7d516443dd7766569110b38e6374649bee6eb1c4 f6e1a7aa8787b5c00acba6370cb70a0beff48b1e 2025-06-12T11:51:38+03:00 Georgi Gerganov server : re-enable SWA speculative decoding (#14131) 2baf07727f921d9a4a1b63a2eff941e95d0488ed 7ae2932116a4de3141cbc8c488f7f6e4e06d8171 2025-06-11T06:43:43-04:00 Taylor server : pass default --keep argument (#14120) 1f7d50b2936023b26eb218e944e62834b80a2ce0 4c763c8d1b4d4de20bf364ec1837430783cba984 2025-06-11T00:19:25-05:00 Jeff Bolz vulkan: Track descriptor pools/sets per-context (#14109) dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834) 2bb0467043258bdc58dbaefb33786f1731b38937 b8e2194efc529378be45ab9b27d6648a5b81458a 2025-06-10T02:41:01-04:00 Isaac McFadyen rpc : nicer error messages for RPC server crash (#14076) 87d34b381d5868e75586210ec17b5ef5deddc276 b460d16ae858c6624fd37aec316622a4060ca325 2025-06-09T12:57:58+03:00 Georgi Gerganov server : fix LRU check (#14079) 228f34c9ceefa3ea4f4d6933edd858121e8106cb 0974ad7a7cd4bca846b15c484ff3be890135a52c 2025-06-07T18:58:20+05:30 Akarshan Biswas SYCL: Implement few same quantized type copy kernels (#13739) 745aa5319b9930068aff5e87cf5e9eef7227339b 487a5e0401423bba02cd6e97e4d45131bb20b22b 2025-06-06T14:11:15+03:00 Georgi Gerganov llama : deprecate llama_kv_self_ API (#14030) 7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748 3a077146a4761fdbd24bdd8eb098f46b8adc4dda 2025-06-05T15:29:22+03:00 Georgi Gerganov memory : migrate from llama_kv_cache to more generic llama_memory (#14006) 363757628848a27a435bbf22ff9476e9aeda5f40 ea394d7ab1f8101716d48ce9421c94c71b93a00f 2025-06-02T21:34:40+03:00 Georgi Gerganov server : disable speculative decoding for SWA models (#13970) c9bbc77931d223ed7e7cbcf1cb057bc02fd0db19 bfd322796cd838f906535ff3352624fc46338894 2025-06-02T10:15:44-07:00 Olivier Chafik `server`: update deepseek reasoning format (pass reasoning_content as diffs) (#13933) c04621711a893cbd09cff6c927cb005bc6749e36 0fc16b42e8793364918e830c234c1f3caec29dae 2025-06-01T11:42:16+03:00 Georgi Gerganov parallel : fix n_junk == 0 (#13952) e15898d1c7e87f1b3d14e0a3c385eeb424b085fe 803f8baf4f741d2f0465c46c33f285886b97a071 2025-05-31T08:26:10-07:00 Olivier Chafik server: allow unclosed thinking tags (#13931) 12d0188c0dc6146ffde6d277a93f232ccbe699f8 eb3949938e82a128855bc0676220bb2ce6e4228d 2025-05-31T10:24:04+03:00 Georgi Gerganov kv-cache : refactor + add llama_memory_state_i (#13746) dd665cc9d4b378626cde11ea0c4c91f514fdc994 df0c0c7d02f951dc639d48fd536f79200460ac83 2025-05-30T19:38:07+03:00 Georgi Gerganov parallel : increase the variability of the prompt lengths (#13927) 53f925074de02c5304b00c14b4d6d8910c58667d db38704f0133be7832123495fa8fc2601ea999d4 2025-05-30T16:25:45+03:00 Georgi Gerganov sync : vendor (#13901) 10961339b26bd2eff01d5479e8879f435da261b7 d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef 2025-05-28T22:35:22+02:00 Xuan-Son Nguyen mtmd : move helpers to dedicated library (⚠️ breaking change) (#13866) c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853) 952f3953c1b61cc70e79e536c42ddce6a5ea5ea7 81713121ee56755ba4a147d1a1e3fa248ec31a66 2025-05-27T04:05:18-07:00 Diego Devesa ggml : allow CUDA graphs when using pipeline parallelism (#13814) cdf94a18023c92f41808ec874ba577d914674717 a26c4cc11ec7c6574e3691e90ecdbd67deeea35b 2025-05-26T14:34:27-07:00 Olivier Chafik server: --offline mode (#13804) 03f582ae8fccecff225c30a2802461b44761e822 88c125f2acce0e25e5fc8481ab0681415fc64a10 2025-05-26T08:03:57-07:00 Olivier Chafik server: fix streaming crashes (#13786) d74e94c1b3ac02db01e47008e1f8d371029d81ac f13847cfb560d92492b480cca2c5d6aa9473cde3 2025-05-26T06:56:49-07:00 Olivier Chafik `server`: fix format of streamed tool call deltas (diff name, fix id location) (#13800) f13847cfb560d92492b480cca2c5d6aa9473cde3 79c137f77677b3c8ee3c60a7da033721b938399a 2025-05-26T06:16:37-07:00 Olivier Chafik server: fix regression on streamed non-chat completion w/ stops (#13785) e121edc4324a640be11b7e567edd39b721b0f8e4 2f099b510f460374acd52742b494595e3e3442d3 2025-05-26T00:30:51+01:00 Olivier Chafik `server`: add `--reasoning-budget 0` to disable thinking (incl. qwen3 w/ enable_thinking:false) (#13771) de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac c508256db2de2b032e19c8ed833f4683c827c9a1 2025-05-25T16:34:36+03:00 Georgi Gerganov kv-cache : rework kv_cell (#13706) d785f9c1fd1a1929c6d0e2a0b12cae5db867908b 4032ca406632212b075e3c61c2a4476128321410 2025-05-25T10:45:49+01:00 Olivier Chafik server: fix/test add_generation_prompt (#13770) f5cd27b71da3ac375a04a41643d14fc779a8057b a2d02d5793fd9af7a7224773456501691b95fd02 2025-05-25T01:48:08+01:00 Olivier Chafik `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379) 9ecf3e66a38f20e41d221f62f05b17f70d040839 faaaff5f947064d13ef8b98659d81a1384c3e57b 2025-05-23T11:03:47+02:00 Xuan-Son Nguyen server : support audio input (#13714) 797990c4bca0dca5be295c63e3fb2800dc0a69c2 ab86335760ebb441574eb47f886fa1ee302e2131 2025-05-22T20:42:48+02:00 Xuan-Son Nguyen mtmd : add ultravox audio input (#13623) cc74d5be990e37f201591fd868a92e64abdbf902 5be24af73d77ea23d399726f1d2a01a70ee86331 2025-05-22T16:33:39+03:00 Georgi Gerganov server : pad small embedding batches (#13692) 5fbfe384d4659f81c47a477eb8ee97692c7ffef9 c76532e7ba128bb097bf6836bf0f5592e1b56b76 2025-05-21T19:46:56+03:00 Georgi Gerganov server : improve error reporting (#13680) c76532e7ba128bb097bf6836bf0f5592e1b56b76 2aa777d86d3f7bb80b93e226f1c25e47825f6a83 2025-05-21T19:40:35+03:00 antichristHater convert : add qwen2vl support for unsloth merges (#13686) 0d5c74216170ef97e5e7511563837263f2d1a496 42158ae2e8ead667a83f07247321ce85f32ace66 2025-05-21T15:15:27+02:00 Robin Davidsson server : Add the endpoints /api/tags and /api/chat (#13659) 42158ae2e8ead667a83f07247321ce85f32ace66 797f2ac0625b22edeff03cc30e0f988da6b6b068 2025-05-21T16:07:57+03:00 Dorin-Andrei Geman server : fix first message identification (#13634) a4090d1174aed22dde5cacce2a4c27656b987a2f b69f1647f9953cb3773266d2c83a92fd0e7e6d66 2025-05-20T16:13:16+03:00 Georgi Gerganov llama : remove llama_kv_cache_view API + remove deprecated (#13653) e298d2fbd082a52c0f6ed02729f94e9bf630cf17 f0adb80bf7c2c0d80abb04f4533b5513622d9964 2025-05-20T08:05:46+03:00 Georgi Gerganov kv-cache : add SWA support (#13194) f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c d30cb5a7fa17362c47e94a023276f169916e0d03 2025-05-19T11:46:09+01:00 Alberto Cabrera Pérez ci : upgraded oneAPI version in SYCL workflows and dockerfile (#13532) 6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9 2025-05-17T17:59:48-04:00 Isaac McFadyen server : added --no-prefill-assistant flag (#13608) 518329b2d4434d0683c30b741b4f4cf5734b5f99 2f5a4e1e09567e09be8b84a5f976334de9539d17 2025-05-17T12:58:55+03:00 Georgi Gerganov parallel : add option for non-shared and larger prompts (#13598) 6aa892ec2aa7fe0c93e87c4b970d83a942fb9454 aea9f8b4e73876739bf88fb705502f291294e469 2025-05-16T21:50:00+02:00 Xuan-Son Nguyen server : do not return error out of context (with ctx shift disabled) (#13577) 3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562) c753d7bed0dc2cc2d5c42dfa9806cba91748392e b2838049ccf50859cea4c390e81405c2fb01e820 2025-05-15T08:40:58+02:00 Piotr Wilkin (ilintar) server : proper error handling for missing elements in messages array (OpenAI compatible backend) (#13540) aa48e373f256df9608395ee6881e7010840d6202 e3a9421b78da5c810d812e6348a405f5acc39f34 2025-05-15T02:39:51+01:00 Olivier Chafik `server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802) 053174436f3b3cbb01077f26ff17809537b832c7 360a9c98e13d35f322b4c5b1309aab0cc90ed82b 2025-05-14T15:42:10+03:00 Georgi Gerganov server : passthrough the /models endpoint during loading (#13535) 360a9c98e13d35f322b4c5b1309aab0cc90ed82b 09d13d94fb169093095416ac6323551c37b75339 2025-05-14T13:35:07+02:00 Xuan-Son Nguyen server : fix cache_tokens bug with no cache_prompt (#13533) d486dd3e8ecfba0170f8632a1530540de560f4a3 21ca987fba504d273ea28ebc4d3e5b3736a11c8e 2025-05-14T10:07:31+02:00 Luca Stefani webui: Allow pasting file from clipboard (#13526) 71bdbdb58757d508557e6d8b387f666cdfb25c5e f0995d28ce3d15095b6845d94ce4465e46575873 2025-05-13T17:07:21+02:00 Xuan-Son Nguyen clip : clip.h become private API (⚠️ breaking change) (#13510) 91159ee9df84edb72ccf874e353d2414f3a8c60d 22cdab343b63edd0906f1c132616746085f81983 2025-05-12T18:56:42+07:00 Anudit Nagar server : allow content to be null in oaicompat_completion_params_parse (#13477) 9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1 09232370fc6426aa5dd9be01a8271b9c28f5af3a 2025-05-11T11:08:26-04:00 Anthony Umfer tools : fix uninitialized llama_batch in server (#13436) 3b24d26c22b9d92b5aa39930988700c84e524cf4 43dfd741a5da77982e0a94d1e522a2481dfb914d 2025-05-10T18:44:49+02:00 Xuan-Son Nguyen server : update docs (#13432) 33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898) b486ba05bf973aae3652b3fd593e0b257d3a41d4 02115dcd9a6d0c03b527d5bee8c1493ab819ddbd 2025-05-09T10:31:07+03:00 Radoslav Gerganov rpc : add rpc_msg_set_tensor_hash_req (#13353) d9c4accaff30926e8a5fd8a2429e549158a845e0 15e03282bb432631193464100c2237a3b6bcfe4c 2025-05-09T09:06:37+02:00 Xuan-Son Nguyen server : (webui) rename has_multimodal --> modalities (#13393) ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 8c83449cb780c201839653812681c3a4cf17feed 2025-05-08T18:51:45+02:00 Xuan-Son Nguyen server : (webui) fix a very small misalignment (#13387) 8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365) 233461f8121455f957a47e6a22a77b3bc88277b0 b34c859146630dff136943abc9852ca173a7c9d6 2025-05-05T17:12:19-03:00 oobabooga sampling : Integrate Top-nσ into main sampling chain (and add it to the server) (#13264) b34c859146630dff136943abc9852ca173a7c9d6 9b61acf06041dcbaff6afa5f28940e93297f8520 2025-05-05T17:03:31+03:00 igardev server : Webui - change setText command from parent window to also send the message. (#13309) 27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184) fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 dcf886007de4b8e5200f461a13233315f897fb9d 2025-05-02T09:48:31+03:00 Georgi Gerganov server : add cache reuse card link to help (#13230) e2e1ddb93a01ce282e304431b37e60b3cddb6114 d9d398f84f96d16c308d4976f5e90222ecc2a492 2025-04-29T20:33:10+02:00 matteo server : Prefilling assistant message in openai compatible API (#13174) 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069) 77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba d5fe4e81bd447124836ecfb47d794f8768665b9f 2025-04-26T22:05:31+08:00 SXX ggml: move fp16/bf16 conversion optimizations to CPU backend + export conversion APIs (#13107) ab47dec3d37aa1927c2ec590e166b76141374ed3 7b53389c24a507564be39e1ea82746a39749059b 2025-04-22T16:16:10+03:00 Georgi Gerganov security : add note about RPC and server functionality (#13061) 35370ba94593c3abc9550328377d461fc4f822b7 8d6600576318dfc6b091fca744b0fd36a5e5255f 2025-04-18T19:58:12+02:00 Xuan-Son Nguyen server : use std::move whenever possible (#12936) b9154ecff93ff54dc554411eb844a2a654be49f2 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2025-04-18T10:04:51+02:00 Xuan-Son Nguyen mtmd : add methods to access `mtmd_image_tokens` (#12906) 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2f74c354c0f752ed9aabf7d3a350e6edebd7e744 2025-04-18T10:13:42+03:00 Radoslav Gerganov rpc : add RPC_CMD_HELLO (#12955) c94085df2871d2cad11f6411304d7798d7dd4cdd e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca 2025-04-11T23:37:41+03:00 Georgi Gerganov server : add VSCode's Github Copilot Chat support (#12896) e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca b6930ebc421e20399663bbd3bc7b7266d5236d06 2025-04-11T13:04:14-07:00 yuri@FreeBSD rpc : Set cache directory in rpc-server.cpp on FreeBSD (#12903) 578754b3157d662c2fdd51eaa62b6c1f43d3172c b2034c2b55b36b2192bdefb3b295db2a911370f5 2025-04-11T15:32:14+02:00 Ewan Crawford sycl: Support sycl_ext_oneapi_limited_graph (#12873) 8b9cc7cdd8a0dcf0176c60c755322c95b5965299 64eda5deb9859e87a020e56bab5d2f9ca956f1de 2025-04-10T22:57:16+02:00 Xuan-Son Nguyen llava : introduce libmtmd (#12849) 64eda5deb9859e87a020e56bab5d2f9ca956f1de fe5b78c89670b2f37ecb216306bed3e677b49d9f 2025-04-10T17:24:44+02:00 Xuan-Son Nguyen convert : ability to lazy-load safetensors remotely without downloading to disk (#12820) a19b5cef16d885c44c635da4a5c97113c1577de8 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2025-04-08T19:54:51+03:00 Georgi Gerganov llama : fix FA when KV cache is not used (i.e. embeddings) (#12825) 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 2025-04-08T18:37:06+02:00 Xuan-Son Nguyen server : fix thread.join() on exit (#12831) 8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 656babd6c21a3b9b3622324cfcc80a2ab78da25b 2025-04-08T14:14:59+05:00 characharm server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785) b7723942970b70412793f1926a35cfb93d5c157c 23106f94ea2bc3da929afb7330655fd5515d08dc 2025-04-04T09:09:52-05:00 Nauful Shaikh server : webui : Upgrade daisyui, tailwindcss. (#12735) a10b36c91a091f4606710fba4e9327fd71e0e738 83a88bd6affbe148a622ac730952ac5b8b585979 2025-04-02T14:32:59+03:00 Georgi Gerganov llama : refactor kv cache guard (#12695) 3891e183c61c1e25c2c61afe68d7b95019ea3f89 af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 2025-03-20T07:02:18+01:00 Daniel Bevenius examples : command.wasm updates (whisper/2904) 5d01670266859444366e4f333ade5e0e5e2ae63d ef03229ff423dd1991f4f44ef1352f03334d86eb 2025-03-28T01:05:44-07:00 Benson Wong server : include speculative decoding stats when timings_per_token is enabled (#12603) 2099a9d5dbdcd2841d02dd396a71d0de70bf4490 296901983700f3c37449bcb555d85d27150a679d 2025-03-27T23:41:04+01:00 Piotr server : Support listening on a unix socket (#12613) 77f9c6bbe55fccd9ea567794024cb80943947901 18b663d8e4ef352a9a15ff15d695fc3258801d60 2025-03-23T19:30:26+01:00 Marius Gerdes server : Add verbose output to OAI compatible chat endpoint. (#12246) 517b5ddbf002b91fd6d6daf5d8db8c88a0173039 a9b59288e222f39fc0311dc66944ed5a86c815fa 2025-03-20T01:22:06+05:30 Gaurav Garg CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183) 810e0af3f50379682dd46b7967c4aadf3f8286f6 eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c 2025-03-18T12:05:42+02:00 Georgi Gerganov server : fix warmup draft cache type (#12446) 7dfad387e3f6ac98d383ded2d175eb59736a3993 60c902926c928f9c2cd6390ce411876f92feeaf3 2025-03-18T07:27:50+08:00 Molly Sophia llama: Add support for RWKV v7 architecture (#12412) b1b132efcba216c873715c483809730bb253f4a1 01e8f2138b2e40902afe2983ecbf503a08d74b1d 2025-03-17T23:55:13+05:30 Gaurav Garg cuda : enable CUDA Graph on CUDA Toolkit < 12.x (#12394) 8fcb563613e20a04dd9791f0a9b8a41086428c09 add2a3aa5a1571211aa5c7303b8e80c8d1824b91 2025-03-14T13:47:05+01:00 fairydreaming Load all MoE experts during warmup (#11571) add2a3aa5a1571211aa5c7303b8e80c8d1824b91 c522ce4143a2b5c277f1e5f65cd570dbd0626466 2025-03-14T11:21:17+01:00 Victor server: fix "--grammar-file" parameter (#12285) 2048b5913d51beab82dfe29955f9008130b936c0 f08f4b3187b691bb08a8884ed39ebaa94e956707 2025-03-13T06:10:05-04:00 Ishaan Gandhi server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338) 4e39a3c332f84b890e91353ec448502cb8373a6f be421fc429795d135786f5a0e489709220a9c43a 2025-03-10T10:59:03Z Olivier Chafik `server`: extract tags from qwq outputs (#12297) 1e2f78a00450593e2dfa458796fcdd9987300dfc 0fd7ca7a210bd4abc995cd728491043491dbdef7 2025-03-09T19:08:20+02:00 Georgi Gerganov server : add speculative decoding presets for FIM (#12287) 7ab364390f92b0b8d83f69821a536b424838f3f8 7c7f3b7f435f41f2508e0e3010f0013cd8335156 2025-03-07T20:54:30+02:00 Georgi Gerganov server : infill gen ends on new line (#12254) 8fad3c7a7c54a25a1ca38dfb08244df55288e675 7cf64f6beecf54c6ac71503181f154667fd4228a 2025-03-07T11:15:33+01:00 Sigbjørn Skjæret server : Log original chat template parsing error (#12233) 06a92a193a07afe445929607be9d5e4d033956fb a057897ad4e48e3df0354256e0cc80dadcb57595 2025-03-05T15:25:45+08:00 Clauszy server : fix cache reuse logic (#12161) 1a24c4621f0280306b0d53a4fa474fc65d3f1b2e becade5de77674696539163dfbaf5c041a1a8e97 2025-03-04T06:24:07Z Olivier Chafik `server`: fix deadly typo in response_format.json_schema.schema handling (#12168) 2679c3b55d1c9c3fed56dea00fea713622e42594 c43af9276b119dae7436b7878d59671d0f6b1a97 2025-03-03T16:17:36+01:00 Daniel Bevenius ci : set GITHUB_ACTION env var for server tests (#12162) 9660ffef582ca275092b621c87085a6eea136a90 c950a1f69269bff416d74349a82d78181ce6f0f8 2025-03-03T20:54:08+08:00 ag2s20150909 ggml : fix kleidiai build (#12159) 70680c48e5f77d2d3138712a6582bd8c1e548922 c43a3e7996e585e2addde1e44057a4f3cdbadef8 2025-02-28T05:41:47-08:00 William Tambellini ggml : upgrade init_tensor API to return a ggml_status (#11854) d7cfe1ffe0f435d0048a6058d529daf76e072d9c a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552 2025-02-25T18:52:56Z Olivier Chafik docs: add docs/function-calling.md to lighten server/README.md's plight (#12069) 401af80b546005a06854827b732e3b46979ae028 c132239bfbc1aae3a96dfee3350afcb491f64ade 2025-02-25T11:52:52Z rhjdvsgsgks server: handle echo=false on /v1/completions (#12060) 0b52745649062c04b546aab662cfdb220f4f0621 4d1051a40ffc2fdff80bc532eea5b9568b85c156 2025-02-25T10:40:22Z Olivier Chafik server: support add_generation_prompt query param (#12062) 3e9a2860e996657fc10db8393cf65adc40703082 58d07a8043a1395177cf77b3e4f388e34182ae64 2025-02-25T01:29:33-08:00 Vitali Lovich llama : expose llama_model_n_head_kv in the API (#11997) 7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794) cf756d6e0a314e0fe25ff944341d79ea8c94cc96 d70908421ff22b013e8209f2d12e5c750663c620 2025-02-22T12:46:31+02:00 Georgi Gerganov server : disable Nagle's algorithm (#12020) c392e5094deaf2d1a7c18683214f007fad3fe42b c5d91a74006c49376590ef2b67420bc7ce206397 2025-02-21T03:43:22+09:00 momonga server (webui): Fix Premature Submission During IME Conversion (#11971) d07c621393fab6cf32f3add2aa65e4d5331d4a67 abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 2025-02-19T12:29:52+01:00 Daniel Bevenius common : add llama.vim preset for Qwen2.5 Coder (#11945) b58934c1836b5ea51dbacbe899eee125775e77c9 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 2025-02-19T00:01:44+02:00 igardev server : (webui) Enable communication with parent html (if webui is in iframe) (#11940) 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 63ac12856303108ee46635e6c9e751f81415ee64 2025-02-18T18:03:23Z Olivier Chafik tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900) 63ac12856303108ee46635e6c9e751f81415ee64 5137da7b8c3eaa090476a632888ca178ba109f8a 2025-02-18T14:21:41+01:00 Xuan-Son Nguyen server : add TEI API format for /rerank endpoint (#11942) 09aaf4f1f5b69b5173b7fcd24eab96729f6b242a 73e2ed3ce3492d3ed70193dd09ae8aa44779651d 2025-02-18T17:12:49+08:00 xiaobing318 docs : Fix duplicated file extension in test command (#11935) c4d29baf3236b011730b6ccaae6852e781fb1b91 2eea03d86a2d132c8245468c26290ce07a27a8e8 2025-02-17T11:25:12+01:00 Antoine Viallon server : fix divide-by-zero in metrics reporting (#11915) 0f2bbe656473177538956d22b6842bcaa0449fab fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf 2025-02-16T18:11:22+01:00 Xuan-Son Nguyen server : bump httplib to 0.19.0 (#11908) f3552296924e704c11ca936907b9cad7873db8e2 fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88 2025-02-15T10:11:36Z Olivier Chafik server: fix type promotion typo causing crashes w/ --jinja w/o tools (#11880) c1f958c0381e797135b7d42a677542133264193c c48f630d1c1942fce08aa7cb18a53ace443cd611 2025-02-13T17:22:44+01:00 Reza Rahemtola server : (docs) Update wrong tool calling example (#11809) c48f630d1c1942fce08aa7cb18a53ace443cd611 bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 2025-02-13T14:46:59+01:00 Daniel Bevenius llama : add --completion-bash option (#11846) c7f460ab882065ec5696e3d51e24dbf67b539287 27e8a23300e30cd6ff6107ce262acf832ca60597 2025-02-13T10:05:16Z Olivier Chafik `server`: fix tool-call of DeepSeek R1 Qwen, return reasoning_content (Command 7RB & DeepSeek R1) unless `--reasoning-format none` (#11607) e4376270d971cff7992bdb6c5412a739195b1459 3e693197724c31d53a9b69018c2f1bd0b93ebab2 2025-02-13T01:25:34-05:00 Oleksandr Kuvshynov llama.cpp: fix warning message (#11839) a394039db004c6ee00098250d160b5aa018c2314 be3bbd62153820ff6d358c817360927f429105c4 2025-02-13T01:02:38+01:00 Diego Devesa ggml-cpu : add chunking support to mul_mat_id (#11666) 31afcbee0eebbc998ab311aa314e389d60aa2127 5c4284d57bbc613121e90de5271f1cbc95d55872 2025-02-12T22:47:11Z Woof Dog server : (webui) Give copy button back to all message bubbles (#11814) a18f481f99962638092d6f1c98b1d34d3e3256de b9ab0a4d0b2ed19effec130921d05fb5c30b68c5 2025-02-11T14:06:45+01:00 Daniel Bevenius server : use common_token_to_piece instead of common_detokenize (#11740) 507f9174fe856772b6c7c17e81be442de7ee6d1e 19b392d58dc08c366d0b29bd3b9c6991fa4e1662 2025-02-10T21:23:17+01:00 Xuan-Son Nguyen server : (webui) introduce conversation branching + idb storage (#11792) 0893e0114e934bdd0eba0ff69d9ef8c59343cbc3 d7b31a9d84297b493a61c9a8ee3a458e7ccc64a7 2025-02-10T18:03:28+01:00 Xuan-Son Nguyen server : correct signal handler (#11795) 55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 e6e658319952f7ad269dc11275b9edddc721fc6d 2025-02-08T21:54:50+01:00 Xuan-Son Nguyen server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759) e6e658319952f7ad269dc11275b9edddc721fc6d aaa55053076f3d5d7da4d9a877cb77e112dabed4 2025-02-08T19:09:55Z Woof Dog server : (webui) increase edit textarea size (#11763) aaa55053076f3d5d7da4d9a877cb77e112dabed4 bdcf8b6a56f4d49d3420ae5b21cdf9a116040551 2025-02-08T18:08:43+02:00 Georgi Gerganov server : minor log updates (#11760) 0cf867160ca9d492e06c0bc688b337cffd1eb187 d2fe216fb2fb7ca8627618c9ea3a2e7886325780 2025-02-08T10:42:34+01:00 Xuan-Son Nguyen server : (webui) fix numeric settings being saved as string (#11739) 2d219b389e8c8c40bce547b08c8aa7add60fde1f 333820d7491cd31c707a340ff23b984a84e40154 2025-02-07T08:55:47-05:00 Christian Fillion vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729) 7ee953a64a40c09438b2064539becdbc577cefd0 ec3bc8270bc67b58955748d40a3e558a05b2d8f2 2025-02-07T04:33:27-05:00 Christian Fillion llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727) b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677) 1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19 2fb3c32a1634488a5265d1304ab37628eeb5480d 2025-02-06T09:29:13-05:00 Patrick Peng rpc: fix known RCE in rpc-server (ggml/1103) 2fb3c32a1634488a5265d1304ab37628eeb5480d 9ab42dc722ad19a12af80f38a06474d498f96da3 2025-02-06T17:32:29+01:00 Xuan-Son Nguyen server : (webui) migrate project to ReactJS with typescript (#11688) 902368a06b915b860236cfc97ff885b2aceae256 c3db0480bb820e120249014b380e1f4badf2a1c1 2025-02-05T19:52:31-06:00 Charles Duffy metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690) 3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e 1bef571f6a23c36a26dabacba631763f9a893b83 2025-02-04T18:25:42+01:00 Xuan-Son Nguyen server : add try..catch to places not covered by set_exception_handler (#11620) db288b60cb49eab69703f995379b8d75c18bf5b3 106045e7bb8db481bb2ebbc60e3b53cb27ada117 2025-02-04T15:48:53Z Olivier Chafik `tool-call`: command r7b fix for normal responses (#11608) f117d84b48104992ba16961b35a96fa93efbb355 534c46b53c23613628d72e93c63ea01ea4d1e2ac 2025-02-04T19:15:24+08:00 Jhen-Jie Hong swift : fix llama-vocab api usage (#11645) b3451785aca16fbf4214eeba7e4612676cdf8ccb 1d1e6a90bcf485ad2dee309c31cf19bd802465e5 2025-02-04T00:10:52+01:00 Xuan-Son Nguyen server : (webui) revert hacky solution from #11626 (#11634) 1d1e6a90bcf485ad2dee309c31cf19bd802465e5 5598f475be3e31430fbe17ebb85654ec90dc201e 2025-02-03T22:16:27Z Woof Dog server : (webui) allow typing and submitting during llm response (#11626) 5598f475be3e31430fbe17ebb85654ec90dc201e 8ec05832fa8409c49b3bbd13f957c6ae8486e618 2025-02-03T16:45:38+01:00 Daniel Bevenius server : remove CPPHTTPLIB_NO_EXCEPTIONS define (#11622) d92cb67e37abc23b1c6f7b0ef27a9889da8537e3 6eecde3cc8fda44da7794042e3668de4af3c32c6 2025-02-03T09:42:55Z mashdragon server : (webui) Fix Shift+Enter handling (#11609) bfcce4d693617ec843d0b2510f6ee16e6bc6720d 69804487e0b10f2c5c06316f0ac0eb6ada68433f 2025-02-02T09:25:38Z Olivier Chafik `tool-call`: support Command R7B (+ return tool_plan "thoughts" in API) (#11585) ff227703d6d6e1888bdc7af6138514092ffcdb96 0cec062a638700495673f5494d200b74340538be 2025-02-01T23:55:32-08:00 Michał Moskal sampling : support for llguidance grammars (#10224) a83f528688324a21484a97af1d1be5e1bc8d4c8e b1bcd309fc8ac929cbd4a6207b3a19886bda031f 2025-01-31T14:15:25Z Olivier Chafik `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539) 4a2b196d03d52da31236390e9f5694a88d43d11d 1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f 2025-01-31T08:12:40Z Olivier Chafik server : fix --jinja when there's no tools or schema (typo was forcing JSON) (#11531) a2df2787b32e0846205f7151dfad88ceab592beb 553f1e46e9e864514bbd6bf4009146db66be0541 2025-01-31T06:04:53+01:00 Daniel Bevenius server : update help metrics processing/deferred (#11512) 4314e56c4f8c5091f45732f39bd94c0c6c323798 496e5bf46bab757d05e18227cb4e17055ae42f42 2025-01-30T11:05:00+01:00 Daniel Bevenius server : use lambda instead of std::bind (#11507) 496e5bf46bab757d05e18227cb4e17055ae42f42 7919256c57f05c09b0b50ec9abb37ff62dab7251 2025-01-30T04:11:53-05:00 Isaac McFadyen server : (docs) added response format for /apply-template [no ci] (#11503) e0449763a4f335cca374254a72892141f41eaa59 eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 2025-01-30T05:48:14+01:00 Daniel Bevenius server : update json snippets in README.md [no ci] (#11492) eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 66ee4f297cff3c7ce98b31dbc0ce909d41b9e408 2025-01-29T12:45:44-06:00 Nigel Bosch server : add /apply-template endpoint for additional use cases of Minja functionality (#11489) e51c47b401f8cb5f21630a05171e2529cde4d186 2711d0215ff6a1ecb2202ac8c1f135bceed7057b 2025-01-29T16:34:18+01:00 Daniel Bevenius server : update auto gen files comments [no ci] (#11484) cf8cc856d7d02165bd08593b4757e1256a62d501 d0c08040b6c8bebeade7b8d5764df6cf901678d5 2025-01-28T16:03:42-07:00 peidaqi server : Fixed wrong function name in llamacpp server unit test (#11473) 49b0e3cec4b67dc9f4debe3a16acd4c819f751d6 20a758155bc5f37290b20ea44d76ba99c4e7f2cb 2025-01-25T16:36:44+01:00 Xuan Son Nguyen server : fix cleaning up stream task (#11418) c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4 564804b79b78df1469ec8646869972de5e885ec4 2025-01-24T09:02:38+01:00 stduhpf server : (webui) put DeepSeek R1 CoT in a collapsible
element (#11364) 58456616408c828a1ce6d2481940fd1c97bce3b5 f211d1dc10332b7e89a4abd1041903fa63bfed27 2025-01-23T13:56:05+01:00 Xuan Son Nguyen server : add more clean up when cancel_tasks is called (#11340) 12c2bdf2de34f747d13b270fc9d3b52490bf194f c64d2becb13f2a7c0145b516a05f028d949a046b 2025-01-22T17:44:40+01:00 Diego Devesa server : fix draft context not being released (#11354) 6171c9d25820ccf676b243c172868819d882848f e28245f35f2faaf249dd352998b3693a8cc28c51 2025-01-21T13:18:51Z Olivier Chafik Add Jinja template support (#11016) f30f099228f774209aa3010b78dfbe5d262e69aa f26c87417999209e7f4576b4f3ecf7a5b9c66a29 2025-01-18T14:12:05+01:00 Xuan Son Nguyen server : implement cancellable request (#11285) 0ccd7f3eb2debe477ffe3c44d5353cc388c9418d f446c2cf6a56a750b67c967505e717a996d2f2fd 2025-01-15T05:44:38+01:00 Daniel Bevenius examples : add embd_to_audio to tts-outetts.py [no ci] (#11235) c5bf0d1bd7eb8762edca47e0a95f64e6fbfaf5b1 091592d758cb55af7bfadd6c397f61db387aa8f3 2025-01-14T14:09:33+03:30 ebraminio server : Improve code snippets direction between RTL text (#11221) 504af20ee4eae72080a56d59d744f6774f7901ce 84a44815f704aaed8e8edec7a39e846a975c7ba9 2025-01-13T22:53:31+03:30 ebraminio server : (UI) Improve messages bubble shape in RTL (#11220) 437e05f714cdd67757405221578d3f95f8228b63 ca001f6656c1c3d29ef479b3aa5d669453e63be5 2025-01-13T17:16:39+03:30 ebraminio server : (UI) Support for RTL text as models input or output (#11208) afa8a9ec9b520137bbd1ca6838cda93ee39baf20 c05e8c9934f94fde49bc1bc9dc51eed282605150 2025-01-12T11:32:42+02:00 Georgi Gerganov llama : add `llama_vocab`, functions -> methods, naming (#11110) 8eceb888d7b7f5e93d20a4f85ca6511022b87040 f8feb4b01af374ad2fce302fd5790529c615710b 2025-01-09T11:28:29+01:00 Daniel Bevenius server : add tooltips to settings and themes btn (#11154) 53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f 017cc5f446863316d05522a87f25ec48713a9492 2025-01-07T18:01:58+01:00 Johannes Gäßler GGUF: C++ refactor, backend support, misc fixes (#11030) e6e7c75d94adf4d39e846d30807c531ff22865e7 09186fabbe05236f2b9446ba6c643cb737540d10 2025-01-06T15:36:08+02:00 Georgi Gerganov server : fix extra BOS in infill endpoint (#11106) 6369f867a410416239d9f20ec27c2b1d6a9fee52 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 2025-01-06T10:28:17+01:00 Daniel Bevenius llama : rename missed batch params/vars to ubatch (#10059) 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 2025-01-06T10:55:18+02:00 Georgi Gerganov llama : update llama_model API names (#11063) 2f0ee84b9b02d2a98742308026f060ebdc2423f1 0da5d860266c6928b8c9408efbd264ae59fedda6 2025-01-02T18:06:12+01:00 Pierrick Hymbert server: bench: minor fixes (#10765) 0da5d860266c6928b8c9408efbd264ae59fedda6 a45433ba209ee0b33d02c7dc4c31f29894ad83a6 2025-01-02T15:05:18+01:00 Xuan Son Nguyen server : allow using LoRA adapters per-request (#10994) 45095a61bfd164e87563a0dc0fbd7b0e9891590b 5896c65232c7dc87d78426956b16f63fbf58dcf6 2024-12-31T15:22:01+01:00 Xuan Son Nguyen server : clean up built-in template detection (#11026) 5896c65232c7dc87d78426956b16f63fbf58dcf6 bc7b1f86324279a3dabb705c04ad754a2b27df16 2024-12-31T12:34:13+01:00 Xuan Son Nguyen server : add OAI compat for /v1/completions (#10974) f865ea149d71ef883e3780fced8a20a1464eccf4 16cdce7b68218959e0658e2f95b4572573d5008e 2024-12-28T10:09:19-05:00 Isaac McFadyen server: added more docs for response_fields field (#10995) 16cdce7b68218959e0658e2f95b4572573d5008e d79d8f39b4da6deca4aea8bf130c6034c482b320 2024-12-28T15:08:54Z Alexey Parfenov server : fix token duplication when streaming with stop strings (#10997) 9ba399dfa7f115effc63d48e6860a94c9faa31b2 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 2024-12-24T21:33:04+01:00 Reza Kakhki server : add support for "encoding_format": "base64" to the */embeddings endpoints (#10967) 09fe2e76137dde850b13313f720e7ffa17efdefa 30caac3a68a54de8396b21e20ba972554c587230 2024-12-24T19:39:49+03:00 NeverLucky server: allow filtering llama server response fields (#10940) 14b699ecde8f1e9e251ebff9eca39ebc5603b83b 485dc01214f266afff7004bc702498b491abc404 2024-12-23T12:52:25+01:00 Xuan Son Nguyen server : fix missing model id in /model endpoint (#10957) 485dc01214f266afff7004bc702498b491abc404 86bf31cfe684849157f0875b4f0ebccac7034547 2024-12-23T12:02:44+01:00 Xuan Son Nguyen server : add system_fingerprint to chat/completion (#10917) 86bf31cfe684849157f0875b4f0ebccac7034547 b92a14a841fb4dfaf27b29d982ec8ba5289a3bff 2024-12-23T10:39:30+02:00 Radoslav Gerganov rpc-server : add support for the SYCL backend (#10934) 0ca416c91aea4549d9c77e3efeca403e15aa6c75 21ae3b9be83820565d1a720999b7f63ce95b4920 2024-12-20T14:12:06+01:00 Xuan Son Nguyen server : (UI) fix copy to clipboard function (#10916) 57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e a3c33b1dce2d4f25040b75f66629104bd1e40128 2024-12-19T15:40:08+01:00 Xuan Son Nguyen server : fix logprobs, make it OAI-compatible (#10783) 0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784) 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 152610eda91217ac409342cd976d05f5114ad39f 2024-12-18T04:00:07-10:00 Gaetan Bisson server: avoid overwriting Authorization header (#10878) 152610eda91217ac409342cd976d05f5114ad39f 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 2024-12-18T13:01:41+02:00 Georgi Gerganov server : output embeddings for all tokens when pooling = none (#10861) 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 46828872c31b25df16169cbbf5c2225fa9cb0675 2024-12-18T11:05:29+02:00 Georgi Gerganov server : add "tokens" output (#10853) 46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872) d62b532c52e0118323277eaa5f442e11ce6505ed 081b29bd2a3d91e7772e3910ce223dd63b8d7d26 2024-12-17T17:24:22-05:00 DAN™ Use model->gguf_kv for loading the template instead of using the C API. (#10868) 05c3a444b8b017b01b366b725ba22c740aae6b38 382bc7f2e8ffd0b89f23e840d097e21f301197ba 2024-12-17T16:00:24Z krystiancha server : fill usage info in embeddings and rerank responses (#10852) 227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 7b1ec53f56bb72c49e4c8434157895f94d3709c2 2024-12-17T09:52:09+01:00 Xuan Son Nguyen server : (UI) fix missing async generator on safari (#10857) 5478bbcd173e7027af7689493c7421719f5c43df b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 2024-12-15T05:55:54-06:00 Vinesh Janarthanan server: (UI) add syntax highlighting and latex math rendering (#10808) 89d604f2c87af9db657d8a27a1528bc4b7579c29 e52aba537a34d51a65cddec6bc6dafc9031edc63 2024-12-14T22:29:45Z Michelle Tan server: Fix `has_next_line` in JSON response (#10818) a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693) 5555c0c1f66d766c544c30699190dec0285bcbfc 973f328b1e92a6406030442dfd15b29449e89747 2024-12-11T22:40:40Z CentricStorm docs: update server streaming mode documentation (#9519) 973f328b1e92a6406030442dfd15b29449e89747 235f6e14bf0ed0211c51aeff14139038ae1000aa fb18934a97425c42c8b32a1baaa94f0080eb051d 2024-12-11T23:14:46+02:00 Georgi Gerganov Merge pull request #10788 from ggerganov/gg/gguf-py-0.11.0 235f6e14bf0ed0211c51aeff14139038ae1000aa 1a31d0dc00ba946d448e16ecc915ce5e8355994e 2024-12-11T20:52:14+01:00 Xuan Son Nguyen server : (UI) add tok/s, get rid of completion.js (#10786) 4b4d92b0986e3b627b9a9ef4782973108bf47691 43041d2eb32623d5b6ca734313327abe96f73146 2024-12-11T10:47:43Z CentricStorm docs: fix server documentation formatting (#10776) b685daf3867c54e42a9db484d7b92619021d4510 dafae66cc242eb766797194d3c85c5e502625623 2024-12-10T14:23:17-06:00 Jeff Bolz vulkan: request round-to-even for fp16 in im2col/rope_head (#10767) 750cb3e246f7e544124cf18cb0c5e0c8b7e38738 a86ad841f103e471ac0fd7ee8852d1eb5015ce89 2024-12-10T18:23:24+01:00 Andreas Kieslinger CUDA: rename macros to avoid conflicts with WinAPI (#10736) a86ad841f103e471ac0fd7ee8852d1eb5015ce89 a05e2afcc241c1ecd38ec5cb4c579d90cdf3f918 2024-12-10T17:22:34Z Yüg server : add flag to disable the web-ui (#10762) (#10751) ce8784bdb153ff7794dde5a50b0ebfa51baa6171 e52522b8694ae73abf12feb18d29168674aa1c1b 2024-12-08T23:04:29+01:00 Xuan Son Nguyen server : fix format_infill (#10724) e52522b8694ae73abf12feb18d29168674aa1c1b 06d70147e6480c021e493c442ae0f0d83ae366de 2024-12-08T20:38:51+01:00 Xuan Son Nguyen server : bring back info of final chunk in stream mode (#10722) 3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 d9c3ba2b7749c00df477599aa141a98b4521aa2c 2024-12-07T20:21:09+01:00 Xuan Son Nguyen server : (refactor) no more json in server_task input (#10691) ce4a7b849388b67d45ad420bdd82d5efcd55647a 19d8762ab61df8286367588a80b9c7db4cb568db 2024-12-07T18:02:05+02:00 Georgi Gerganov server : various fixes (#10704) 19d8762ab61df8286367588a80b9c7db4cb568db c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 2024-12-07T13:37:50+01:00 Djip007 ggml : refactor online repacking (#10446) c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 3df784b3050f657ea681f804187ce5bddb433e88 2024-12-07T11:52:44+02:00 Georgi Gerganov server : fix free of spec context and batch (#10651) f162d45a21b27f7613f14539f9a4932d6ff3ca48 6c5bc0625fae6909cb40def15bc4bb45db6f7f4d 2024-12-06T13:29:05+01:00 Xuan Son Nguyen common : bring back --no-warmup to server (#10686) 6c5bc0625fae6909cb40def15bc4bb45db6f7f4d 7736837d62efed1dbebfe579472fca041eda12d6 2024-12-06T11:14:32+01:00 Xuan Son Nguyen server : (refactoring) do not rely on JSON internally (#10643) 7736837d62efed1dbebfe579472fca041eda12d6 c9c6e01daedac542b174c235872569fce5385982 2024-12-05T23:36:41+02:00 Plamen Minev fix(server) : not show alert when DONE is received (#10674) 1da7b765692764a8b33b08da61cbee63812a7bd9 59f4db10883a4f3e855cffbf2c3ab68430e95272 2024-12-04T22:38:20+02:00 Georgi Gerganov server : fix speculative decoding with context shift (#10641) 91c36c269bca75b2d08119c653512cd20b4ea2ba 1cd3df46bd49a0c1c78da8b68c956448a73b7476 2024-12-03T19:38:44+01:00 Xuan Son Nguyen server : (web ui) Various improvements, now use vite as bundler (#10599) efb6ae963031709fc331e6e48cc4606ac8f9c3a7 667d70d1704dfa6977505f5d01d4638669b90dce 2024-12-02T19:27:24+01:00 PAB feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019) 3b4f2e33e2cbfca621e623c4b92b88da57a8c2f4 82bca2257b3cec72676abb26011f1b99fcdab29d 2024-12-03T12:54:30+01:00 Xuan Son Nguyen llama : add missing LLAMA_API for llama_chat_builtin_templates (#10636) 70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e 2024-12-03T11:20:00+02:00 Georgi Gerganov server : fix default draft model parameters (#10586) 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e 8648c521010620c2daccfa1d26015c668ba2c717 2024-12-02T22:10:19+01:00 Xuan Son Nguyen llama : add enum for built-in chat templates (#10623) 64ed2091b24b2f9747148fdf49a34ed5938762c3 991f8aabeec89d801300bb179e52013fb0eb0584 2024-12-02T21:45:54+08:00 haopeng server: Add "tokens per second" information in the backend (#10548) 86dc11c5bcf34db2749d8bd8d4fa07a542c94f84 6acce3971098772a8aacb10fe8550b4119110581 2024-12-01T12:33:12+01:00 alek3y server : bind to any port when specified (#10590) b782e5c7d453b3f1fa8dc6c34cde7e2fa946af93 3a8e9af402f7893423bdab444aa16c5d9a2d429a 2024-11-29T21:48:56+01:00 Xuan Son Nguyen server : add more test cases (#10569) f095a649ec390e04dfab1b04e646ae8549dafaef 678d7994f4da0af3d29046be99950ac999ee9762 2024-11-29T00:18:02-06:00 Jeff Bolz vulkan: get the first command buffer submitted sooner (#10499) 6c595676899013102fdb0aa4b06a49954300c94a 890719311b6535e572f15965c6d7ec4ac2537f60 2024-11-28T19:17:49+01:00 Xuan Son Nguyen server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568) 45abe0f74ee281aea6e5283c1e738061256cfcae 0bbd2262a3263f37385297b30de37941836e57f7 2024-11-26T16:20:18+01:00 Xuan Son Nguyen server : replace behave with pytest (#10416) 7db3846a94ce7683b3e8120abe427457edf840c9 c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2 2024-11-26T13:05:20+01:00 Diego Devesa ci : publish the docker images created during scheduled runs (#10515) 84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 811872a59daefb25fc0c4326bcb6d8ae893c2f7c 2024-11-26T13:36:40+02:00 Georgi Gerganov server : fix parallel speculative decoding (#10513) 9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 47f931c8f9a26c072d71224bc8013cc66ea9e445 2024-11-25T22:28:27+02:00 Georgi Gerganov server : add more information about error (#10455) 47f931c8f9a26c072d71224bc8013cc66ea9e445 106964e3d266740f571b5aad7b57545b4a901ac9 2024-11-25T21:50:07+02:00 Georgi Gerganov server : enable cache_prompt by default (#10501) a9a678a6b2264e5895533217b0cf8f250534cc58 9ca2e677626fce759d5d95c407c03677b9c87a26 2024-11-25T08:11:55-08:00 brucepro Add download chat feature to server chat (#10481) 9ca2e677626fce759d5d95c407c03677b9c87a26 5931c1f233c616083d64e41a228249d58e039aa5 2024-11-25T16:31:38+02:00 Georgi Gerganov server : add speculative decoding support (#10455) 5a8987793f3e7c1fbfa6806bfcd17d578071b6c9 d9d54e498d38ec99bbc0031022f9c92711e97bbc 2024-11-25T17:31:10+08:00 Neo Zhang Jianyu [SYCL] Fix building Win package for oneAPI 2025.0 update (#10483) 6dfcfef0787e9902df29f510b63621f60a09a50b 599b3e0cd40432cd1975a8906f3db70bbe53b627 2024-11-22T17:44:08+08:00 蕭澧邦 ci: Update oneAPI runtime dll packaging (#10428) bcdb7a23862b61aa307fc462fadfe1e2e653d010 f245cc28d4eb900efad0bc740145f58d713c6e4f 2024-11-16T18:26:54+05:00 MaggotHATE server: (web UI) Add samplers sequence customization (#10255) 9901068ac78838745e604fffb4601d315a610456 231f9360d94446cd083b6b116f63991b1328c484 2024-11-15T05:48:49-04:00 Xuan Son Nguyen server : (web UI) add copy button for code block, fix api key (#10242) 5a54af4d4f588f109f31e456483fdf77096399d9 1607a5e5b08f4e55f118af3d7de325949d8f1835 2024-11-15T04:09:12+01:00 Romain Biessy sycl: Use syclcompat::dp4a (#10267) fb4a0ec0833c71cff5a1a367ba375447ce6106eb 5ea926dad7f62ebccff7b24784bd1e01a06d13ae 2024-11-13T20:00:35+02:00 Michael Podvitskiy llama : propagate the results of `graph_compute` (#9525) ff7fb670d0a62897c5662536aeb53422c549fbe8 0e712a5acbbdd1593e5aeb86d4f6b896a11b438c 2024-11-13T11:16:30Z Alexey Parfenov server : add missing docs (#10269) 0e712a5acbbdd1593e5aeb86d4f6b896a11b438c a0ec17b32ec6077f5ca22fe833ebdc9b86795a4d 2024-11-13T19:15:23+08:00 Jhen-Jie Hong server : fix incorrect res in validate_model_chat_template (#10272) b141e5f6efbab3a00633df88c4f9425bfe8b78ab 4b3a9212b602be3d4e2e3ca26efd796cef13c55e 2024-11-11T08:38:43+02:00 Georgi Gerganov server : enable KV cache defrag by default (#10233) 505f33274d60676320216b662a97672a76ec600e 160687b3ed002eee83a04de83a9cd752f928ced1 2024-11-11T00:42:25+05:00 MaggotHATE server : (web UI) Add back sampler settings (#10239) 76c6e7f10551960e4ec9e14e0535b72081f1c7ad a71d81cf8c1afb26b166f897c94ee1581f9fac7d 2024-11-07T18:44:38-04:00 Xuan Son Nguyen server : minor UI fix (#10207) a71d81cf8c1afb26b166f897c94ee1581f9fac7d eec4d71737b32f312e0082b671629a0368e1a20d 2024-11-07T17:31:10-04:00 Xuan Son Nguyen server : revamp chat UI with vuejs and daisyui (#10175) b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 2024-11-06T13:29:01+02:00 Georgi Gerganov server : remove hack for extra parallel slot (#10187) 9e0ecfb697d297355e43c20559d29bcc71beb0c3 6a066b9978533e2ab9890b7f4f8c0262d91798b3 2024-11-04T16:33:29+01:00 Xuan Son Nguyen server : clarify /slots endpoint, add is_processing (#10162) 42cadc74bda60afafb45b71b1a39d150ede0ed4d 45950415ed985830c59bf42cf9c9216b20cf08ef 2024-11-02T16:34:56Z sasha0552 server : fix slot selection by lru (#10126) 45950415ed985830c59bf42cf9c9216b20cf08ef 1926d6e39d6f6358bc1a4c52316a560178be7233 2024-11-02T18:34:00+02:00 Georgi Gerganov server : fix endpoint checks (#10135) d865d1478cd4e403f82d793c2afcd0f943412f05 1804adb0cfee4811eaf633741503d683a46e4c77 2024-11-01T13:33:14Z sasha0552 server : fix smart selection of available slot (#10120) e597e50794f07ec8dc24b9efb18f94ec6386fda0 85679d37f34f66783cc04664a06c405b28e8e035 2024-11-01T11:09:59+08:00 Zhenwei Jin build: fix build error in Windows env with OneAPI setup (#10107) 0a683e8088d849626e7471f9e2ed381f7dbdf2e9 dea5e86051aadcdf42f7db7a8855a78d8f5ff3d6 2024-10-31T06:02:35-07:00 Kevin Gibbons server : include scheme when printing URL (#10106) 8125e6cbfcf2b3b9066e4d923aca9295526730f5 8841ce3f439de6e770f70319b7e08b6613197ea7 2024-10-28T08:49:32+02:00 Georgi Gerganov server : don't overfill the batch during infill (#10018) bc5ba007b2c83ac95875e68724dabfc12159fc61 958367bf530d943a902afa1ce1c342476098576b 2024-10-25T10:13:46+03:00 Georgi Gerganov server : check that the prompt fits in the slot's context (#10030) 958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023) 0a1c750c80147687df267114c81956757cc14382 190a37d7977eb5bd6a729299bd1e371208c87149 2024-10-23T13:27:51-06:00 wwoodsTM server : samplers accept the prompt correctly (#10019) 6b8447352df3d662b56280c8fc38d7f092885787 674804a99617b4f90292b4080ecab450ea3d30ba 2024-10-22T16:16:01+08:00 leo-pony [CANN] Adapt to dynamically loadable backends mechanism (#9970) afd9909a6481402844aecefa8a8908afdd7f52f1 87421a23e8c60e00a7b227d501e8aab2a1aff7ce 2024-10-18T14:33:58+03:00 Radoslav Gerganov rpc : backend refactoring (#9912) 87421a23e8c60e00a7b227d501e8aab2a1aff7ce 60ce97c9d809f4b040e90b597468b839df5728d0 2024-10-18T06:46:16+01:00 Ouadie EL FAROUKI [SYCL] Add SYCL Backend registry, device and Event Interfaces (#9705) 60ce97c9d809f4b040e90b597468b839df5728d0 8901755ba328643c9ab071c20e1939ea52951a0e 2024-10-18T13:34:36+08:00 Ma Mingfei add amx kernel for gemm (#8998) 8901755ba328643c9ab071c20e1939ea52951a0e 6f55bccbb8835d42147add4ee48807450f5ff535 2024-10-18T07:32:19+03:00 Georgi Gerganov server : add n_indent parameter for line indentation requirement (#9929) 1f66b699c48cb5ab3265ed72c48e8549b1674291 0e41b300ed28f7fe185d938b2e3d56a0bf7411ed 2024-10-16T08:35:53Z Alexey Parfenov server : fix the disappearance of the end of the text (#9867) 223c25a72fcc3f65cdfd7f5d57edd5b44b550e18 fbc98b748e7b075e327bcf13237057f647678049 2024-10-15T16:28:55+03:00 Georgi Gerganov server : improve infill context reuse (#9894) fbc98b748e7b075e327bcf13237057f647678049 dcdd535302fc9702a4709be25f56540d65163a44 2024-10-15T15:54:55+05:00 MaggotHATE sampling : add XTC sampler (#9742) dcdd535302fc9702a4709be25f56540d65163a44 4c42f93b22146c83b763d8cbee5fafc512746649 2024-10-15T12:48:44+03:00 Georgi Gerganov server : update preact (#9895) a89f75e1b7b90cb2d4d4c52ca53ef9e9b466aa45 13dca2a54a394757d56fdd652b9f0df08f44ea22 2024-10-14T15:04:36+08:00 VoidIsVoid server : handle "logprobs" field with false value (#9871) d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4 c7181bd294757dd80a7904e3dd0fea2d0be914e7 2024-10-13T21:31:35+03:00 Georgi Gerganov server : accept extra_context for the infill endpoint (#9874) c7181bd294757dd80a7904e3dd0fea2d0be914e7 92be9f12164f18ce845a5bab60cefa5f7fec6836 2024-10-13T18:52:48+03:00 Georgi Gerganov server : reuse cached context chunks (#9866) edc265661cd707327297b6ec4d83423c43cb50a5 1bde94dd024b632f98428f4bf2ce483295130779 2024-10-12T16:14:27+03:00 Georgi Gerganov server : add option to time limit the generation phase (#9865) 1bde94dd024b632f98428f4bf2ce483295130779 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 2024-10-12T16:06:31+03:00 Georgi Gerganov server : remove self-extend features (#9860) 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 11ac9800aff532715a5bc7991062c68ba3472e6e 2024-10-12T14:51:54+03:00 Georgi Gerganov server : remove legacy system_prompt feature (#9857) 11ac9800aff532715a5bc7991062c68ba3472e6e 943d20b4111c746bcd9dbc7e4771de313b08b50c 2024-10-12T08:21:51+03:00 Georgi Gerganov llama : improve infill support and special token detection (#9798) 0e9f760eb12546704ef8fa72577bc1a3ffe1bc04 cf8e0a3bb9c0e93e371773b282054cdbbb231038 2024-10-10T20:14:55+02:00 Diego Devesa rpc : add backend registry / device interfaces (#9812) 458367a90606448a9c0262b276947c9e536086e0 fa42aa6d8902cc4eaf31866b3b3b7b61b69da930 2024-10-08T13:27:04+02:00 Xuan Son Nguyen server : better security control for public deployments (#9776) 7254cdf7e8d6312840509ca8d766358c687c6266 cad341d88924788b940997c55e7bef000c99e784 2024-09-29T23:18:02+02:00 Johannes Gäßler ggml: fix gradient allocation logic (ggml/966) f4d2b8846a6b34419ff9e9491aee6cd95e444bfc 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 2024-09-28T17:42:03+03:00 Georgi Gerganov llama : add reranking support (#9510) 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 739842703e32cd43443c45e0b4f6647cc4e6b3d6 2024-09-28T14:32:46+02:00 slaren test-backend-ops : use flops for some performance tests (#9657) 95bc82fbc0df6d48cf66c857a4dda3d044f45ca2 7691654c68aa5316108f881136c59f815ccb6809 2024-09-26T17:38:31+08:00 Neo Zhang Jianyu [SYCL] add missed dll file in package (#9577) afbbfaa537a96f562c34df4542930fa951b40d9e 3d6bf6919f7b10726421779cd344f2da05421c68 2024-09-25T14:05:13+02:00 Xuan Son Nguyen server : add more env vars, improve gen-docs (#9635) 3d6bf6919f7b10726421779cd344f2da05421c68 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 2024-09-25T01:06:52-06:00 Gabe Goodhart llama : add IBM Granite MoE architecture (#9438) 0aa15011e315659640504731d1d05663837130fa b0f27361f3539a81d983a8b045f3c61e682d9fc0 2024-09-23T23:04:39-07:00 StrangeBytesDev server : add newline after chat example (#9616) 0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 f0c7b5edf82aa200656fd88c11ae3a805d7130bf 2024-09-23T22:23:54+02:00 Xuan Son Nguyen server : add --no-context-shift option (#9607) f0c7b5edf82aa200656fd88c11ae3a805d7130bf 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 2024-09-23T11:42:43-07:00 Max Krasnyansky threads: improve ggml_barrier scaling with large number of threads (#9598) 6026da52d6942b253df835070619775d849d0258 eca0fab44eb449ed34e17a9b651ae7398b494117 2024-09-19T12:44:53+03:00 Georgi Gerganov server : clean-up completed tasks from waiting list (#9531) 8a308354f6520df6bea851b435bd8054ee5617b4 f799155ab8279cfa668086ce584aa52ecc05f5e5 2024-09-18T01:50:34-05:00 Vinesh Janarthanan server : match OAI structured output response (#9527) f799155ab8279cfa668086ce584aa52ecc05f5e5 faf67b3de4688f47c3b1019c89df255df2fd59b4 2024-09-18T14:28:20+08:00 Eric Zhang server : fix OpenSSL build (remove obsolete `LOG_INFO`) (#9529) 8b836ae731bbb2c5640bc47df5b0a78ffcb129cb 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 2024-09-17T09:35:38-04:00 Bert Wagner arg : add env variable for parallel (#9513) 0226613853133c081b55bb892a41bb5eacc0bc94 503147a9f9d195d6a14e7c998df23b6eb61f2bae 2024-09-17T01:19:46-07:00 Max Krasnyansky threadpool : skip polling for unused threads (#9461) 441b72b91f818fe69497e5816f87969e90c73c43 c4965a64f72ac9434c21cf0e1c3421d13e889155 2024-09-16T01:20:01-05:00 Vinesh Janarthanan main : option to disable context shift (#9484) dcdcee3a744f39714503ee2b19c49b7c7b6209c9 1f4111e540bacec8d00ca9fd96417bf4c1339394 2024-09-14T17:36:44+08:00 VoidIsVoid server: add data: [DONE] to /chat/completions stream response (#9459) feff4aa8461da7c432d144c11da4802e41fef3cf 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 2024-09-13T14:23:11+02:00 Xuan Son Nguyen server : add loading html page while model is loading (#9468) 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 bd35cb0ae357185c173345f10dc89a4ff925fc25 2024-09-13T09:53:38+03:00 Georgi Gerganov llama : llama_perf + option to disable timings during decode (#9355) 78203641fee3b1f82abaff0c7f667e1b4a286390 e6b7801bd189d102d901d3e72035611a25456ef1 2024-09-12T22:30:11+02:00 Mathijs Henquet server : Add option to return token pieces in /tokenize endpoint (#9108) 8d300bd35fbe23b35a4e1ece0cf0fe8f43331029 49006c67b4c6cc2e7c75a875b4d6e161ebae287c 2024-09-10T22:40:59+02:00 matteo enable --special arg for llama-server (#9419) bfe76d4a17228bfd1565761f203123bc4914771b 293bebe0773c907c0c866213856eeba41b035df1 2024-09-09T23:36:09+02:00 Xuan Son Nguyen common : move arg parser code to `arg.cpp` (#9388) 1b9ae5189cd279c6b45e36d43e4f9ccae628d02f e32d0816edfd247784f6780b0bb9ae0bceef5e47 2024-09-07T20:43:51+02:00 Xuan Son Nguyen common : refactor arg parser (#9308) df270ef74596da8f1178f08991f4c51f18c9ee82 947538acb8617756a092042ff7e58db18dde05ec 2024-09-07T15:16:19+03:00 Georgi Gerganov llama : refactor sampling v2 (#9294) 9b2c24c0993487d3b34a873980e292da571481f3 134bc38ecf3e2c5460581badce289a1ffa680453 2024-09-06T23:21:29+02:00 Xuan Son Nguyen server : simplify state machine for slot (#9283) 4a1411b4f17b6569dc0a067e5914dcc0f738b370 8ebe8ddebd68526757c631cd019de009697c63c2 2024-09-06T14:06:04+02:00 Xuan Son Nguyen server : fix missing lock (#9334) 9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151) 32b2ec88bc44b086f3807c739daf28a1613abde1 1031771faaba28d07b4ec6a812cb21532efc8c31 2024-09-06T06:34:36+08:00 awatuna Update build.yml (#9184) 82e3b03c11826d20a24ab66d60f4de58f48ddcdb 9379d3cc1718e9ec6ab5ffcb60a06bbe048a61ee 2024-09-04T11:08:32+03:00 Radoslav Gerganov rpc : make RPC servers come first in the device list (#9296) b69a480af4db8ffd6cbb2efe7ed8132bc7d39073 48baa61eccdca9205daf8d620ba28055c2347b64 2024-09-03T10:00:36+03:00 Georgi Gerganov readme : refactor API section + remove old hot topics 48baa61eccdca9205daf8d620ba28055c2347b64 f1485161e58d562099dd050f8ac3a9ea9f4cd765 2024-09-02T22:08:38+02:00 Xuan Son Nguyen server : test script : add timeout for all requests (#9282) 6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274) 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980) 42c76d1358021ccdbe8ba89109c143dd7ae166df 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 2024-08-29T19:20:53-04:00 Faisal Zaghloul Threadpool: take 2 (#8672) 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 2024-08-27T18:28:06+08:00 Jan Boon server : fix crash when error handler dumps invalid utf-8 json (#9195) a77feb5d71831c61e455541e8a655b9f0337ea8c 2e59d61c1b321431c597c1f12249273427d5640d 2024-08-27T11:07:01+02:00 Xuan Son Nguyen server : add some missing env variables (#9116) e5edb210cd361689da41f032f1b36c45ff1bf9be 0c41e03ceba1aafaf469476a56347419d5785376 2024-08-26T12:16:57+03:00 Georgi Gerganov server : update deps (#9183) a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526) fc54ef0d1c138133a01933296d50a36a1ab64735 b40eb84895bf723c7b327a1e3bf6e0e2c41877f8 2024-08-21T11:04:34+02:00 Xuan Son Nguyen server : support reading arguments from environment variables (#9105) 18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 554b049068de24201d19dde2fa83e35389d4585d 2024-08-19T10:10:21+03:00 Radoslav Gerganov rpc : prevent crashes on invalid input (#9040) 8b3befc0e2ed8fb18b903735831496b8b0c80949 d565bb2fd5a2a58b9924a7a34e77a87c78c52137 2024-08-16T17:19:05+02:00 Xuan Son Nguyen server : refactor middleware and /health endpoint (#9056) d565bb2fd5a2a58b9924a7a34e77a87c78c52137 ee2984bdaf10c14d440ad873a049bcc09b786d9b 2024-08-16T21:34:41+08:00 tc-mb llava : support MiniCPM-V-2.6 (#8967) 37501d9c79ed5897db4b73ea7502211d25b3f763 4af8420afba39de4968adf2695ce12fd42422a13 2024-08-15T15:28:05+08:00 Riceball LEE server : fix duplicated n_predict key in the generation_settings (#8994) 234b30676a97ce227b604c38beb9dcaca406dea9 5fd89a70ead34d1a17015ddecad05aaa2490ca46 2024-08-15T08:21:57+02:00 Jiří Podivín server : init stop and error fields of the result struct (#9026) 98a532d474c73d3494a5353024cb6a4fbbabbb35 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 2024-08-14T02:51:02-04:00 compilade server : fix segfault on long system prompt (#8987) 5ef07e25ac39e62297a67208c5bcced50835a2dd 4134999e01f31256b15342b41c4de9e2477c4a6c 2024-08-12T10:21:50+03:00 Georgi Gerganov server : handle models with missing EOS token (#8997) 7c3f55c10051c634546247387c5c359c9d499360 911b437f228e75aa3d235acec21bfddd23ecce2f 2024-08-10T11:43:26+02:00 fairydreaming Add support for encoder-only T5 models (#8900) 3071c0a5f218f107dabd13b73f6090af683ef5ec 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 2024-08-09T18:33:53+08:00 tc-mb llava : support MiniCPM-V-2.5 (#7599) daef3ab233fc02e4c53afd9b07366379876f00d1 345a686d8271a24db20d31789c0d4b9ed51dcb0c 2024-08-09T08:32:02+02:00 Mathieu Geli server : add one level list nesting for embeddings (#8936) 1e6f6554aa11fa10160a5fda689e736c3c34169f 641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5 2024-08-06T17:33:39+02:00 Xuan Son Nguyen server : add lora hotswap endpoint (WIP) (#8857) a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904) 978ba3d83d17b10fdf9807006048432b5b3769fc ecf6b7f23e664afd7ff856ec39034240ce438daa 2024-08-04T18:16:23Z ardfork Server: Don't ignore llama.cpp params (#8754) ecf6b7f23e664afd7ff856ec39034240ce438daa 01aae2b4975b57a265ce8194928fd87f2d71027e 2024-08-04T03:55:03-07:00 Brian Cunnie batched-bench : handle empty `-npl` (#8839) afbbcf3c04e3c6420cad3d72571478cd62ac176c ed9d2854c9de4ae1f448334294e61167b04bec2a 2024-07-31T18:59:09-05:00 Igor Okulist server : update llama-server embedding flag documentation (#8779) 01aec4a6310ab0160483196db0e726d78d4c94b6 41cd47caab88c442edc50e90c8d8d0ac3e82768d 2024-07-25T18:10:16-04:00 Yaiko server : add Speech Recognition & Synthesis to UI (#8679) 4b0eff3df58d8d86e47348fb73d54da3194d416d 8a4bad50a8ed24ed1e9df003521468dcc37320e8 2024-07-25T13:43:27+05:30 Ujjawal Panchal docs : Quantum -> Quantized (#8666) b841d0740855c5af1344a81f261139a45a2b39ee 64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e 2024-07-23T17:37:42+03:00 Vali Malinoiu server : fix URL.parse in the UI (#8646) 938943cdbf4dd79005a394d732bc226f9e34e0ff 751fcfc6c33ea5f43cadd4d976f8fb176871df5e 2024-07-23T13:10:17+03:00 Georgi Gerganov llama : move vocab, grammar and sampling into separate files (#8508) 566daa5a5b38018b2727950bbd280239adb981b6 6f11a83e4e7700fdf353ed4a29599cb662c792f6 2024-07-22T15:44:53+02:00 Jiří Podivín *.py: Stylistic adjustments for python (#8233) 628154492a0b2dcc954a3af99e5c267097568eae 04bab6b7da0ed2b0a57174a57784d602aabb6c10 2024-07-22T16:02:09+08:00 Jan Boon server : update doc to clarify n_keep when there is bos token (#8619) 69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 07283b1a90e1320aae4762c7e03c879043910252 2024-07-20T22:25:26+02:00 Johannes Gäßler CUDA: MMQ code deduplication + iquant support (#8495) be0cfb41752551a4680ee7dfd29f2a05b50db442 b57eb9ca4fb79f3163c6a69e154ff76157a4f716 2024-07-19T14:34:55+03:00 Georgi Gerganov readme : fix server badge 0d2c7321e9678e91b760ebe57f0d063856bb018b 672a6f101839a150180fc28891ebed379c8f2353 2024-07-18T18:43:49+08:00 Eric Zhang server: use relative routes for static files in new UI (#8552) 3807c3de04cde853418033c95e96642876545f3e e02b597be3702174e7b47b44cd03e1da1553284b 2024-07-18T16:06:22+08:00 RunningLeon server : respect `--special` cli arg (#8553) f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 9104bc20edf47f74dc49379b7d61d0c6e85a4882 2024-07-15T08:04:56-04:00 M-A server: update README.md with llama-server --help output [no ci] (#8472) 4e24cffd8cccd653634e24ee461c252bd77b1426 6af51c0d96e6268769fc05c98d5b1a5e832c0017 2024-07-12T14:48:15+03:00 Georgi Gerganov server : handle content array in chat API (#8449) c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420) 278d0e18469aacf505be18ce790a63c7cc31be26 dd07a123b79f9bd9e8a4ba0447427b3083e9347a 2024-07-10T20:08:17-04:00 Clint Herron Initialize default slot sampling parameters from the global context. (#8418) dd07a123b79f9bd9e8a4ba0447427b3083e9347a f4444d992c16b6b9442f4770c7c3a10b19a08343 2024-07-10T12:35:18-04:00 Clint Herron Name Migration: Build the deprecation-warning 'main' binary every time (#8404) 0f1a39f3439825acf7e3a1663566d410be152170 83321c6958acf20747d288031174cc1bf8816e33 2024-07-10T07:14:51-05:00 Dibakar Gope ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780) a59f8fdc85e1119d470d8766e29617962549d993 fd560fe680c72fd0a0af2bc8881add20ad919071 2024-07-09T18:26:40-04:00 Clint Herron Server: Enable setting default sampling parameters via command-line (#8402) 3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d a8db2a9ce64cd4417f6a312ab61858f17f0f8584 2024-07-07T15:04:39-04:00 compilade py : type-check all Python scripts with Pyright (#8341) cb4d86c4d723af87d3d7e3177e9485f200391384 86e7299ef5dff0f388922dc6fcbce009e99d8005 2024-07-07T11:10:38+02:00 Bjarke Viksøe server: Retrieve prompt template in /props (#8337) 807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763) a95631ee97bb24861af6bdeec380270459631e8e f3f65429c44bb195a9195bfdc19a30a79709db7b 2024-06-26T19:26:13+03:00 Georgi Gerganov readme : update API notes f3f65429c44bb195a9195bfdc19a30a79709db7b 88540445615e77a0177fcca43aaa8e9d8eea6864 2024-06-26T18:33:02+03:00 Georgi Gerganov llama : reorganize source code + improve CMake (#8006) 6777c544bdd8c5d9de3220d6e2557957bbbf2a4f 163d50adaf8897d8b734d701ff332de6be63d484 2024-06-26T01:45:58+01:00 Olivier Chafik `json`: fix additionalProperties, allow space after enum/const (#7840) dd047b476c8b904e0c25e5dbc5bee6ffde2f6e17 925c30956dd17723c3a25297bcd0a609aec60663 2024-06-25T19:20:06+02:00 slaren disable docker CI on pull requests (#8110) 925c30956dd17723c3a25297bcd0a609aec60663 c8ad35955ad2c68db172dcd0e857423ab128518d 2024-06-25T08:13:27-07:00 joecryptotoo Add healthchecks to llama-server containers (#8081) 48e6b92cc378c937e59719f2c0f482bf76c9ca81 3791ad219323389106dc3fd80814eb5bbb7b80de 2024-06-25T13:56:49+02:00 Xuan Son Nguyen Add chat template support for llama-cli (#8068) 3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950) 6a2f298bd784403c5c33eebb822217ec5d9b5590 11318d9aa1f668aa10407a5cb9614371af32f3ce 2024-06-23T18:03:08+03:00 Aarni Koskela server : fix JSON-Scheme typo (#7975) b6b9a8e606da7764bd3649c2ea574979c85abd43 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc 2024-06-23T13:14:45+02:00 slaren fix CI failures (#8066) ba5899315283eb1df3902363daf79bdc5eefe426 a7854743c5e6216a6178824a603aa9479728ddd5 2024-06-19T23:57:10Z sasha0552 server : fix smart slot selection (#8020) e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084 a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f 2024-06-18T09:37:20+03:00 Georgi Gerganov whisper : use ggml_backend_sched (whisper/2239) 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 963552903f51043ee947a8deeaaa7ec00bc3f1a4 2024-06-13T00:41:52+01:00 Olivier Chafik `build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809) 704a35b183748954013bd875bbbfdd9eaca14e62 dcf752707d96eb305f546526c7bc5d01f0831130 2024-06-12T14:42:29+03:00 Georgi Gerganov server : restore numeric prompts (#7883) dcf752707d96eb305f546526c7bc5d01f0831130 f2b5764beb35583295e2475479c18f249b139b58 2024-06-12T17:05:35+08:00 Meng, Hengyu update intel docker oneapi-basekit to 2024.1.1-devel-ubuntu22.04 (#7894) 14f83526cd27f638c856ea6eff08110b9860eb2a 6fe42d073f0554eada93ac9d40574025aeedb703 2024-06-11T12:18:58-04:00 Deven Mistry fix broken link in pr template (#7880) [no ci] fd5ea0f897ecb3659d6c269ef6f3d833e865ead7 c28a83902cf6ab6a9e085ad6d4cc2e95c4ccfe40 2024-06-10T14:18:41+02:00 slaren ci : try win-2019 on server windows test (#7854) d9da0e4986f121c727bdd9579a6688097b11602c 1f0dabda8d5c131f9d4632aa41de74317cdd61fb 2024-06-10T14:59:55+03:00 Georgi Gerganov server : improve "prompt" handling (#7847) 57bf62ce7cb75cca589943e2050d29bff4026e76 3e2ee443159724e2d3a0741f6b167e599ec088aa 2024-06-09T11:24:29-04:00 Nicolás Pérez docs: Added initial PR template with directions for doc only changes and squash merges [no ci] (#7700) 3e2ee443159724e2d3a0741f6b167e599ec088aa 42b53d192f4e3abf1b7c8e424628424504ea5dc5 2024-06-09T12:50:35+02:00 mgroeber9110 server: do not remove whitespace at the start of a completion chunk (#7830) fe1e3917cfa0f9397a765cfd0aef880674d938d5 d4d915d351d1f1270d56184bdd46672893e8a5d8 2024-06-09T01:43:39+02:00 slaren Revert "[SYCL] Update rpc-server.cpp to include SYCL backend (#7682)" (#7808) 7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f da799b41891e34aac86ce4e173f9c4c0afd4fab3 2024-06-08T07:50:31Z sasha0552 server : smart slot selection using Longest Common Prefix (#7728) 7027b27d765db95d4ac6b569d976e387a8715881 a5cabd76491f07494c5b8267f921c73f5e2bbfb4 2024-06-07T11:15:49+02:00 Johannes Gäßler server: update cache_prompt documentation [no ci] (#7745) a5cabd76491f07494c5b8267f921c73f5e2bbfb4 d5c938cd7716b9a2ace49a43a469dfbffcff4d28 2024-06-07T15:09:45+08:00 woodx server : do not get prompt in infill mode (#7286) ee459f40f65810a810151b24eba5b8bd174ceffe f83351f9a62a6262f1fc3d08f320033089cddfb5 2024-06-06T19:19:59+03:00 Georgi Gerganov server : fix --threads-http arg (#7801) 55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f 2024-06-06T10:07:06+01:00 Olivier Chafik grammars: x{min,max} repetition operator (#6640) 2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f d67caea0d6e6c303d31b01d0a010973e6c908dff 2024-06-06T07:19:49+02:00 slaren docker : build only main and server in their images (#7782) 1442677f92e45a475be7b4d056e3633d1d6f813b 554c247caffed64465f372661f2826640cb10430 2024-06-04T21:23:39+03:00 Georgi Gerganov common : refactor cli arg parsing (#7675) 6d1616944d9efd342ed2a4fd318722adfc9febcd bde7cd3cd949c1a85d3a199498ac98e78039d46f 2024-06-04T10:01:09+03:00 Georgi Gerganov ggml : prevent builds with -ffinite-math-only (#7726) bde7cd3cd949c1a85d3a199498ac98e78039d46f a5735e4426b19a3ebd0c653ad8ac01420458ee95 2024-06-03T20:03:26+03:00 Radoslav Gerganov llama : offload to RPC in addition to other backends (#7640) a5735e4426b19a3ebd0c653ad8ac01420458ee95 0b832d53ba0ffcc759c8d62ede3772dd62321f8e 2024-06-04T00:14:15+09:00 Masaya, Kato ggml : use OpenMP as a thread pool (#7606) 7c4e5b7eae26581869e782015d9deca947c34997 9422c5e34bbd302493b77a8f6d546154a1f4fe82 2024-06-02T13:39:08-04:00 Austin chore : add ignore rule for generated server themes (#7689) 9422c5e34bbd302493b77a8f6d546154a1f4fe82 e141ce624af57bdffbaf57014a044eb1d9689230 2024-06-02T19:13:54+10:00 nickp27 [SYCL] Update rpc-server.cpp to include SYCL backend (#7682) 2e666832e6ac78194edf030bd1c295e21bdb022c 2ac95c9d5678d05e253691fb1f26471675bff5ad 2024-06-01T21:31:48+02:00 Yazan Agha-Schrader server : new UI (#7633) 2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) a323ec60af14a33d560df98f2cc41b4112cb4f80 0515ad93f48df63bbff204eddb0cac75e8585c65 2024-05-31T22:23:04+03:00 Georgi Gerganov server : update js (#7670) 972b555ab935705f3437abd5909a5c46852811f6 3854c9d07f67de7f8cd6d86117bfaef47549b05a 2024-05-30T09:52:39+02:00 Johannes Gäßler README: explain parallel build [no ci] (#7618) 3854c9d07f67de7f8cd6d86117bfaef47549b05a eb57fee51f7b4d78039f003249873c2eb46f12f6 2024-05-30T14:19:08+08:00 Meng, Hengyu [SYCL] fix intel docker (#7630) e2b065071c5fc8ac5697d12ca343551faee465cc 0548a4187f2e53b8fc6d9ff0f4c71988f708ff42 2024-05-28T17:53:37+08:00 Neo Zhang [SYCL]fix ggml_sycl_mul_mat_id() to match the change of api (#7436) 9335b969e86a222e247adacedf814d8abfff8847 c41767154eb82aa3fe7568fc816c3402b78eae94 2024-05-28T06:55:51+02:00 mgroeber9110 server: do not remove whitespace at the start of a completion chunk (#7524) b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480) 27891f6db03de6e3fd5941983838c29bef253352 fbca2f27fc7fa9aa4a8ad0357478fdb908472908 2024-05-24T23:47:56+10:00 Brian docker.yml: disable light-intel and server-intel test (#7515) fbca2f27fc7fa9aa4a8ad0357478fdb908472908 0df0aa8e43c3378975269a51f9b876c8692e70da 2024-05-24T14:31:13+02:00 fairydreaming Add support for ArcticForCausalLM (#7020) 3015851c5ac7334fb544a23a70a284c117b87044 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 2024-05-23T14:29:26+02:00 Daniel Bevenius llama : add getters for n_threads/n_threads_batch (#7464) 1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350) 201cc11afa0a1950e1f632390b2ac6c937a0d8f0 6369bf04336ab60e5c892dd77a3246df91015147 2024-05-22T04:28:32+08:00 liuwei-git llama : add phi3 128K model support (#7225) d7e852c1bc8e85bf62a6f1aede08cd2de723404a 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 2024-05-21T14:39:48+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425) 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 fabf30b4c4fca32e116009527180c252919ca922 2024-05-20T20:15:57+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (#7375) 3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb 2024-05-20T15:10:03+03:00 Georgi Gerganov server : fix temperature + disable some tests (#7409) 1cc0155d04918cb3017afa472acea51b77483c4a e932094d58f513d5996c3efc9f6fed8238894c57 2024-05-20T10:16:41+03:00 Georgi Gerganov server : tuning tests (#7388) e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389) 1b01f06db0cff5f5f600bb754fc39fde565ed56a 41858392e17abead21735309bf17cb55183d8c31 2024-05-19T16:26:02+02:00 Johannes Gäßler server: add test for token probs (#7347) 41858392e17abead21735309bf17cb55183d8c31 6aade19ee74b896c59929676629340b36be3e22c 2024-05-19T16:06:33+02:00 Johannes Gäßler server: fix seed being reported back (#7382) cb42c294279bc4a0a4e926a7b5a5568049f12fa7 d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc 2024-05-18T11:10:47+02:00 Johannes Gäßler server: correct --threads documentation [no ci] (#7362) f4bd8b3d260bb09491ba63c77ab7012b744362ef 51e9d02599336e62948d29f1d6c05addeb921ac2 2024-05-17T17:25:44+03:00 Radoslav Gerganov rpc : set SO_REUSEADDR for the server socket (#7320) d273c1402b25086fd91aef2467ac13f2e49fa0ea 27b040691cbe45314147c2745e891a38e9c048d4 2024-05-17T15:11:45+03:00 Aarni Koskela py : convert-hf-to-gguf-update improvements (#7340) 27b040691cbe45314147c2745e891a38e9c048d4 29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba 2024-05-17T13:24:38+02:00 fairydreaming llama : use n_embd_head_v when reshaping kqv (#7327) ee94172d33399d2e814ca05c8a3ff8c523ebb093 934266c0e0b2aa9781fdba2deb112c161ff038a9 2024-05-17T10:00:17+03:00 Radoslav Gerganov server : add support for the RPC backend (#7305) 9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642 24ecb58168dce81646c2ed425690a106591c8c6d 2024-05-17T02:11:03+02:00 Leon Knauer [Server] Added --verbose option to README [no ci] (#7335) 24ecb58168dce81646c2ed425690a106591c8c6d 9afdffe70ebf3166d429b4434783bb0b7f97bdeb 2024-05-16T20:43:45+02:00 Pierrick Hymbert Revert "server bench: fix bench not waiting for model load (#7284)" (#7334) 583fd6b000ec9ad1b465b5c98524f4a0ae388077 9f773486ab78d65f5cca3f7e31c862b7043bf721 2024-05-15T08:44:16+02:00 Johannes Gäßler server bench: fix bench not waiting for model load (#7284) 4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 1265c670fd8e41e1947352c96c5179adda97fb2c 2024-05-14T10:11:24-04:00 Steve Grubb server: free sampling contexts on exit (#7264) 5e31828d3e35c76ecfee665bc23771a4bec1d130 541600201e6480f54ae09e58d16b154d4b4b331d 2024-05-14T14:27:19+03:00 Radoslav Gerganov ggml : add RPC backend (#6829) 541600201e6480f54ae09e58d16b154d4b4b331d efc8f767c8c8c749a245dd96ad4e2f37c164b54c 2024-05-14T09:33:42+02:00 slaren llama : disable pipeline parallelism with nkvo (#7265) e586ee42595500c53938e937b6b6ad5353ad76dc cbf75894d256f1861f6409565db599365de3d4b8 2024-05-12T19:40:08-07:00 Benjamin Findley change default temperature of OAI compat API from 0 to 1 (#7226) cbf75894d256f1861f6409565db599365de3d4b8 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 2024-05-13T08:04:29+08:00 Neo Zhang [SYCL] Add oneapi runtime dll files to win release package (#7241) 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 dc685be46622a8fabfd57cfa804237c8f15679b8 2024-05-13T08:02:55+08:00 Neo Zhang [SYCL] update CI with oneapi 2024.1 (#7235) 988631335a20d06497f58be0b8ba13adb4323a22 f99e1e456eaf69cc38c1982a2693ce41c0f897ef 2024-05-11T04:13:02-04:00 Steve Grubb server : free llama_batch on exit (#7212) 5ae3426b0b64672991563d4c28b2018b9f961467 b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 2024-05-11T10:11:28+02:00 Johannes Gäßler server: fix reported top tokens for temperature 0 (#7203) 4e3880978f8b1bf546dd4e6f3b524d6b8739c49c f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 2024-05-10T07:01:08-04:00 Justine Tunney Fix memory bug in grammar parser (#7194) d46dbc76f8770caec0175f1e57777173c70556a0 0961d866044143eefec5b525e991611f73fd4f6e 2024-05-09T16:40:42+03:00 Georgi Gerganov readme : add scheduled server workflow status badge 47345248827f426038098d016ed11975021b4919 07cd41d0965829463eff73eda3348aedbfd3a444 2024-05-09T17:34:37+08:00 Albert Jin opencl : alignment size converted from bits to bytes (#7090) bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 26458af1d63c85195cd96cd1673051e332d06d30 2024-05-08T20:12:06+01:00 JohnnyB server : add themes + favicon (#6848) 911b3900dded9a1cfe0f0e41b82c7a29baf3a217 ad211edef5db1f1fb955874b7ca6a67bd0c88708 2024-05-08T14:27:58+02:00 Johan server : add_special option for tokenize endpoint (#7059) 1fd9c1741d864d01cd7ec6d67227b92d7bfabf22 4cd621c26de2095cd7c4464bdec5fe2e696ef3f3 2024-05-08T13:24:14+02:00 Xuan Son Nguyen clean up json_value & server_log (#7142) 3855416027cb25d9a708ffa5581cf503a87856a6 c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 2024-05-08T02:30:09-04:00 Justine Tunney ggml : introduce bfloat16 support (#6412) af0a5b616359809ce886ea433acedebb39b12969 b6aa6702030320a3d5fbc2508307af0d7c947e40 2024-05-07T23:07:58+02:00 Johannes Gäßler server: fix incorrectly reported token probabilities (#7125) 260b7c65296fba0568eeb1ff05244ea0be206b54 53d6c52e227dedef347b21e28febcfb9caeecdad 2024-05-07T13:44:29-05:00 Kyle Mistele server : update readme with undocumented options (#7013) 8f8acc8683a00ce40fa5a81161a079d2167126e6 ca3632602091e959ed2ad4c09c67a7c790b10d31 2024-05-05T13:38:55+02:00 Sigbjørn Skjæret Disable benchmark on forked repo (#7034) cf768b7e71cbcc9886c753ae963c2b68893d02e4 fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c 2024-05-04T13:10:15-03:00 Jeximo Tidy Android Instructions README.md (#7016) 03fb8a002df2e96104f9e06de9c78d2a8ed91e92 92139b90af4841d7fd060b526bdd443b621770ff 2024-05-04T12:06:40+03:00 maor-ps If first token generated from the server is the stop word the server will crash (#7038) 3ea0d36000e2314baba7e9fc6a97f08670a6f7e4 1613ef8d8eb2479ba55c4d598e08c8f3f18a0fed 2024-05-01T17:52:55+02:00 Johannes Gäßler Server: add tests for batch size, different seeds (#6950) 9c67c2773d4b706cf71d70ecf4aa180b62501960 952d03dbead16e4dbdd1d3458486340673cc2465 2024-04-30T12:16:08+03:00 Georgi Gerganov ggml : add Flash Attention (#5021) 8843a98c2ba97a25e93319a104f9ddfaf83ce4c4 b8c1476e44cc1f3a1811613f65251cf779067636 2024-04-30T00:52:50+01:00 Olivier Chafik Improve usability of --model-url & related flags (#6930) b7368332e24c5b2c8038bf8267f43632783fcc35 928e0b7013c862cf10701957b3d654aa70f11bd8 2024-04-27T17:50:48+02:00 Pierrick Hymbert ci: server: tests python env on github container ubuntu latest / fix n_predict (#6935) 928e0b7013c862cf10701957b3d654aa70f11bd8 0c4d489e29e53589bf13a801fe7c94b7b546d8f6 2024-04-26T19:08:30+01:00 agray3 Reset schedule earlier to allow overlap with ggml graph computation on device (#6933) 0c4d489e29e53589bf13a801fe7c94b7b546d8f6 017e6999b5184234370b22a2f868e1be911e8d88 2024-04-26T20:06:33+02:00 Pierrick Hymbert quantize: add imatrix and dataset metadata in GGUF (#6658) bbe3c6e76157a5d806fdc155451f0ca8936248ee 7f5ff558eed0f732af8f25c2ab0645610bdec80c 2024-04-26T12:27:25+02:00 Pierrick Hymbert ci: server: fix python installation (#6925) 7f5ff558eed0f732af8f25c2ab0645610bdec80c 9e4e077ec50fde6049b128662c72d37a3c28e34b 2024-04-26T12:15:30+02:00 Pierrick Hymbert server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638) 9e4e077ec50fde6049b128662c72d37a3c28e34b 83b72cb086ce46a33dececc86bfe4648b6120aa8 2024-04-26T11:11:51+02:00 Pierrick Hymbert ci: server: fix python installation (#6922) 83b72cb086ce46a33dececc86bfe4648b6120aa8 d4a9afc1009f0da88d04b2c5f672d81d5ae94675 2024-04-26T10:41:53+03:00 Georgi Gerganov Merge pull request from GHSA-p5mv-gjc5-mwqv d4a9afc1009f0da88d04b2c5f672d81d5ae94675 7d641c26ac73956a54b204cabefe85c764823678 2024-04-26T09:27:49+02:00 Pierrick Hymbert ci: server: fix python installation (#6918) 7d641c26ac73956a54b204cabefe85c764823678 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 2024-04-26T09:26:59+02:00 Pierrick Hymbert ci: fix concurrency for pull_request_target (#6917) 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 2024-04-26T09:26:16+02:00 Pierrick Hymbert bench: server add stop word for PHI-2 (#6916) 3fe847b5747676ee1bf90371c46ed0bc66b57240 37246b1031b1680c0dcaf20aef736d6b446203fa 2024-04-24T12:54:24+02:00 mgroeber9110 server : do not apply Markdown formatting in code sections (#6850) 37246b1031b1680c0dcaf20aef736d6b446203fa 28103f4832e301a9c84d44ff0df9d75d46ab6c76 2024-04-24T05:15:29-05:00 Kyle Mistele common : revert showing control tokens by default for server (#6860) 28103f4832e301a9c84d44ff0df9d75d46ab6c76 c0d1b3e03e27634ac2871761f5033cf9324d472d 2024-04-24T11:08:36+02:00 Johannes Gäßler Server: fix seed for multiple slots (#6835) 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 40f74e4d739e9250431cf339ae7588b28d8d0663 2024-04-21T18:48:53+01:00 Olivier Chafik `build`: generate hex dump of server assets during build (#6661) 40f74e4d739e9250431cf339ae7588b28d8d0663 b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 2024-04-21T18:36:45+03:00 Georgi Gerganov llama : add option to render special/control tokens (#6807) b8109bc0139f15a5b321909f47510b89dca47ffc aed82f6837a3ea515f4d50201cfc77effc7d41b4 2024-04-21T00:29:50+08:00 Jan Boon doc : server tests require llama to be built with curl enabled (#6788) 637e9a86c220718d008b54842dfd294aa96d3b7a 9958c81b798a5872087b30b360e4674871f2479e 2024-04-19T13:19:01+02:00 Pierrick Hymbert server: static: upstream upgrade (#6765) 3272896d79465fd2befef3425dac8e83933b7ea4 7fc16a2c32650d46e79b382ecc6720f58c82f31b 2024-04-15T14:18:47+02:00 Pierrick Hymbert server : revert "minor layout improvements" (#6684) ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa fbbc030ba93561fac842af994c5c6c4c1147f13b 2024-04-12T19:43:38+01:00 Olivier Chafik JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555) 24ee66ed0d908d156bd0d1747b63a636a495cd7a 91c736015b66ba1d0b82cbae6313b6d5eaa61b68 2024-04-12T13:49:21+02:00 Pierrick Hymbert server : coherent log output for KV cache full (#6637) cbaadc92942c50aab599a9e4c163afc1f44f7c26 1bbdaf6ecda6f0a360dfb307b256fcb6838c560b 2024-04-11T19:47:34+01:00 Olivier Chafik grammars: 1.5x faster inference w/ complex grammars (vector reserves / reuses) (#6609) 400d5d722d7edf7de0cf24a18c42b183c65047d2 5dc9dd7152dedc6046b646855585bd070c91e8c8 2024-04-09T01:31:47-07:00 Ed Lee server : detect search query to start webchat (#6554) e3c337d87ca650972105a51c6ce302dd236c07ad beea6e1b16e783a0886e78dec01002a8c00db24d 2024-04-08T06:02:30-07:00 Rick G llama : support negative ith in llama_get_ API (#6519) beea6e1b16e783a0886e78dec01002a8c00db24d 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 2024-04-08T20:43:30+08:00 Jan Boon llama : save and restore kv cache for single seq id (#6341) b66aec675c1571a06b3570b858ae711246f96f84 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d 2024-04-03T22:57:20+02:00 Daniel Bevenius backend : fix typo in scheduler documentation (ggml/781) 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d 75cd4c77292034ecec587ecb401366f57338f7c0 2024-04-06T10:31:33-04:00 Clint Herron Tests: Added integration tests for GBNF parser (#6472) 75cd4c77292034ecec587ecb401366f57338f7c0 a8bd14d55717754a1f48313a846a2b16fa998ad2 2024-04-06T05:40:47+02:00 Pierrick Hymbert ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495) 0a1d889e27d6aaa3293dd2c692b849a9bcf4b474 7dda1b727ef1730783a6077136d28b83e70dd397 2024-04-04T17:31:22+01:00 Ed Lepedus server: add cURL support to server Dockerfiles (#6474) 2e66913e5f56209f4c949f98e431925b78e7e84d 8120efee1d9931b514aeb5a047209d576f23286c 2024-04-04T11:03:00-04:00 Shakhar Dasgupta server: allow penalizing repetition of newlines on server webpage (#6431) 7a2c92637ae265654a68f62e6a7610b358255d3f 4bcd6b959ca3991084ad1d8464caf2a734e29b1d 2024-04-04T11:57:58+02:00 Pierrick Hymbert ci: bench: add more ftype, fix triggers and bot comment (#6466) 4399f13fb9462cd06f3f154d0aee738425000fea 1a43c7254ed5de91d09274b853db843c518f1b64 2024-04-04T09:34:58+03:00 Georgi Gerganov server : remove obsolete --memory-f32 option 1a43c7254ed5de91d09274b853db843c518f1b64 72d73af65132792a52433952ca4729b01c36cde2 2024-04-04T01:33:48-05:00 Xiao-Yong Jin server : add option to disable KV offload (#6468) 5fb1574c8112c757fc202fdae279da883f34e610 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 2024-04-03T13:22:57-07:00 Fattire A few small fixes to server's README docs (#6428) 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 bb43cf7e9d86d69ffd9c7f008f75db890a35b45a 2024-04-03T20:09:52+02:00 JH23X server : handle exception on wrong type in request (#6452) 5d4f12e4624bf4435ba26753814bedd4e9b62803 154d4ee39c38e231fb5c3910df14d2fc920fdf1b 2024-04-03T18:56:37+01:00 Ed Lepedus server: add cURL support to `server.Dockerfile` (#6461) 226e819371eec0f298d9075198394a07b23ecfa9 c50a82ce0f71558cbb8e555146ba124251504b38 2024-04-01T12:36:40+02:00 Pierrick Hymbert ci: server: verify deps are coherent with the commit (#6409) 057400a3fd457f4f214684eeb171444663b47a23 b75c38166cf0c66793a32d5c3d6cb69929dd083d 2024-03-29T08:23:22+01:00 Daniel Bevenius llama : remove redundant reshape in build_kv_store (#6369) 28cb9a09c4d10a489be1238abe7a858dcd4d65f2 cfc4d75df6399b36153ef739f2c1abee4c114bb8 2024-03-28T11:27:56+01:00 Pierrick Hymbert ci: bench: fix master not schedule, fix commit status failed on external repo (#6365) 6902cb7f2e3479f364ee177118200fb7e4e9fc92 d2d8f389960a106b66313ff1621bdb1aaaaaa285 2024-03-28T16:50:48+08:00 Eric Zhang server : stop gracefully on SIGTERM (#6348) a016026a3ac16d8c9b993a3573f19b9556d67de4 53c7ec53d5eca26b2c0c648605543a5fa6c12817 2024-03-27T20:26:49+01:00 Pierrick Hymbert server: continuous performance monitoring and PR comment (#6283) 1740d6dd4e00dedda87d6820b0e0d8e70dade340 0642b22cd12af278d6e7e459b73411947c169381 2024-03-27T08:08:59+01:00 Mateusz Charytoniuk readme : add php api bindings (#6326) 0642b22cd12af278d6e7e459b73411947c169381 a4f569e8a316cbd33d2b4de94b694d111507475a 2024-03-27T13:55:29+08:00 Eric Zhang server: public: use relative routes for static files (#6325) 557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122) 3d032ece8e6973441273601ca2981130608e287d e190f1fca6f60d80944f9e8709d343a025c4d245 2024-03-26T16:47:43+08:00 Jan Boon server : add `n_discard` parameter (#6300) ad3a0505e3b6cd777259ee35e61d428357ffc565 95ad616cddda50273e955bfe192328acd9aa4896 2024-03-25T09:42:17+01:00 Xuan Son Nguyen Server: clean up OAI params parsing function (#6284) ddf65685105a39a57b1e7f80c3aa502a6313af24 d03224ac9840351023ff8abcf4aa0542258a53df 2024-03-24T12:04:25+08:00 Meng, Hengyu [SYCL] offload op (#6217) f482bb2e4920e544651fb832f2e0bcb4d2ff69ab 1997577d5e121568ae39f538021733ccd4278c23 2024-03-23T18:07:00+01:00 Pierrick Hymbert common: llama_load_model_from_url split support (#6192) 1997577d5e121568ae39f538021733ccd4278c23 476b0251b27fb64c575507024a671e639d675594 2024-03-23T18:00:38+01:00 Pierrick Hymbert server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254) 1b26aebe4de4f048ac99996efd8a2c9af150904d 50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652 2024-03-23T13:18:45+01:00 Pierrick Hymbert server: flush stdout after logging in both text and json layout (#6253) 72114edf068a9b2f54d3b09e9a198f611be397e8 2f0e81e053b41ca28e73a841e7bdbf9820baaa57 2024-03-22T13:07:44Z Olivier Chafik json-schema-to-grammar : fix order of props + non-str const/enum (#6232) 6b8bb3a31d260a01020497c5f01025c34222fcb9 68e210b3543e0cc71268bee0920441747679ee13 2024-03-22T19:12:05+08:00 Jan Boon server : fix n_keep always showing as 0 in response (#6211) 68e210b3543e0cc71268bee0920441747679ee13 b3e94f26bab8e3b5338b5902e5af5bb01894cb4a 2024-03-22T13:08:28+02:00 Georgi Gerganov server : enable continuous batching by default (#6231) be07a03217376c53b1d95e5f658adbbbb2831555 d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f 2024-03-22T06:41:24+08:00 Jan Boon server : update readme doc from `slot_id` to `id_slot` (#6213) f372c49ccdc561ab96fb3c7d2b7cbc0f89a4b359 924ce1dce7fdf54894b462d03e7b608a6e574c32 2024-03-21T11:52:35-06:00 semidark Corrected typo to wrong file (#6199) 5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 1943c0198125a0da1a200390e82cf461f9080d99 2024-03-21T11:50:43Z Olivier Chafik json-schema-to-grammar improvements (+ added to server) (#5978) 91f8ad167dcd24b54615b468d9dd764ebe1d37ad 6b7e76d28cdf4361740054140708c71828453522 2024-03-20T13:30:36+01:00 Xuan Son Nguyen Server: version bump for httplib and json (#6169) bc0baab2ea8f806961dd3fb9f534cfeb59a2e1fc d795988d9e09f75412efe2134512914c42780ad5 2024-03-20T14:14:32+02:00 Georgi Gerganov server : allow to override -ngl in tests (#6170) 47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 bd60d82d0cc8b6852ec535495a5042dbdf05de24 2024-03-20T16:32:34+05:30 Karthick Server: Handle n_keep parameter in the request (#6174) bd60d82d0cc8b6852ec535495a5042dbdf05de24 6c0b287748327741b113d7d6018b68c63039b1c5 2024-03-20T01:33:49-04:00 Jared Van Bortel server tests : more pythonic process management; fix bare `except:` (#6146) a56d09a4407f29c21e149b44fd5308f83aa1cb09 d84c48505f60bcd358b82a751d40418c4d235643 2024-03-16T13:20:53+01:00 Pierrick Hymbert ci : close inactive issue with workflow (#6053) 877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 12247f4c69a173b9482f68aaa174ec37fc909ccf 2024-03-15T13:43:02-07:00 Theia Vogel llama : add support for control vectors (#5970) 12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033) 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae 2024-03-15T22:31:05+08:00 Ting Lou llava : change API to pure C style for Rust FFI bindgen (#6079) 43241adf22e8231ffaf3827d2c9310cc0ffd5ac5 a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 2024-03-14T12:15:39+01:00 Pierrick Hymbert server: disable debug release type sanitizer, simplify trigger (#6047) 76a936c8939c249a7c3e8e66dfefbab13eae194f 463628372d5fe3a0c1e5864aa5fc57deb7387039 2024-03-13T20:33:56+02:00 Georgi Gerganov readme : update API changes and hot topics f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017) 99b71c068f624521ad977e08e41589e2971fa1c7 306d34be7ad19e768975409fc80791a274ea0230 2024-03-13T11:39:11+01:00 Xuan Son Nguyen Server: Use multi-task for embeddings endpoint (#6001) 05b06210c954491cf0f12034b0a62bd4d69ce78b 83796e62bc9f6caae6228168e359890f51e60fee 2024-03-11T17:49:47+02:00 Georgi Gerganov llama : more consistent names of count variables (#5994) 83796e62bc9f6caae6228168e359890f51e60fee 828defefb66fc8a25404f5de845897145bf34061 2024-03-11T17:47:47+02:00 Georgi Gerganov llama : refactor unicode stuff (#5992) 828defefb66fc8a25404f5de845897145bf34061 caa106d4e05a0ab94225c220b81f9e2cd522339b 2024-03-11T14:40:42+01:00 Jakub N Update server docker image URLs (#5997) caa106d4e05a0ab94225c220b81f9e2cd522339b 3202361c5b1ba15e695b31209567ef42c22c5c32 2024-03-11T10:56:41+01:00 Xuan Son Nguyen Server: format error to json (#5961) 332bdfd7980718abf664bfa5460f2288a3314984 ecab1c75de68de7c41c254e2ae170d3b07bee6d4 2024-03-11T17:09:32+09:00 Minsoo Cheong server : maintain chat completion id for streaming responses (#5988) fa8a809a9119411bc9c3f00026550d0343f4d9b7 bcebd7dbf62fd7b293d5ed089023e4e733269c71 2024-03-10T18:17:47+01:00 Pierrick Hymbert server: ci: windows build and tests (#5968) 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 2024-03-09T23:41:49+01:00 Pierrick Hymbert server: benchmark: chat/completions scenario and other llm servers comparison (#5941) 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 d894f352bf433157232dc8dc54eacd50014e898e 2024-03-09T22:04:00+02:00 Georgi Gerganov server : print chat template info d894f352bf433157232dc8dc54eacd50014e898e 098dbaab449f5309a54871ba7e5acef72ae696de 2024-03-09T19:55:54+01:00 slaren perplexity : support using multiple sequences to allow larger batch sizes (#5946) 58308a0ecce7cc261b802f4803c38d420063db21 5b09797321430f08caf0473143a962916ab2ea89 2024-03-09T17:34:15+02:00 Georgi Gerganov server : fix metrics init (#5964) 5b09797321430f08caf0473143a962916ab2ea89 97c09585d65a95864773b4d25d66d0f708baf38d 2024-03-09T15:53:59+02:00 Georgi Gerganov ggml : remove old quantization functions (#5942) 97c09585d65a95864773b4d25d66d0f708baf38d fb215c3832236fec7380c4fb618bd7154cb196ef 2024-03-09T15:47:47+02:00 Georgi Gerganov server : clarify some items in the readme (#5957) fb215c3832236fec7380c4fb618bd7154cb196ef 2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89 2024-03-09T21:27:58+09:00 SeungWon Jeong server : normalize embeddings (#5956) 0db32beaf09d90b8959d3d0cc493ed1e45685353 8a3012a4ad08112bb3dc3f1399afec4e93780c44 2024-03-09T11:16:53Z Alexey Parfenov server : fix passing prompt as tokens (#5955) 9674aaf35cb81478eb38c3f3ebde713ec72fbb79 950ba1ab84db199f0bbdecdb2bb911f35261b321 2024-03-09T12:34:18+02:00 Georgi Gerganov server : simplify logic for empty prompts (#5953) 950ba1ab84db199f0bbdecdb2bb911f35261b321 e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea 2024-03-09T11:27:53+01:00 Xuan Son Nguyen Server: reorganize some http logic (#5939) e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 2024-03-09T02:57:09-07:00 Gabe Goodhart server : add SSL support (#5926) fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 c2101a2e909ac7c08976d414e64e96c90ee5fa9e 2024-03-09T10:30:04+01:00 Pierrick Hymbert server: tests: add truncated prompt tests, better kv cache size (#5933) c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328) 76e868821a94072fbc87cb1fcca291694319eae8 e457fb3540e0aaec47cfde0abf784c213f9216ee 2024-03-08T12:25:04+01:00 Pierrick Hymbert server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937) af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 581ed5c4fe3a8909aaa8313633ac443f471ba755 2024-03-08T12:40:02+02:00 Georgi Gerganov server : fix EOS token detection with disabled cache (#5938) 55a2a900ff4a02fc33708ac7858d595d289a3f2a 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 2024-03-07T19:42:39+09:00 Minsoo Cheong server : add `/v1/completions` endpoint (#5914) 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882) 21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862) 29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796) 231ae28f078c3148d097b301f2145f1e3e816cc1 475df1d6cf817060028d3ff763cb8097d4ec40d6 2024-03-03T12:44:03+02:00 Georgi Gerganov readme : add API changes section e6029348e86c3810d4435faee54ba822cb43e2ef 8ef969afcec1645d2d9c3ab1fc82263bba968989 2024-03-03T09:35:23+01:00 Pierrick Hymbert ci : schedule slow server tests only on Release or on demand (#5839) 8ef969afcec1645d2d9c3ab1fc82263bba968989 fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 2024-03-03T08:48:36+01:00 Pierrick Hymbert server : init http requests thread pool with --parallel if set (#5836) 9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832) 38d16b142624bdd7c41d9955752b7f7b59c5e048 c2224f003bf9cf558b1a3c57033563e11a4de9a5 2024-03-01T20:00:58+02:00 Georgi Gerganov server : remove api_like_OAI.py proxy script (#5808) 5cb02b4a012bb16c6c699c0c62c05ffa653eee0f 6ea0f010ff6967034528d9e0b8330b9b0f0b7c13 2024-03-01T10:08:08+01:00 Pierrick Hymbert server: allow to override threads server pool with --threads-http (#5794) f105471ef6aa4727afac8240da398590d7277f45 38d152160898b0173ffe4dc7df5daadcbd2eceb0 2024-03-01T09:59:43+02:00 Georgi Gerganov server : fix newlines in help (#5785) 052051d8ae4639a1c3c61e7da3237bcc572469d4 d5ab29757ebc59a30f03e408294ec20628a6374e 2024-02-29T21:42:11+01:00 Xuan Son Nguyen Server: normalize naming (#5779) 08c5ee87e4cceb603ecceac90734fcdade57311b 78aacf36344df724cdca9f1e1af849b2d2519cb8 2024-02-28T18:43:38+02:00 Georgi Gerganov llama : remove deprecated API (#5770) a693bea1e6762a17b78b6ddf4611e54136941ea2 adcb12a9bad87bc96f2f158c95892b3d04aa7ffb 2024-02-28T09:55:37+01:00 Xuan Son Nguyen server : hit Ctrl+C twice to exit (#5734) efc72253f7987ed7bdc8bde9d9fa5c7cac2f6292 7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af 2024-02-28T01:39:15-07:00 Jorge A server : add "/chat/completions" alias for "/v1/...` (#5722) b11a93df41921846a10628a7c306d5c82a549939 a33e6a0d2a66104ea9a906bdbf8a94d050189d91 2024-02-26T23:15:48+01:00 Xuan Son Nguyen fix server hangs on empty prompt (#5733) 4804215cb833841ffb15a710a16b77ca0a29eb4b 8a533f0d9078396ebaee9ba213038a1322976dee 2024-02-26T11:41:34+01:00 Pierrick Hymbert server: CI fix trailing space (#5728) 8a533f0d9078396ebaee9ba213038a1322976dee 269de86ba073b5dc9ce687c11a3bc4d7d873b962 2024-02-26T09:56:10+01:00 Pierrick Hymbert server: CI tests reduce build matrix (#5725) e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 8b350356b28f782deab63d8b0e9ae103ceb25fcd 2024-02-25T22:48:33+01:00 Pierrick Hymbert server: tests - slow inference causes timeout on the CI (#5715) 8b350356b28f782deab63d8b0e9ae103ceb25fcd bf08e00643fd529f748f0a858fd79f3061e3fa18 2024-02-25T21:46:29+01:00 Pierrick Hymbert server: docs - refresh and tease a little bit more the http server (#5718) f7625019c51ca437a5840576d92362cfa710e4a2 abbabc5e51d0d4656b438aec10b7fae9479ef37d 2024-02-25T13:43:50-05:00 compilade server : fix crash when system prompt is bigger than batch size (#5714) 930b1780269a69948d106e2d1b838ab7661f679a d52d7819b8ced70c642a88a59da8c78208dc58ec 2024-02-25T13:50:32+01:00 Pierrick Hymbert server: logs - unified format and --log-format option (#5700) d52d7819b8ced70c642a88a59da8c78208dc58ec 12894088170f62e4cad4f8d6a3043c185b414bab 2024-02-25T13:49:43+01:00 Pierrick Hymbert server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708) 9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699) 525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566) fd43d66f46ee3b5345fb8a74a252d86ccd34a409 54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea 2024-02-23T19:31:54Z AlpinDale server : add KV cache quantization options (#5684) a46f50747b2028f7f9c9883b26bfba12bf92556e c5688c6250430d2b8e0259efcf26c16dfa4c1f46 2024-02-22T09:33:24+01:00 Xuan Son Nguyen server : fallback to chatml, add AlphaMonarch chat template (#5628) c5688c6250430d2b8e0259efcf26c16dfa4c1f46 4ef245a92a968ba0f18a5adfd41e51980ce4fdf5 2024-02-22T08:27:32Z Alexey Parfenov server : clarify some params in the docs (#5640) 1ecea255ebb70750b52688393f37a63606b90e3f a00a35cef93e057eace8351a667d14d152a91ebc 2024-02-21T15:47:48+01:00 Pierrick Hymbert server: health: fix race condition on slots data using tasks queue (#5634) 6560bed3f066c876682464762cad90f1e28e3f1b 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df 2024-02-20T11:07:22-08:00 CJ Pais server : support llava 1.6 (#5553) 9c405c9f9a7cfd23511fd6b2de05dc72481119b4 5207b3fbc500f89dfe528693e96540956dbaed96 2024-02-20T15:58:27+01:00 Xuan Son Nguyen Server: use llama_chat_apply_template (#5593) c0a8c6db371cb3e4379900867b948879f5842201 b9111bd209c7b11b0592450a6ed2e0ca545b2c84 2024-02-20T08:48:19+01:00 Pierrick Hymbert server : health endpoint configurable failure on no slot (#5594) 5ee99c32f5e47c8d32634eff9a47fb32a24c276b c145f8a132b2fe1d1e65987faddbd9a40bef7a12 2024-02-18T11:11:16-08:00 Robey Holderith common, server : surface min_keep as its own parameter (#5567) c145f8a132b2fe1d1e65987faddbd9a40bef7a12 689a091bbe0537ee9abff3e15a1d74f5f3561165 2024-02-18T18:39:57+01:00 Pierrick Hymbert server : slots monitoring endpoint (#5550) e75c6279d1c8e7abb82a331f5de7124eed402de2 36376abe05a12a8cb3af548a4af9b8d0e2e69597 2024-02-18T17:31:28+01:00 Pierrick Hymbert server : enhanced health endpoint (#5548) 36376abe05a12a8cb3af548a4af9b8d0e2e69597 66c1968f7a2e895675425e875b6589f1233a1b52 2024-02-18T17:30:09+01:00 Pierrick Hymbert server : --n-predict option document and cap to max value (#5549) 66c1968f7a2e895675425e875b6589f1233a1b52 1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e 2024-02-18T08:23:16-08:00 Daniel Hiltgen server : graceful server shutdown (#5244) 6dcc02d2444c779c18d49c364c5d5c5728b6b484 5f5808ca7b7f23a1fa7a77241842bb84a0e55108 2024-02-16T11:33:25Z Alexey Parfenov server : add "samplers" param to control the samplers order (#5494) 5f5808ca7b7f23a1fa7a77241842bb84a0e55108 f486f6e1e5e9d01603d9325ab3e05f1edb362a95 2024-02-16T11:00:56+01:00 Rőczey Barnabás server : fix system prompt cli (#5516) f486f6e1e5e9d01603d9325ab3e05f1edb362a95 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 2024-02-16T01:31:07-08:00 bmwl ggml : add numa options (#5377) 0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491) aa2341298924ac89778252015efcb792f2df1e20 f5ca054855dea83f424003162f26de376e5643f6 2024-02-14T08:38:35+01:00 John llava : support v1.6 (#5267) 684780141a08200ec98eba3e982dbafd1d0b5000 85910c5b30f6e268321be8df044f5528a6efac52 2024-02-11T13:38:14Z Alexey Parfenov server : allow to specify tokens as strings in logit_bias (#5003) 907e08c1109f498b01036367804cff3082c44524 f026f8120f97090d34a52b3dc023c82e0ede3f7d 2024-02-11T11:16:22+01:00 Xuan Son Nguyen server : add llama2 chat template (#5425) 7c777fcd5dd4af7079e33390cf6a19c328a2666f e5ca3937c685d6e012ac4db40555d6ec100ff03c 2024-02-09T02:49:49-08:00 Riley Stewart server : fix prompt caching for repeated prompts (#5420) 0ef46da632c32faa1a538e5dc180994e8bbb46e1 ee1628bdfea8b0079fed0140ac2f00ef1b465b57 2024-02-07T02:17:25-06:00 Xiao-Yong Jin llava-cli : always tokenize special tokens (#5382) f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d f68664ac241a6b5c233d8f1051eef20929b06008 2024-02-07T01:15:19-05:00 Justin Parker server : update `/props` with "total_slots" value (#5373) 213d1439fadefe182f69c5f7e8dd3b4b6572ebcb 17c97fb0620448b37516a3f53fea6c482b0a30a4 2024-02-06T18:08:38Z Alexey Parfenov server : remove model.json endpoint (#5371) 8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be 31e790322133a4b1d0684527ea446e765e8a96cf 2024-02-06T04:20:59-05:00 Justin Parker server : include total "num_slots" in props endpoint (#5349) 31e790322133a4b1d0684527ea446e765e8a96cf 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 2024-02-06T04:20:00-05:00 Michael Coppola server : add `dynatemp_range` and `dynatemp_exponent` (#5352) 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 906cff55c2848fda091d888a1585915ec0c9ea9e 2024-02-06T08:16:23Z Niall Coates server : various fixes for the prompt field in /completion (#5300) a2d60c9158435ae9a6f14632f07f1acf7a3becef e6f81775323f6f4e4a30abf022a6028fa86b79ac 2024-02-05T08:10:22Z Alexey Parfenov server : allow to get default generation settings for completion (#5307) 4be04c8965578edc09194fab769b4b922b8444f5 5d55b0cd827bb0fcfedfa329a82bd5d6ef2c93ca 2024-02-05T10:43:57+03:00 Нияз Гарифзянов scripts : add non-interactive server-llm.sh (#5303) e437b37fd0b2b97e6c6ff1045ec7f901faa6498a 2d40085c26794e29c434480b9e06738e89e5686f 2024-02-02T14:23:40+02:00 Georgi Gerganov scripts : parse wtype in server-llm.sh (#5167) 6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6 e805f0fa9951081ce0a86378a7aa52b6f636b82d 2024-02-02T08:56:31+01:00 Xuan Son Nguyen docker : add build for SYCL, Vulkan + update readme (#5228) 5cb04dbc16d1da38c8fdcc0111b40e67d00dd1c3 efb7bdbbd061d087c788598b97992c653f992ddd 2024-01-31T17:30:17+02:00 Georgi Gerganov llama : remove LLAMA_MAX_DEVICES and LLAMA_SUPPORTS_GPU_OFFLOAD (#5240) e0085fdf7c758f0bc2746fc106fb29dd9df959de e6f291d15844398f8326940fe5ad7f2e02b5aa56 2024-01-30T21:19:26+02:00 Georgi Gerganov Revert "server : change deps.sh xxd files to string literals (#5221)" e6f291d15844398f8326940fe5ad7f2e02b5aa56 4003be0e5feef320f3707786f22722b73cff9356 2024-01-30T20:17:30+02:00 Georgi Gerganov server : fix context shift (#5195) 4003be0e5feef320f3707786f22722b73cff9356 fea4fd4ba7f6b754ac795387b275e1a014a77bde 2024-01-30T12:15:05-06:00 JohnnyB server : change deps.sh xxd files to string literals (#5221) 813416991ab0d1caa0d12f93ac4e8a24a2add0a3 5589921ef84a4fb1c6d1c9c34d626a5a83033db6 2024-01-30T10:18:02+01:00 divinity76 main : allow empty --prompt-cache file (#5176) 6685cc41c237544623b4b5651eceb9c4280728cc ceebbb5b21b971941b2533210b74bf359981006c 2024-01-30T17:11:46+08:00 Wu Jian Ping server : improve README (#5209) c82d18e863fcde91b4b1109b1d0c73ea4470c405 14fef85e2d5361e6b4dd7a9ecf22bb817362997d 2024-01-29T21:48:10+08:00 Wu Jian Ping server : embeddings compatibility for OpenAI (#5190) 2307523d322af762ae06648b29ec5a9eb1c73032 0f648573dde61c510560f68244f70ece7e60d8c1 2024-01-28T18:03:59+01:00 0cc4m ggml : add Vulkan backend (#2059) 39baaf55a160909bb9428bd981014218761a20cb 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 2024-01-28T01:55:31-06:00 Kyle Mistele docker : add server-first container images (#5157) ec903c034131848da9222536ff18da07ec0882a0 a1d6df129bcd3d42cda38c09217d8d4ec4ea3bdd 2024-01-27T14:38:05+01:00 Maximilian Winter server : add self-extend support (#5104) 48c857aa10aea73210a4a72da3f1a6f99269e75d 413e7b0559f922bd4de5e9eec548829d111651b1 2024-01-26T13:42:20+01:00 Xuan Son Nguyen server : refactored the task processing logic (#5065) 2bed4aa3f37cb4e39e16e9ec7b595a7738fd5faf 125d03a5036a02a983c8e98c2cdc126e061afb8e 2024-01-23T08:11:39+01:00 Xuan Son Nguyen devops : add intel oneapi dockerfile (#5068) 125d03a5036a02a983c8e98c2cdc126e061afb8e 011e8ec577fd135cbc02993d3ea9840c516d6a1c 2024-01-23T01:51:27-05:00 Michael Coppola llama.vim : added api key support (#5090) 780e24a22eb595b705cbe8284771e9ceff1c4dd2 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea 2024-01-22T21:15:08+08:00 Reinforce-II ggml : parallelize FP32 conversion when using BLAS (#5045) 7dcbe39d36b76389f6c5cd3b151928472b7e22ff 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 2024-01-21T14:42:44+02:00 Kawrakow Add ability to evauate multiple choice tasks (#5047) 7051aacfac0057fa5fac9ea46c55bffc3892d810 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 2024-01-19T11:39:11+02:00 Kawrakow winogrande: evaluate log-probs in parallel (#5036) 821f0a271e7c9ee737945245dd7abfa22cc9b5b0 96d7f56d2918ffde1995dbb32392571deb76d7fc 2024-01-18T21:33:05+01:00 Xuan Son Nguyen server : defer tasks when "slot unavailable" (#5018) 3e945cc1e9c06d2001031360e4e303e9548fb02c ad19812cda4062c9f154ef16315df41fbe6a770a 2024-01-18T19:18:21+02:00 Kawrakow HellaSwag: speed up by parallelizing log-prob evaluation (#5020) ad19812cda4062c9f154ef16315df41fbe6a770a 682986a08eb5cb04865d2e713449f17304d266d8 2024-01-18T15:33:01+02:00 Georgi Gerganov perplexity : faster HellaSwag via batching (#5017) 4feb4b33eeb1756e46084a4db9230b279af1a480 959ef0c0df725c013c7f712eaa7790b8e38a8e20 2024-01-16T18:41:42+01:00 Maximilian Winter examples : add complete parallel function calling example (#4974) 4be5ef556de830c5c4f6e45c05ef4427823fe607 0ea069b87bd296c556824e57455433b6c0357340 2024-01-13T20:45:45+02:00 Georgi Gerganov metal : remove old API (#4919) 0ea069b87bd296c556824e57455433b6c0357340 f172de03f11465dc6c5a0fc3a22f8ec254c6832c 2024-01-13T19:31:26+02:00 Georgi Gerganov server : fix prompt caching with system prompt (#4914) 356327feb3f66980ab687040495d722696d98970 ee8243adaa9a9f51ff449213383874e49efe368f 2024-01-13T09:20:46-05:00 Ziad Ben Hadj-Alouane server : fix deadlock that occurs in multi-prompt scenarios (#4905) ee8243adaa9a9f51ff449213383874e49efe368f 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 2024-01-13T14:16:11Z makomk server : fix crash with multimodal models without BOS token (#4904) e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766) 1d118386fea031f01550f8cd47a5c86296e5333f 7edefbd79cc6dea96640edc54c6b94b2b2496d8b 2024-01-11T23:23:49+02:00 Georgi Gerganov server : fix infill when prompt is empty (#4833) 4330bd83feb39683de4bd7a34cfcf672ff8ac3e4 27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 2024-01-11T19:02:48+01:00 Laura server : implement credentialed CORS (#4514) 27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 eab67950068e4b125007d027232c47d2a5831cd0 2024-01-11T12:51:17-05:00 Michael Coppola server : support for multiple api keys (#4864) eab67950068e4b125007d027232c47d2a5831cd0 d8d90aa343c22fe01429d3540e47ded87e9dcb9d 2024-01-11T12:41:39-05:00 Behnam M server : add `LOG_INFO` when model is successfully loaded (#4881) 43f76bf1c362c067fce46bb8dcda0b64af8a9533 2f043328e3116724d15b915b5c6078e2df860a69 2024-01-11T16:14:52Z pudepiedj main : print total token count and tokens consumed so far (#4874) 2f043328e3116724d15b915b5c6078e2df860a69 2a7c94db5fb67b2f8882d2d16a11bf5d8d12d397 2024-01-11T09:33:26-05:00 Isaac McFadyen server : fix typo in model name (#4876) 7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b 2024-01-11T02:12:05-05:00 Behnam M server : update readme to document the new `/health` endpoint (#4866) 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b cd108e641dbdedd8c5641c4cec1762f751f38136 2024-01-11T09:10:34+02:00 Georgi Gerganov server : fix build + rename enums (#4870) cd108e641dbdedd8c5641c4cec1762f751f38136 57d016ba2d46a6e22517a31a75cebb48f9e234b6 2024-01-10T14:56:05-05:00 Behnam M server : add a `/health` endpoint (#4860) 128de3585b0f58b1e562733448fc00109f23a95d 8c5833031857c9e9ada61948bae894ab9c785f86 2024-01-09T05:02:05-05:00 Behnam M server : update readme about token probs (#4777) 8c5833031857c9e9ada61948bae894ab9c785f86 18c2e1752c3b387689e9e73d7d8a1a3b1511ce23 2024-01-09T10:12:43+01:00 Zsapi server : add api-key flag to documentation (#4832) 67984921a70a7e680a24494aeb7575a66e90685d c75ca5d96f902564cbbbdd7f5cade80d53c288bb 2024-01-07T08:45:26+02:00 Georgi Gerganov server : fix n_predict check (#4798) 012cf349aec8ffb47c9def5dc018240fa3721e8b a91928014fcf51fe297823fcff0788de4f14206e 2024-01-04T19:56:33+02:00 Georgi Gerganov server : send token probs for "stream == false" (#4714) e5804313a1edaf00726ed0b96ecced07accbf50c dc891b7f7a23158d54f9383790b92c79cc5906c1 2024-01-04T03:17:09-05:00 Michael Coppola server : fix options in README.md (#4765) f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099 f3f62f0d835d559e80714bbeb05d03125574e3dd 2024-01-03T03:43:19-05:00 Justin Parker server : throw an error when `slot unavailable` (#4741) f3f62f0d835d559e80714bbeb05d03125574e3dd 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 2024-01-02T21:07:47+02:00 Georgi Gerganov metal : optimize ggml_mul_mat_id (faster Mixtral PP) (#4725) 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 540938f8904707dd74cb3be18495f853b312e72f 2024-01-02T15:48:49Z Phil H server : add token counts to html footer (#4738) 0040d42eeb237197054cc7790df5776eacfa608e 83e633c27efdf0eb0ba54249e784b0ea760b1007 2024-01-02T06:15:16-08:00 Marcus Dunn llama : replace all API facing `int`'s with `int32_t` (#4577) 5d7002d4372ebf107cfaf46fcd90df27b204f330 26f3071d714f0b27ad7f021a46a66a1085480258 2024-01-02T04:38:15-06:00 minarchist server : add --override-kv parameter (#4710) 58ba655af054715c0516ee270ad028ad9e74f357 edd1ab7bc34c10a780ee7f9a4499f7689cdad36d 2024-01-02T10:57:44+02:00 Georgi Gerganov metal : enable shader debugging (cmake option) (#4705) 9fbda719de18a9400a064c28759c39d55d687d3e 39d8bc71edcb8b6f99d46fa4216af7a15232e218 2023-12-30T23:24:42+02:00 Georgi Gerganov clip : refactor + bug fixes (#4696) 24a447e20af425fa44cf10feaa632b6bb596c80f a20f3c7465d6d1b33767757c2760643b799a81bf 2023-12-30T15:07:48+07:00 automaticcat ggml : add ggml_cpu_has_avx_vnni() (#4589) db49ff8ed7f0bb201176703441cc02911b08ef2a 60f55e888c29cbd87c4238dd19e85d0eef87245d 2023-12-29T06:24:12-08:00 Justine Tunney server : replace sleep with condition variables (#4673) 60f55e888c29cbd87c4238dd19e85d0eef87245d b93edd22f55d3e5268263c3edcdae1818505c078 2023-12-29T22:22:44+08:00 SakuraUmi server : fix OpenAI server sampling w.r.t. penalty. (#4675) b93edd22f55d3e5268263c3edcdae1818505c078 82d6eab224862a7044069fb9211dc4b29124264b 2023-12-29T06:22:10-08:00 Karthik Sethuraman server : allow to generate multimodal embeddings (#4681) 441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576) 65e5f6dadbba4b496bba27f573e473c66b446496 ea5497df5d138c83b2b0ca70aefdc4b1175c1001 2023-12-28T11:20:00-08:00 Justine Tunney Fix OpenAI server sampling w.r.t. temp and seed (#4668) 6123979952385847d8348e295d77d6e01da8aa84 b9ec82d262cb20d7f0a8a1157bfa9aace40e2625 2023-12-23T09:31:49Z Alexey Parfenov server : allow to specify custom prompt for penalty calculation (#3727) 31f27758faf4a4bd08101a57c7ec3a473f771f86 56fa50819f7a3ca2128f63b81c17c08a4454479e 2023-12-21T11:57:48-08:00 Marcus Dunn llama : allow getting n_batch from llama_context in c api (#4540) 2994f0c5a2e8c96955b422dedc93ec2595d16b82 b1306c439490c7fa4ec33594500d980d1e9e15e6 2023-12-17T19:39:02-05:00 Jared Van Bortel decode : fix logits_valid for legacy API (#4516) 0ffc92d2d23a789625f018840469af045be1e3c0 8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 2023-12-17T17:02:16+02:00 olexiyb server : disable llm logs if SERVER_VERBOSE is off (#3792) 8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 eb16dae7e70ca97396190698b29c0f9ee3388e88 2023-12-17T15:57:56+01:00 AdithyanI server : fix grammar being ignored (#4494) eb16dae7e70ca97396190698b29c0f9ee3388e88 62bd52b7bf90819e75f427a95a484cd5eee0b3c7 2023-12-17T14:56:09Z Alexey Parfenov server : fix possible ambiguity in content type charset (#4501) 62bd52b7bf90819e75f427a95a484cd5eee0b3c7 5daa5f54fdcd2b5228add1a4c43a1897b2168f35 2023-12-17T15:54:37+01:00 mzcu server : allow requests larger than 8K (#4500) 88ae8952b65cbf32eb1f5703681ea592e510e570 ee4725a686643669a8587142fa068cbf29de3ce2 2023-12-15T13:49:01+02:00 ShadovvBeast server : add optional API Key Authentication example (#4441) 948ff137ec37f1ec74c02905917fa0afc9b97514 4d98d9a65665eee3838cef936641f640e3f5b649 2023-12-13T23:57:15+04:00 shibe2 server : fix handling of characters that span multiple tokens when streaming (#4446) fecac45658a99eddc4d6e36ba0310ca8f87a77f0 9494d7c4774ab745490b5a19570ff7747a194143 2023-12-12T04:12:35-06:00 kalomaze server : tweak default sampling parameters (#4367) d9d4cfef64ea416dd66632173787d03ffb180cc7 41a11aaf99feff4901e4c8dc48ad00766c5da4e9 2023-12-12T11:25:29+02:00 Vladimir Zorin server : fix local model name in server (#4420) bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 81bc9214a389362010f7a57f4cbc30e5f83a2d28 2023-12-07T13:03:17+02:00 Georgi Gerganov llama : per-layer KV cache + quantum K cache (#4309) 05cd6e5036d72d0930de4d8f6be7bce09e8dda24 caa9249217c5fd524b900add5ddcbeaa20cbcb12 2023-12-06T20:21:59+02:00 Georgi Gerganov server : recognize cache_prompt parameter in OAI API (#4347) 23b5e12eb5a76489b4c3ee22213a081da68b1809 d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 2023-12-04T17:04:21+01:00 Daniel Bevenius simple : update error message for KV cache check (#4324) 33e171d1e9fc4903f9314b490d77fb8d58331b63 6949b50df56ee58a2d76d45487942cb211c08629 2023-12-03T01:10:43-08:00 Ed Lee server : fix OpenAI API `stop` field to be optional (#4299) 6949b50df56ee58a2d76d45487942cb211c08629 d7b800b8bc490a221acbd83c575206a907f2f6e2 2023-12-03T10:03:25+01:00 Rickard Edén py : add grammar to oai like api (#4294) 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de f43f09366dfd018e4568e23a232aaa8c4f7cfc78 2023-11-30T17:25:49-05:00 Ziad Ben Hadj-Alouane server : add --log-disable to disable logging to file (#4260) f43f09366dfd018e4568e23a232aaa8c4f7cfc78 d2809a3ba2780e00fce5a6149a7eda09f1c0e906 2023-11-30T17:25:04-05:00 Ziad Ben Hadj-Alouane server : add single-client multi-prompt support (#4232) e2bd725f4b39bc5c6234858d158e01248f5ab5bd 1f5cd83275fabb43f2ae92c30033b384a3eb37b4 2023-11-30T20:50:40Z rhjdvsgsgks py : fix oai proxy (#3972) af19d3573481d409b3c4e55494810eb1f65a9aae e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb 2023-11-25T11:29:06+02:00 Georgi Gerganov server : OAI API compatibility (#4198) 6b0a7420d03b9d13cb0e9439a01ce8476d8bf093 d103d935c0e75769a6a597f7a64cab72c6cc3e79 2023-11-23T19:07:56+02:00 Georgi Gerganov llama : KV cache view API + better KV cache management (#4170) 9d5949f04b1f8b76184818abbd99938c2020803f ff8238f71d56245f4a6dbea693f4ebd81263464d 2023-11-23T12:34:20+01:00 Daniel Bevenius examples : fix typo in parallel example doc comment (#4181) 936c79b2275a8f15f3512e63de615c676904d650 262005ad9ded375e9c544a02c18ef6254fe185a2 2023-11-19T11:54:10-05:00 SoftwareRenderer server : relay error messages (#4131) 9e87ef60e18d69338c5efea314aa7e718bf2040a c7cce1246e248124117ae5bc058923e3ade95f11 2023-11-17T16:24:07+01:00 Jannis Schönleber common : improve yaml log escaping (#4080) 4760e7cc0b68570d58f55e8dda469805d1759d0d bb50a792ec2a49944470c82694fa364345e95170 2023-11-13T14:16:23+02:00 Georgi Gerganov sync : ggml (backend v2) (#3912) 532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd e86fc56f7521ca4b18d1d9939e82abd40c2f1c01 2023-11-11T22:04:58-08:00 Richard Kiss Fix some documentation typos/grammar mistakes (#4032) d96ca7ded77df764db797b68b4a29e34c5b56285 34b0a082074b073eb14c2bd93c0c070e20ddcd16 2023-11-11T05:48:21Z Alexey Parfenov server : fix crash when prompt exceeds context size (#3996) 4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf df9d1293defe783f42bc83af732d3c670552c541 2023-11-11T06:49:33+08:00 Jhen-Jie Hong server : allow continue edit on completion mode (#3950) 57ad015dc3011b046ed5a23186c86ea55f987c54 875fb42871a0f5a88fbe31a0b5edd697b84038e4 2023-11-09T04:00:34+02:00 Mihai server : add min_p param (#3877) 381efbf480959bb6d1e247a8b0c2328f22e350f8 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede 2023-11-06T22:36:23+01:00 Damian Stewart llava : expose as a shared library for downstream projects (#3613) bb60fd0bf6bb270744d86dd45b3a95af01b7de45 132d25b8a62ea084447e0014a0112c1b371fb3f8 2023-11-05T23:15:27+07:00 Thái Hoàng Tâm server : fix typo for --alias shortcut from -m to -a (#3958) 50337961a678fce4081554b24e56e86b67660163 0e40806c1cb3bdf9955ed807ffbe212be85b4c67 2023-11-01T20:11:02+02:00 Georgi Gerganov llm : add llm_build_context (#3881) f0e209324a7f663225791897877bf610f1af152d ca190bca8e844d171020d6147687e71472d71734 2023-11-01T11:29:07+02:00 Georgi Gerganov scripts : add server-llm.sh (#3868) ca190bca8e844d171020d6147687e71472d71734 71e3718abdb2771b50c9606d3a7569623a0b0afe 2023-11-01T09:28:28Z Adrian Hesketh server : re-enable completion and embedded at the same time (#3876) 82a6646e0221216c41edcdf99f5a44bb051391f5 ba231e8a6dd8ad82acfe0e4d492ff7cef6b3f0a1 2023-10-28T15:43:01+03:00 Aarni Koskela metal : try cwd for ggml-metal.metal if bundle lookup fails (#3793) 34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798) ad939626577cd25b462e8026cc543efb71528472 1717521cdb976a2219888b0e5cba36e210eee9df 2023-10-24T16:10:43-04:00 cebtenzzre server : add parameter -tb N, --threads-batch N (#3584) (#3768) 1717521cdb976a2219888b0e5cba36e210eee9df b2f7e04bd312eaf97eee0523aa09d950d585626b 2023-10-24T23:08:20+03:00 Georgi Gerganov server : do not block system prompt update (#3767) 5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce 6336701c9378c23c85d1c0e464b663ca2bbb8e60 2023-10-23T12:40:03-07:00 Marcus Dunn llama : remove token functions with `context` args in favor of `model` (#3720) 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677) d3956aea53369455008159cc405ed4c496976692 22c69a27945e7acf9690dd3210d316f22182751c 2023-10-22T20:09:51+02:00 vvhg1 main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623) d1031cf49c3b958b915fd558e23453471c29ac33 8cf19d60dc93809db8e51fedc811595eed9134c5 2023-10-20T21:07:23+03:00 Georgi Gerganov sampling : refactor init to use llama_sampling_params (#3696) a0edf73bda31c7c4e649e6f07c6fd30a729929cd f439e506e8ae8b01df2ae2156380f8156d7553e3 2023-10-20T13:06:10+03:00 Georgi Gerganov server : fix uninitialized sampling context (close #3685) 0e89203b517c95ec6675eda75d200a60d1e8921d c67fe68e417f766970fb1feaf2e66458aa24116a 2023-10-18T16:21:57+03:00 Georgi Gerganov speculative : add tree-based sampling example (#3624) 3ad1e3f1a10c1f66b4f1cd7510e0977fadbc0dfd 1142013da40e98946a109b141dd858f0ed996051 2023-10-17T18:51:02+02:00 coezbek server : documentation of JSON return value of /completion endpoint (#3632) b016596d903641f8825cd94bb6742e1de0c21017 6b3ae4da92485f979a0f45774fcf68597634db0b 2023-10-12T15:51:53+09:00 Aarni Koskela server : add completion mode (no chat) (#3582) 57dd55e2c742bfc50e0f5c6fb95c14118cff44f6 b8fe4b5cc9cb237ca98e5bc51b5d189e3c446d13 2023-10-12T09:29:04+03:00 Georgi Gerganov server : fix kv cache management (#3588) a8bdd65525ae86dea905e9866ad369b53e30ac14 70c29da118cdb02bfcbd0376c32b5b2236e48e48 2023-10-11T15:42:22-04:00 Michael Coppola server : add parameter -tb N, --threads-batch N (#3584) 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 95bd60a0a69f57e9a2ff1269667ea484a1a9bb40 2023-10-10T09:31:21+02:00 vvhg1 infill. : fix tokenization (#3508) 8e6716a102e390e930594d51302730184dac83cc 9c38d181d40b9d27f8f42152c18e7c70bfffcf37 2023-10-08T03:55:58-07:00 Ryder Wishart api_like_OAI.py : compat with Microsoft Guidance (#2746) 9c38d181d40b9d27f8f42152c18e7c70bfffcf37 a1202a31ed8c35705bd09fe91c3e7410c619bd70 2023-10-08T06:52:57-04:00 arcrank api_like_OAI.py : simplify function (#2796) cb13d73a720c42d1958bff79b6869d77b26b8cea 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 2023-10-06T21:39:33+03:00 Mihai server : docs fix default values and add n_probs (#3506) 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 0c731ca4039ccff86ffab90eaae4ca98037c4496 2023-10-06T10:10:13-06:00 Kerfuffle kv cache slot search improvements (#3493) a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416) 97af49fa395df77e4c18af0e1655b2fee67c9686 16820a5a0d885113f21021ce934f0b0027b9d69a 2023-10-06T07:44:24-05:00 Jhen-Jie Hong server : reuse llama_sample_token common util (#3494) e8b8d32e8663ffc55a02c9721af3a5190382cbb0 8f3a642ec1d878b2d0a0d15e3a4277f522790d4c 2023-10-05T09:02:55-05:00 Jhen-Jie Hong server : fix incorrect num_tokens_predicted (#3480) ac2219fef34eb5b713c286c34c6e4162c39c8f3b 48be797ffbd80b062f55778e09e97180eb25d2ab 2023-10-03T21:04:01+03:00 Georgi Gerganov llama : fix session saving/loading (#3400) 48be797ffbd80b062f55778e09e97180eb25d2ab f56e1baec361b5381e32ee6b6e56e4f00e002dfe 2023-10-03T10:09:28-07:00 Alex Klinkhamer llama : expose model's rope_freq_scale in the API (#3418) c97f01c362ac102c6994edb80008f8608539553a f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0 2023-10-02T09:42:02+02:00 vvhg1 infill : add new example + extend server API (#3296) 7f1a0fe709ea1a861da2f3759f58a28bf8953c12 16bc66d9479edd5ee12ec734973554d4493c5dfa 2023-09-29T03:51:52+08:00 Qu Zongfu ggml : release the requested thread pool resource (#3292) 0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632) ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228) dc6897404e141c74cbbf8030ecfebd74e1815411 527e57cfd8a9a26bf622c0510c21c2508a24be26 2023-09-27T17:48:33+02:00 Rickard Hallerbäck metal : reusing llama.cpp logging (#3152) be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af be6beeb8d75294552c4918fce06d7b84eebf3d79 2023-09-07T15:45:01+02:00 Kawrakow metal : parallel RoPE on Metal (#3024) e4386f417faf894f6706eec005e24d142b577fcb 35195689cd835464779c247b1c22ab9247418fd1 2023-09-04T10:28:55+02:00 Aarni Koskela server : add a subtle loading animation to the edit box (#2466) 571083f508266c4eb5cb5457d836df5dd3c173ce f04d0028444bc9b3d4225fba47e19d4c3aeb3741 2023-09-02T08:31:46+08:00 Jhen-Jie Hong server : avoid aniprompt in probabilities of final response (#2849) 44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439) c1ac54b77aaba10d029084d152be786102010eb2 730d9c681e339b76407659344e5a2cd50af7d7d5 2023-08-26T16:11:45-07:00 Bruce MacDonald server : add `/detokenize` endpoint (#2802) 730d9c681e339b76407659344e5a2cd50af7d7d5 c7d92e6dfec3f54849f3a0ba373054d29f321ea2 2023-08-26T14:13:36-06:00 Kerfuffle convert.py : advanced option (#2753) 2ba83c8685177faea3399db9564f9c52df75c366 bae5c5f679e043371bc2b4dffff8d4964d6cb953 2023-08-26T13:45:53+02:00 klosax Fix spm whitespaces (#2806) bae5c5f679e043371bc2b4dffff8d4964d6cb953 232caf3c1581a6cb023571780ff41dc2d66d1ca0 2023-08-26T10:07:43+02:00 lon examples : skip unnecessary external lib in server README.md how-to (#2804) 29674ab4e847fcaba60cc6558f0d46d5f74ae279 5439a0ab57c16b556ffa91a0953df5e46b1e7fb4 2023-08-25T18:32:45+08:00 Jhen-Jie Hong server : display token probabilities in the UI (#2489) cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717) b8ad1b66b23f9b2e6e4531e9a62753323036a556 f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 2023-08-23T02:12:12-05:00 Xiao-Yong Jin server : allow json array in prompt or content for direct token input (#2306) 46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea c63bb1d16a70c03440671b76954bb767513cead8 2023-08-22T23:10:42+02:00 goerch llama : fix whitespace escaping in tokenizer (#2724) 226255b44ef2c2794bfac48d101d35a9c2dbb965 930523c8e1cbbee5449c055daa894917fac6805e 2023-08-22T08:32:00+08:00 Jhen-Jie Hong server : fallback to default if client param is null (#2688) 6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398) 1f0bccb27929e261744c979bc75114955da49e98 f63564adfaa157ca387071d6b9a06cfaef0ef576 2023-08-19T00:45:36+03:00 Georgi Gerganov server : better default prompt (#2646) f63564adfaa157ca387071d6b9a06cfaef0ef576 2d8b76a110d76ff6b5728ff0af8477531e4db60e 2023-08-19T05:41:32+08:00 Jhen-Jie Hong server : update xxd usage for older versions compatibility (#2649) 10151bee2e38b5711335c4a38f6ca93b50223acf 0992a7b8b18a89e29a205efb48ceb559c9a08203 2023-08-17T23:34:01Z staviq server : support for saving templates in browser LocalStorage (#2486) 3ebb00935f3f0522b75df49c2769ab1774b91380 d783f7982e0e823a2626a9956359c0d36c1a7e21 2023-08-15T06:14:14+08:00 Jhen-Jie Hong server : add missing /json-schema-to-grammar.mjs (#2616) d75561df207d22790609ee0ad924302f66ac2599 348acf188c9fbe66396990f2dc83229df367969b 2023-08-14T15:36:42+02:00 Cheng Shao server : add --numa support (#2524) 2feb8934eb75ca63f3c42724229cce1df9579c8e 5517d6e69214cdead000a76983b9fe175c3f8329 2023-08-14T16:20:17+08:00 Jhen-Jie Hong server : fix default grammar by use empty string in the UI (#2604) 5517d6e69214cdead000a76983b9fe175c3f8329 f31b5397143009d682db90fd2a6cde83f1ef00eb 2023-08-14T15:16:54+08:00 Jhen-Jie Hong server : implement json-schema-to-grammar.mjs & add grammar param in the UI (#2588) 53dc399472d5bd35ee739b865e843b1996bd3814 9ca4abed893685692f90413e4d43153af12342d9 2023-08-12T06:35:14+08:00 Equim server: fixed wrong variable name in timing json (#2579) 1638757767072a4957f52b9e3594f0b67610631b 916a9acdd0a411426690400ebe2bb7ce840a6bba 2023-08-10T12:16:38+02:00 Martin Krasser Fix grammar-based sampling issue in server (#2566) 182af739c4ce237f7579facfe8f94dc53a1f573f 4329d1acb01c353803a54733b8eef9d93d0b84b2 2023-08-04T15:00:57-04:00 Cebtenzzre server: regenerate completion.js.hpp (#2515) 5f631c26794b6371fcf2660e8d0c53494a5575f7 415e99fec27be5a2e4283f1937afd17eb33fbd66 2023-08-04T06:37:24-05:00 Stephen Nichols Fixing race condition in server and partial stream handling in frontend. (#2391) 415e99fec27be5a2e4283f1937afd17eb33fbd66 ff966e7ca6af127c9405523cdb07ef8fa01bf6d6 2023-08-04T19:29:52+08:00 l3utterfly Stream save llama context data to file instead of allocating entire buffer upfront (#2488) c574bddb368424b5996cbee2ec45ec050967d404 86aeb27734481751592abd85590020b40d9224c8 2023-08-01T20:54:28+08:00 Bono Lv fix a typo in examples/server/README.md (#2478) 86aeb27734481751592abd85590020b40d9224c8 1873ff586bd8499a18f763632711bf15d253585e 2023-08-01T01:56:23-07:00 ebraminio server : Support dark mode (#2414) 34ae1caf7fdea4c4c09087002e15e6230102e6a9 d91f3f0c55663719ea03b76311e8c36ed55eb0e2 2023-07-29T03:02:10+09:00 nhamanasu examples : server chat mode with llama2 (#2400) d5512b782b27ff698007dcd175da18959d5f163f c798308e3a425eae050a1f249a576fa8c6433327 2023-07-25T11:36:17+02:00 slaren server: add rms_norm_eps parameter (#2380) c798308e3a425eae050a1f249a576fa8c6433327 41c674161fb2459bdf7806d1eebead15bc5d046e 2023-07-25T10:27:34+03:00 Henri Vasserman [Server] Escape HTML in webchat (#2368) b3f138d05849ccbce67303ac17b50ebbc268128a 5b2b2dc6ae8086bff7c9b3c17fb435cf319b7185 2023-07-24T17:54:22+03:00 Aarni Koskela Chat UI extras (#2366) 4f06592cc6b83979e4b442e8cb97b3948c857188 70d26ac3883009946e737525506fa88f52727132 2023-07-23T17:31:17-03:00 IgnacioFDM Add gqa parameter support to the server (#2351) 355c80f49e32b0b15c0a457f3bad380e57f5b9ac 83a00ce69bef9124c0702424a012ea799128b77d 2023-07-23T06:16:48-05:00 AustinMroz examples : simplify vim plugin (#2327) 24baa54ac1ff3d4156a2360deb1473af04a9b1a2 dd6c67d3cbb7b360747f776412bf01976aa32f4b 2023-07-22T12:34:51+02:00 whoreson examples : basic VIM plugin 9cf022a1889e50113fd348dc96b4557fc75a6296 e782c9e735f93ab4767ffc37462c523b73a17ddc 2023-07-21T09:42:21+02:00 Przemysław Pawełczyk make : fix embdinput library and server examples building on MSYS2 (#2235) 294f424554c1599784ac9962462fc39ace92d8a5 45a1b07e9b20c33d71d8c849ff27d693a75a0269 2023-07-19T15:06:40+08:00 Rinne llama : extend API to get max devices at runtime (#2253) 6e7cca404748dd4b1a3affd0d1296e37f4ac0a6f a6803cab946c817fb7aaf2a40b317f5d3e373bd1 2023-07-15T06:34:16-04:00 Xiao-Yong Jin llama : add custom RoPE (#2054) 3ec7e596b2ba3f43c22f441254ca2bcfa91102ba 917831c63a4138814d23da1917bf2b5d5b9faa6c 2023-07-12T01:12:35+09:00 Jinwoo Jeong docker : add '--server' option (#2174) 5656d10599bd756dc0f17284e418e704200b43f3 1d1630996920f889cdc08de26cebf2415958540e 2023-07-10T11:49:56-04:00 Evan Miller mpi : add support for distributed inference via MPI (#2099) 1d656d6360359cfdaaf5d64ed9690047b600dbcb 72421402834141df6cbdcf595fe46dbd11874dce 2023-07-08T00:24:01+08:00 Qingyou Meng ggml : change ggml_graph_compute() API to not require context (#1999) 31cfbb1013a482e89c72146e2063ac4362becae7 983b555e9ddb36703cee4d22642afe958de093b7 2023-07-05T16:51:13-04:00 Tobias Lütke Expose generation timings from server & update completions.js (#2116) 983b555e9ddb36703cee4d22642afe958de093b7 ec326d350c72afd23709a409944728a607188cc0 2023-07-05T18:03:19Z Jesse Jojo Johnson Update Server Instructions (#2113) 8567c76b5326e862be0755a8dc1dd988223fcae3 924dd22fd3ba93e097f8d19ba5cda919ca2fe2fb 2023-07-05T15:13:35Z Jesse Jojo Johnson Update server instructions for web front end (#2103) f257fd255044decffad93dee2502875ce66ad80c 7ee76e45afae7f9a7a53e93393accfb5b36684e1 2023-07-05T03:06:12+09:00 jwj7140 Add an API example using server.cpp similar to OAI. (#2009) 7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998) acc111caf93fc6681450924df9f99679c384c59e 23c7c6fc9182b041f006b86ea1e7f99911ecf344 2023-07-04T15:38:04+03:00 Henri Vasserman Allow old Make to build server. (#2098) 1cf14ccef12e19c5a5b0b17ab456242d1f8c7fdd cc45a7feb8412e84ff292207621412fffc0d3d51 2023-07-04T00:05:23+03:00 Henri Vasserman fix server crashes (#2076) d7d2e6a0f0c74f7a570dae384dfff371ac744d2a 46088f72318981341a2d646f12f6eee6aec06d65 2023-07-03T05:38:44+08:00 WangHaoranRobin server: add option to output probabilities for completion (#1962) b1ca8f36a9cdbcee5f5c425df717611a1040a897 b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf 2023-07-01T23:42:43+08:00 Qingyou Meng ggml : disable GGML_TASK_INIT and GGML_TASK_FINALIZE by default (#1995) b853d456018b10820686362af41b2f2f75f1eec6 9225baef71407d799a6f7f563b77fd7f82791416 2023-06-26T13:57:59-04:00 zrm ggml : add NUMA support (#1556) c2a08f87b8d180115d04b8688f383d1b2761b16d 66a2555ba6cab954c56d653b29c27bfbbacfbfb1 2023-06-25T08:48:36Z anon998 fix server sampling: top k sampler first (#1977) 527b6fba1d237befb324fd846bda7418c0fa394d d7b7484f74d486f77feb4c0b7af7e1718ed91651 2023-06-24T11:47:58+03:00 Didzis Gosko llama : make model stateless and context stateful (llama_state) (#1797) 20568fe60f00155fa25e92eb3a7f6b911d557967 18b35625c3c19c64b7818a12460ba5ddb006dfdc 2023-06-20T01:12:39+03:00 Henri Vasserman [Fix] Reenable server embedding endpoint (#1937) fc45a81bc642b9ef33d9004f2b363d558438a6c9 794db3e7b982fee37e3995db9c3a216a57ff65e3 2023-06-17T17:13:05+05:00 Faez Shakil exposed modules so that they can be invoked by nix run github:ggerganov/llama.cpp#server etc (#1863) 794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570) 9dda13e5e1f70bdfc25fbc0f0378f27c8b67e983 37e257c48e350cf03c353c10d31e777f8d00123d 2023-06-15T18:36:38+01:00 Srinivas Billa readme : server compile flag (#1874) 4bfcc855abdb2c9fcc3c5a84747974521909fa41 6b8312e7979b852f6b6ac9d29cd51fda16c17948 2023-06-15T20:29:48+03:00 Georgi Gerganov metal : parallel command buffer encoding (#1860) e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652) 17366df842e358768c0df7024484fffecfc7865b 44f906e8537fcec965e312d621c80556d6aa9bec 2023-06-06T21:33:23+02:00 Johannes Gäßler Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703) 7552ac586380f202b75b18aa216ecfefbd438d94 5d1830b99dfd85bb6279adb4dd94aa444afd5b5e 2023-05-29T19:31:44+03:00 Georgi Gerganov ggml : sync cgraph import / export API 1b78ed20818b72306edc7208b9bfb69a1a0d3297 337aea11390221bc925e4acb1f603f1649af2735 2023-05-28T11:48:57-06:00 Kerfuffle Only show -ngl option when relevant + other doc/arg handling updates (#1625) 0df7d63e5ba0ab8856476e121a03b985d6f15c9d 97c9b77c4fc5e2283755c4418759cfc5fc73ad05 2023-05-27T11:04:14-06:00 Kerfuffle Include server in releases + other build system cleanups (#1610) 7e4ea5beff567f53be92f75f9089e6f11fa5dabd 7780e4f479dc5af106287c164b8e186cd9b6215c 2023-05-21T11:51:18-06:00 Steward Garcia examples : add server example with REST API (#1443) affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483) ec2e10c4443209da56b431b24dd0845b60e757fb d2c59b8ba498ab01e65203dde6fe95236d20f6e7 2023-05-20T11:06:11+03:00 Georgi Gerganov llama : add llama_init_backend() API (close #1527) 7694b52b9a206b93d59139c3c7c9b55da0f5aa59 79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4 2023-05-19T10:24:59-07:00 Jason McCartney main : make reverse prompt option act as a stop token in non-interactive mode (#1032) 5ea43392731040b454c293123839b90e159cbb99 ee9654138ab0ae5f138f4abddf56ca234ea3c352 2023-05-18T19:31:01+02:00 Erik Scholz make kv_f16 the default for api users (#1517) f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360) dd7eff57d8491792010b1002b8de6a4b54912e5c 7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c 2023-04-29T08:34:41+03:00 Ivan Stepanov llama : new sampling algorithms (#1126) c4fe84fb0d28851a5c10e5a633f82ae2ba3b7fae 1d78fecdab4087028a38517e86ed129f077174d8 2023-04-24T07:40:02+03:00 Georgi Gerganov llama : refactor get / set state + remove redundant kv cache API (#1143) b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 2023-04-22T08:21:32+02:00 xaedes llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105) a32f7acc9f54dba1c728cb1e596bd00bf3b4eb5f 43ffdefb7424f79a3d510c199e2ea86684b4f824 2023-04-14T15:37:11+02:00 Pavol Rusnak py : cleanup dependencies (#962) 95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653) f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone: e986f94829bae0b9e66b326acbbba179931c84f1 c0bb1d3ce21005ab21d686626ba87261a6e3a660 2023-04-02T12:23:04+02:00 Christian Falch Added api for getting/setting the kv_cache (#685) f4f5362edb01b05c383b23f36d7b3489c77061b5 863f65e2e32dc1e6d23c96a4811bf382d6b2a548 2023-03-24T15:23:09Z Gary Mulder Update README.md (#444) 56e659a0b271436e24813a801640d015e7b05328 40ea807a972ec7b5a426f034ebfa593b5e7a06ed 2023-03-22T17:09:38+01:00 Erik Scholz fix perplexity after c-api refactor (#390) f5a77a629bd0f37ae1696747633ab42a5530ec15 da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b 2023-03-22T07:32:36+02:00 Georgi Gerganov Introduce C-style API (#370) 5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 da5303c1ea68aa19db829c634f1e10d08d409680 2023-03-20T08:24:11Z Stephan Walter Add tqdm to Python requirements (#293) 7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9 ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d 2023-03-19T12:38:44-06:00 Suaj Carrot Improved quantize script (#222)