Files
calculet-npu-research-archive/history/llama.cpp/topics/01-calrt-calculet-npu-backend.tsv
T

49 KiB

1ebce9e1a548c2329aa97f53b8b2ad50d968088dce850ff4de25ad1221abc9bf3bb30df252ccd9c362026-05-27T09:38:00+08:00Yunzhe Jiaorigin/runtime_replaceRefactor cal-llm integration by removing runtime capacity loading and adjusting request handling
2e850ff4de25ad1221abc9bf3bb30df252ccd9c369985688f7fa96f755882f96a2cd8a18114fdc42d2026-05-26T10:59:45+08:00Yunzhe JiaEnhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
39985688f7fa96f755882f96a2cd8a18114fdc42d38ca6895815671a87ceec86b4aa4eb976580ce762026-05-25T09:05:49+08:00Yunzhe JiaRefactor CalrtEngineConfig initialization by removing redundant parameters
438ca6895815671a87ceec86b4aa4eb976580ce76ddd60c928224b52eb4e1e60e01e8a1ecbb80ee452026-05-20T16:37:13+08:00Yunzhe JiaAdd support for cal-llm profile dumping to JSONL file
5ddd60c928224b52eb4e1e60e01e8a1ecbb80ee452716130010c58f1cdd9d94f0e2f8e047bc92dc662026-05-20T09:22:40+08:00Yunzhe JiaAdd cal-llm backend profiling support with command-line option
6c931ef3163940227c9b6291e04216245cce21429a43741244a646d3f8fa3ff01bb9b7d059223d0a52026-05-18T17:34:37+08:00wangbomengcalrt: fix prefill_by_ids.fix create_buf
72716130010c58f1cdd9d94f0e2f8e047bc92dc66b35bda124ccd4ed581dd6088d3ffa4931c2809b62026-05-18T08:40:54+08:00Yunzhe Jiafix n_ctx_slot error by adding runtime capacity loading for cal-llm
8a43741244a646d3f8fa3ff01bb9b7d059223d0a5b2003d6c90ef0fa26ab9e930ba3e22b355eb3d392026-05-15T14:39:53+08:00wangbomengrun llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
9b35bda124ccd4ed581dd6088d3ffa4931c2809b681a2cbd4cef5d28334ff513d6b69e593d9d1cb492026-05-15T09:19:31+08:00Yunzhe JiaImplement vocab-only model initialization and enhance cal-llm backend error handling
1081a2cbd4cef5d28334ff513d6b69e593d9d1cb493b14ed556c15529fe1f94b649f49db7156dfaf672026-05-14T16:06:37+08:00Yunzhe JiaEnhance CMake configuration for cal-llm integration by updating paths and adding library properties
113b14ed556c15529fe1f94b649f49db7156dfaf67dde8b8228081769c8d8f1e0751d47fa7875f84232026-05-14T14:34:25+08:00Yunzhe Jia- Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
12fabcc7dac4b34d83fe430980bb364b81087c7ee91e9787962f20a7e82c71589ac1dd0585454e4bfe2026-04-30T16:17:17+08:00wangbomengcalrt: fix encode dump
13f584311c716dd078c4b737eebbfda97fe12b7274a339954cc2a145a80c5ea349e7896211916cbed92026-04-30T16:05:15+08:00wangbomengcalrt: fix encode dump
141bec0db5a675ddc60fb793be2a746e8f3c8855dc465df20c3e1f3f58d0f5531c796e0941a49c32b02026-04-30T16:02:59+08:00wangbomengorigin/dev-benbench: support 2 calbins
15465df20c3e1f3f58d0f5531c796e0941a49c32b0a339954cc2a145a80c5ea349e7896211916cbed92026-04-30T09:08:12+08:00wangbomengsupport one calbin
16431ad6f1c787f1b47e9e7be14b2e1a7d8565485cefa1876bb8b2a449a55054a8c3745892f2c0f2622026-04-27T16:52:15+08:00wangbomengupdate calrt_infer
174a2a3181f1cea170105c771e6ba69d851b82b937e3ea5541259f35871c3e995331770aaca297e9ec2026-04-26T10:56:02+08:00wangbomengadd calrt-version
18e3ea5541259f35871c3e995331770aaca297e9ec0b8e43943846a1cd05c26c9186b9ef778ebae6e22026-04-26T10:55:48+08:00wangbomengadd calrt-version
195eb46fffbd2e260c540fb112314ad67bbb8f56b6005112c51e00d998b457337ca3dad53fc46e2d0b2026-04-24T16:24:51+08:00wangbomengclip: add image_to_patches; calrt: vision copy data from bf16 to fp32
20005112c51e00d998b457337ca3dad53fc46e2d0b509670642e8090a1713f5d73590b549be827aaef2026-04-24T16:24:31+08:00wangbomengclip: add image_to_patches; calrt: vision copy data from bf16 to fp32
215d219bfcef239c1e3ddd1baecc0514a9462ff6a86787a53ab9b4897c5a7b51a4062d7b90e6697d352026-04-24T09:31:32+08:00wangbomengcalrt: recover base = batch_index * dict_len
226787a53ab9b4897c5a7b51a4062d7b90e6697d35e1a76abf66178ea85656479a5e19aea7785c09f42026-04-24T09:22:02+08:00wangbomengcalrt:input of multimodel from fp32 to bf16
23e1a76abf66178ea85656479a5e19aea7785c09f499dd308adb8488fa869bb669e3335e646a938eff2026-04-22T16:29:22+08:00wangbomengcalrt:add CalcoreRT version print
2499962021f2dd1994dbbf90d5712f0ca2633f20f89af6682ef101c6d006c743c703cf150ac25f466f2026-04-17T14:48:33+08:00wangbomengorigin/dev-otcalrt: add onetoken slice and untile_prefill
25e24f775ee26ea5249d5ff6cd23b8a0a17fe1438da206460e610aef995e36e50b33e8bd41fe4775412026-04-15T10:01:09+08:00wangbomengcalrt: add copy_data_to_ibuf for vision model
26a206460e610aef995e36e50b33e8bd41fe477541d8b2aaa00049978cebac15041f960d75b552f97b2026-04-14T10:23:43+08:00wangbomengcalrt: support mixture of prefill_by_ids and prefill_by_embeds
270cd44929b442860dc0e5f88976108be82350f9dcb8153b6b8f244b223c9f4c2940ae1f212634519e2026-04-09T15:08:50+08:00Bomeng Wangrm calculet0.txt
289626239f5a9e568c9975d67dd6745fef90279a87da724f3e2a8af2c2537e3edcff41e9415ac66fef2026-04-08T17:47:04+08:00wangbomengcalrt: fix MapBuf
29da724f3e2a8af2c2537e3edcff41e9415ac66fef18814f9bf1a423ebe8f32d6043c9cbc5b21b02182026-04-08T16:58:32+08:00Bomeng Wangcalrt: add MapBuf
30bbee06d6d851e3f84f75b578047967d7e0e4a8dce126c21ed7b793b648d63533ea7ee30885f5a82a2026-04-08T11:29:36+08:00wangbomengcalrt: add test time print
315603e050af07173589f3b8850121263d86da01fd1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e2026-04-01T05:57:55+08:00wangbomengcalrt: add t_incopy and t_outcopy
321e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e893e52bda0fee99bbda1521ea733a760bc4201f12026-04-01T10:14:22+08:00wangbomengcalrt: fix slice and add infer/copy time
336d5e83902bdd3142a8ff0d3db19f02a8619e95a0e4eaab700333490e80ebefc8d023f6c1adfcc3122026-03-27T00:57:11+08:00wangbomengserver: printf calrt commit ID
34e4eaab700333490e80ebefc8d023f6c1adfcc312aeacc23a883400db0ebffb50e23355ada054da662026-03-25T09:03:55+08:00wangbomengcalrt: prefil to prefill
35aeacc23a883400db0ebffb50e23355ada054da66cbaa7492663630132adeddccd9fec5e44ffa33362026-03-25T08:49:22+08:00wangbomengcalrt: add slice only on decode
363c08ebf0e442cd730ddffd959ec676f9caf31c82613bc2b9a9d7af92efbe42d876ffcdb244f7a00e2026-03-24T02:43:03+08:00wangbomengcalrt: comment LOG_ERROR in untile_decode_cpy
37613bc2b9a9d7af92efbe42d876ffcdb244f7a00e4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa2026-03-24T02:30:12+08:00wangbomengcalrt: fix max_seq_len judgment
384e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa16cbf81a731f5839a2f6b0eb9d8539826353748b2026-03-24T01:59:03+08:00wangbomengcalrt: fix ubatch.embd cpy
3916cbf81a731f5839a2f6b0eb9d8539826353748b8b4e17d990c23025148c4abadefe1010a0dd07342026-03-23T09:38:21+08:00wangbomengcalrt: fix model_name of untile_cpy
406dacdd2cf9574214ca272a86674e7bd7ba21c4f03e6ad64467771224f072e5bad90e270951ba4cdf2026-03-23T14:42:28+08:00wangbomengcalrt: add multimodal
413e6ad64467771224f072e5bad90e270951ba4cdfb37b7d9756feb3dac2db526eeab38b572a095d472026-03-23T14:36:41+08:00wangbomengcalrt: add multimodal
42d0a1b2c758440720d42fa108b3444f54593daa73b37b7d9756feb3dac2db526eeab38b572a095d472026-03-12T16:10:28+08:00Bomeng Wangcalrt: comment out dump
437ddafbdcb9426ae3af016925b8b596f11e8742d0059009eeaf20a569abfbac5eb37dad3bb93764282026-03-10T07:13:04+08:00wangbomengcalrt: commented out cal_ctx->encode(batch)
44059009eeaf20a569abfbac5eb37dad3bb93764281b073661d1311b5300173993b9f31ee7241d86062026-03-10T07:04:22+08:00wangbomengcalrt: add multimodel
456295273c5866b9249bacdedbfc3a31877e6e6a85c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d72026-03-10T06:54:41+08:00wangbomengarg: update hf_repo url to https://download.calculet.tech:9443
46f8fba66b657c51a1df1efc7267bfea9f6140cebfdb4a61d2234c2f457b42ecc3f7219a1e1a35508a2026-03-06T15:06:36+08:00Yunzhe Jiafix calrt_install include path
47e672e02ca1a582f9e3a9d011d9e1b4fea4942a2527b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a2026-03-06T11:47:09+08:00Yunzhe JiaMerge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
4827b82f64252779ad160a3fa76bd378c39421de360bd95719fed2f0247c8d0199dd897d24157dfae62026-03-06T11:42:45+08:00Yunzhe Jiaadapt to calrt_objs target
497a3a9a0e76bb5f530beafcfe52e87e388e93117a583c387efaf7bc030574e554088de79d09a27fbd2026-03-05T07:24:59+08:00wangbomengcalrt_infer: fix past_kv_len
50aa0a17d719326a63e0d6fea60aa0ced44e7abc33fa332e773da681f3e77d6ffe83a87edb557f758b2026-02-27T01:40:11+08:00wangbomengcalrt: add bf16_to_fp32
5149fea70a20f550bfdb59d0ffe041b54919c2244774a118df31b6a4acc8876b2a2db90d2395cc6ec32026-01-28T09:11:16+08:00Yunzhe Jiaadapt to new calbin test_case
5274a118df31b6a4acc8876b2a2db90d2395cc6ec398e8f9acfe87cd93646482cb2d942b8a132f08522026-01-13T14:32:47+08:00Yunzhe Jiasync with calrt update
538c8152a04036bb0d4756a4e08e54f514dae4e64d5d2387931528fbe04aa8d66de935147efb65ca4d2025-12-09T14:40:04+08:00Yunzhe Jiaadapt to calrt csr
54e6285a748657add8d974b78ca920c5b41753ee126b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb2025-11-27T16:58:35+08:00Yunzhe Jiaadapt to calrt
55240d9bb75241c91896afe125f2fc74698a7395f37eeb241aad429a68fb8cfa3ba85d000fb2348cd22025-11-24T12:03:00+08:00Yunzhe Jiaadapt to calrt modification
56cd5e3b57541ecc52421130742f4d89acbcf77cd487c9efc3b297b8a498716b1db3d061842e6fc85b2025-11-02T18:14:04+02:00Georgi Gerganovserver : support unified cache across slots (#16736)
578da3c0e200a586f768ada6f38745acb01380174cc22473b580807929fd9e3a3344a48e8cfbe6c88f2025-10-31T13:50:33+02:00Georgi Gerganovbatch : fix consistency checks for the input positions (#16890)
58c22473b580807929fd9e3a3344a48e8cfbe6c88f0f715b4e759acceccb9f437cfd2a988fff85514a2025-10-31T10:54:19+02:00Georgi Gerganovserver : don't print user inputs to console (#16871)
5913002a08960e51a76c4d696165b5d7638d2f2b996eb208d17ea29bb60295d9a2b5e7122dfb8f4b552025-10-31T12:46:31+08:00l3utterflyggml-hexagon: respect input size when getting/setting tensor data (#16836)
6063d2fc46e17a06be5b4b5823a5ada088317f1f0aa2e0088d9242bd9e57f8b852b05a6e47843b5a452025-10-22T13:47:09-07:00Max KrasnyanskyAdd experimental ggml-hexagon backend for the Hexagon NPU (#16547)
619b9201f65a22c02cee8e300f58f480a58859122719a5a3edfd306516cc419679d69d6435943b68162025-10-22T16:58:23+02:00Pascalwebui: introduce OpenAI-compatible model selector in JSON payload (#16562)
624926419c4d74a1cf724e7163d937eb72f36e7b266ea37f57391d27736c35cd3c20c1f990b7952b742025-10-21T16:43:14+08:00Aman Guptaggml: add ggml_can_fuse_subgraph (#16662)
6379068501fac9a74cca7129a8e5a8281b410a853e0e4a0cf2fae667d3efcf52f2f52398779d986b1d2025-10-20T14:21:12+02:00Aleksander GrygierPrevent premature submission on IME input (#16673)
64f4ce81c45e7bd910e36bf44c253fc5255c49b1e417304cbcc1dd24de7741cbe57925d58e90a98ac12025-10-15T23:05:56+09:00Sam/Samuelmetal: optimise `GGML_OP_SUM` (#16559)
65f9bc66c3ebcfddb5f09e4b21253623caeb8e414aa31cf36ad946a13b3a646bf0dadf2a481e89f9442025-10-13T08:52:22+08:00hipuddingCANN: Update several operators to support FP16 data format (#16251)
6612bbc3fa50b6df03318a4451c9a2210200a0b28d9d0882840e6c3fb62965d03af0e22880ea90e0122025-10-08T22:18:41+02:00Pascalrefactor: centralize CoT parsing in backend for streaming mode (#16394)
67e29acf74fea996014380d59d31aa504ae8964258128d522c04286e019666bd6ee4d18e3fbf8772e22025-10-04T11:42:56+02:00Aclyvulkan : incremental shader builds (#16341)
6834fcc5a4ace8c69476ef2ea3857f39a60334acc491a2a5655658bb9ab77894716b82fae7ecb4b4d12025-10-02T19:43:22+02:00Piotr Wilkin (ilintar)model : Apertus model implementation (#15852)
6998c8269abefdfa8fde47dfb2769ceebc8b704e862790ecc304e384d9075c55d0628d8bf440025dc42025-09-30T17:42:57+08:00Yunzhe Jiaserver: adapt to calrt
702790ecc304e384d9075c55d0628d8bf440025dc4f528e97d894b4d93934a0711a00253eea980e7992025-09-30T17:37:58+08:00Yunzhe Jiaadapt to calrt
71f528e97d894b4d93934a0711a00253eea980e799dcbe998a6d8f13b6c9cb36bbe7b355ced2ac38422025-09-11T14:13:35+08:00Yunzhe Jiaadd calrt mtmd support
7266bb7985c3fcefda7a74aae9f8321f70eb1646c42f61c0f5bf8a620ca4c3872408803ab38cfb96132025-09-29T09:08:41+02:00Pascalfix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312)
732f61c0f5bf8a620ca4c3872408803ab38cfb96133ffd0fae473c954bb3e67526b31262048fb508d42025-09-29T12:33:12+05:30Vinkalllama-cli: prevent spurious assistant token (#16202)
74cd08fc3ecc0264b4414b68af3874a6c689ed60c1cb5bb6cc05119c24e7711ca2956cd0e6d409d3962025-09-17T01:08:02-07:00David Ribeiro Alvescommon : Fix corrupted memory error on json grammar initialization (#16038)
753d4053f77f0f78ee2b791088c02af653ebee42dddc381aa9a6dc45f00673471d34b8bddd30e775702025-09-15T16:28:31-06:00Jake KarnesCUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956)
76fd621880f3fd908424e675a41715a2dc760247a24281c7b315f8a904549fe527039b976e08098d1a2025-09-05T17:32:39-06:00Gabe GoodhartaLoRA Support (#15327)
775fac79cbc77b6d12c9feb5f34fc63586b35fd561408ff524b40baf4f51a81d42a9828200dd4fcb6b2025-09-05T14:31:24-06:00Gabe GoodhartThinking model disabled assistant prefill (#15404)
78dcbe998a6d8f13b6c9cb36bbe7b355ced2ac384287932ec016f0ec81e98a13ce5212851f8c12458a2025-09-05T14:34:07+08:00Yunzhe Jiaadd calrt API used in server side
79fb15d649ed14ab447eeab911e0c9d21e35fb243e856ed0947f27b4ec3ad269fceda0402fbab263d32025-09-04T18:10:29+02:00Daniel Beveniusllama : add support for EmbeddingGemma 300m (#15798)
805d804a4938d896f9089687a8b99911cdb43b0b94d4d8dbe383e8b9600cbe8b42016e3a4529b512192025-09-02T01:14:55+02:00Johannes Gäßlerggml-backend: raise GGML_MAX_SPLIT_INPUTS (#15722)
81886b97a5d693550c2da470c091d9d27bf38398f8111f8d06f0b9169059779a35f655b343242ccbb62025-08-25T10:47:16-05:00Jeff Bolztests: Generate unique input values for count_equal (#15487)
824afb0a746f22abaa545b3ebdb76a400d7da3a713e288693669cf9d0a71e2f2b8bd57305f063402572025-08-22T08:10:14Z65aserver : Support multimodal completion and embeddings prompts in JSON format (#15108)
835e6229a8409ac786e62cb133d09f1679a9aec13ee2c1bfff5305c661ac53e9d57cb732ff626a22422025-08-15T19:50:52+02:00Daniel Beveniuscommon : fix double bos, use common_chat_templates for add_bos and add_eos (#15326)
84ff27f80a74bbe5303acd511a6781a1de6d619b3cd3248d9b6557c75d59954c594bb53cf517591e912025-08-15T21:11:22+08:00Aaron Teoggml: initial IBM zDNN backend (#14975)
853a617cb18121a85eed17ac5585788810c5d9c1e0c42293848dd9f03eba9a6c1b85a600b398f065412025-08-13T10:58:59+08:00Yunzhe Jiaadd calrt_decode
86c42293848dd9f03eba9a6c1b85a600b398f065411cbf442f50a154aac0bf35d7b8b3436a2cdfd6f52025-08-06T15:46:06+08:00Yunzhe Jiasync with calrt API
871cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5ba67d6c03fed3193987a4ef13050e6e2a4451df42025-07-24T15:50:19+08:00Yunzhe Jia1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
88f906275537d14c8fc7c6976d944233771fd6672ca9f7541ec25c4c8547daf5ff48700ad2836e2b7d2025-08-02T10:12:41+02:00Johannes Gäßlerserver: enable token array inputs for OAI API (#15001)
8941e78c567e9a8c652e405f4f909deb598deecd31ad4a700117d1746799d2d6599e526e2c3a7938d22025-07-30T18:07:11+02:00Daniel Beveniusserver : add support for `embd_normalize` parameter (#14964)
90a118d80233d3bf92569c051346fd2638f87bf20261550f8231dc0aa478e2f537c5009ede6878ce222025-07-30T00:25:05-05:00Douglas Hanleyembeddings: fix extraction of CLS pooling results (#14927)
91d1aa0cc5d13ec3fa553de5d298f9166679e58479c8ade30036139e32108fee53d8b7164dbfda4bee2025-07-22T13:33:37+01:00Ed Addarioimatrix: add option to display importance score statistics for a given imatrix file (#12718)
926c9ee3b17e19dcc82ab93d52ae46fdd0226d4777cd465d823c378853f1f6570eebfb77f69c7e1d392025-07-21T19:03:19+02:00rmatifopencl: add conv2d kernel (#14403)
93021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2d498af3d5a00f96bdd37b534860f03a6d9e98d392025-07-18T13:35:32+02:00Oliver Simonscuda : Fix Gemma3n not executed as CUDA_GRAPH on NVGPUs (#14741)
94d9b691081c04ec5fb0daa9d2b979f915c142963dad57d3edd2f48cf6dc41a98fd9b303435ecb4fb02025-07-17T09:49:15+03:00Georgi Gerganovkv-cache : opt mask set input (#14600)
950aedae00e6fb48680324a5ac5da9cba0e35de6b56bdda13981d6c8189b7dc4f9fb8ecb91c21529f82025-07-10T18:20:13-06:00Gabe Goodhartmodel : Granite Four (#13550)
96cb9178f885d1986cc0b12feb26ff426bc8a3556c4a5686da22057867c23bd4a6be941ddc8c51e5852025-07-09T23:09:28+02:00Xuan-Son Nguyenllama : remove llm_graph_input_one (#14603)
974a5686da22057867c23bd4a6be941ddc8c51e58598bab638fb28cf95a5a66dd2d51b40d6c8f6d69a2025-07-09T14:59:57-04:00compiladellama : support Jamba hybrid Transformer-Mamba models (#7531)
98bac8bed248d15419137c5bc7f834582397baaebcb81510a7b78f7c5a6f069c4f3d0e569b9d2879132025-07-05T07:18:09+03:00Georgi Gerganoveval-callback : check for empty input (#14539)
995d46babdc2d4675d96ebcf23cac098a02f0d30cce17991c466ac835b2c71bd813c1ca7ff8dd97b942025-07-02T13:10:24-04:00compiladellama : initial Mamba-2 support (#9126)
10055a1c5a5fdefef808e95aabd3d5563af1068cc8012a81af45f0dbbab24bd819a15f57c03ceb1be902025-07-02T20:34:24+08:00Aman GuptaCUDA: add softmax broadcast (#14475)
1018846aace4934ad29651ea61b8c7e3f6b0556e3d2a01047b041aa04aeea351933658433ed004516ab2025-06-26T19:34:02+02:00Xuan-Son Nguyenmodel : gemma3n text-only (#14400)
102ba67d6c03fed3193987a4ef13050e6e2a4451df48f52c6f8abb2ed9ad967cc0bfb90acb0730111932025-06-26T17:42:32+08:00Yunzhe Jiallama-calrt: infer-op: copy data from output buffer to dst-tensor.data
1038f52c6f8abb2ed9ad967cc0bfb90acb073011193d2f325130c4ed77a3dcff2c23a926587fb08e2cc2025-06-26T15:10:45+08:00Yunzhe JiaSquashed commit of the following:
10472c6bc3f3d0cf3bf160dddf1b803fed52bcbb0a3defe2158dd5e250b4ef53994057a4ec03131a2632025-06-23T19:56:19+08:00Molly Sophiallama : better rwkv chat template and add missing `inputs.use_jinja` setting (#14336)
105d2f325130c4ed77a3dcff2c23a926587fb08e2cc6391ee7ffd97e723dfbdcc32f001e1b95a63cba62025-06-17T11:53:33+08:00Yunzhe Jiacalrt: add input_token in graph; input_token will be copy to calrt_in_buffer
106edc4a29effe716956fdfd2bc5b9cba2a6d8492f8ed3290ab34493fd3d2e0f925f816a401da4f2dfd2025-06-19T00:08:14-05:00Gabe Goodhartmemory : Hybrid recurrent cache (#13979)
107b9912ac570de8945ae9383c9ca8291027bf287dd00ba7726100d7e1941d9f5a06f56a7559945b33c2025-06-15T09:18:37+03:00Georgi Gerganovbatch : auto-gen positions + verify multi-sequence input (#14177)
108b9850050a5b5147cb2e6720b98ed8c1e8e02eff9933b205c32551848589b8339437d778cb4f2a46d2025-06-06T17:25:52+08:00Yunzhe Jiacalrt: add call chain for using calrt::infer
109dad5c44398b78467943ed0a603ea427fe9f6fc6255f6b9fa6563f6ae49113f9abdc980c12348cc1c2025-06-10T18:20:14-04:00compiladekv-cache : avoid modifying recurrent cells when setting inputs (#13834)
110056eb74534ffd3efc50a9b854156eb6876a52a44247e5c6e447707bb4539bdf1913d206088a8fc692025-06-09T11:20:06+08:00Yuanhao JiCANN: Enable labeler for Ascend NPU (#13914)
11133fea9a8592fd338abe279b89350a3af2e0ff1f7806f05a353d322e97d97e02f910de2b408a8b4ab2025-06-06T17:25:52+08:00Yunzhe Jiacalrt: add load calbin
112806f05a353d322e97d97e02f910de2b408a8b4abec9e0301fef6476df83e94842c3b625501c955662025-05-30T09:45:37+08:00Yunzhe Jiaadd calrt demo
113663445b0deb21fb602176da030d4154197a4fca67675c555a13c9f473249e59a54db35032ce8e0fc2025-06-02T10:12:20+01:00Atharva Dubeysycl: quantize and reorder the input to q8_1 when reorder is enabled (#13826)
114c962ae3382a1e759c8517a229549ee53685313a1a3938fb53d0b5183db4f5a6db21fd9122a0e47802025-05-28T22:33:54+08:00Skyserver: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
115bc583e3c63c04a11d287c108ea9e6a515ead042372b090da2c50e540143fd312a2f9aa5f151e61362025-05-27T14:06:10+02:00Xuan-Son Nguyenmtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
1164f81b33e324b1669b282eb81104e4a1131be7dcecdf94a18023c92f41808ec874ba577d9146747172025-05-27T09:40:59+03:00Georgi Gerganovllama : validate seq id batch input (#13809)
1176f180b915c9ed9ec0c240b5dcd64644988fb5e8203f582ae8fccecff225c30a2802461b44761e8222025-05-26T21:10:36+05:30Akarshan BiswasSYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611)
1182d38b6e4004fb1c341723e657fb1e71a4d3fb473e121edc4324a640be11b7e567edd39b721b0f8e42025-05-26T10:20:18+08:00Bizhao ShiCANN: Add the basic supports of Flash Attention kernel (#13627)
119f5cd27b71da3ac375a04a41643d14fc779a8057ba2d02d5793fd9af7a7224773456501691b95fd022025-05-25T01:48:08+01:00Olivier Chafik`server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
1209ecf3e66a38f20e41d221f62f05b17f70d040839faaaff5f947064d13ef8b98659d81a1384c3e57b2025-05-23T11:03:47+02:00Xuan-Son Nguyenserver : support audio input (#13714)
121797990c4bca0dca5be295c63e3fb2800dc0a69c2ab86335760ebb441574eb47f886fa1ee302e21312025-05-22T20:42:48+02:00Xuan-Son Nguyenmtmd : add ultravox audio input (#13623)
1223cc1f1f1d24472a6558c942b1c78989ff4b0e569c753d7bed0dc2cc2d5c42dfa9806cba91748392e2025-05-15T14:24:50+02:00Xuan-Son Nguyenwebui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
123bf7937112058f2815fc3825a9ff7b536ecafa3bbd590cd4c244e5f260c42c290b83a358b9d86d7632025-05-13T15:31:12+02:00Sigbjørn Skjæretscripts : support arbitrary input file formats in compare-llama-bench.py (#13455)
124d590cd4c244e5f260c42c290b83a358b9d86d7631e2809bc4b5d8db2a9ed12ac872eca832c53f5fd2025-05-13T07:12:01-06:00Gabe Goodhartmodel : Granite MoE shared (#13269)
12533eff4024084d1f0c8441b79f7208a52fad7985817512a94d636c4b6c1332370acb3e5af3ca709182025-05-09T19:29:37+02:00Xuan-Son Nguyen server : vision support via libmtmd (#12898)
1268c83449cb780c201839653812681c3a4cf17feed1a844be132dbe865358e1de81136920c1d35ac732025-05-08T15:37:29+02:00Xuan-Son Nguyenserver : (webui) revamp the input area, plus many small UI improvements (#13365)
12727aa2595321c4d9cc4086a8e67bdea204b8309b09fdfcdaeddd1ef57c6d041b89cd8fb7048a0f0282025-05-04T23:43:42+02:00Xuan-Son Nguyenmtmd : add C public API (#13184)
128e84773ab604fe0d935d03741df003716398dc57bfab647e8842c5f80da7e8f2c625dab6a0e19e5d42025-05-02T14:20:27+06:00Shakil Ahmedmtmd-cli : fix out_of_range when input image path is empty (#13244)
129cdf76586b23c67abd3ca064ee2c084c57ae240bd7d3af70b089bb349b5d17eb01839224c99ec19522025-04-29T16:00:27+02:00Johannes GäßlerCUDA: fix non-cont. inputs for batched mat mul (#13155)
13043ddab6eeeaab5a04fe5a364af0bafb0e4d350651831f538f720d1d99fba146f24f0a8e970838cc42025-04-28T21:00:20+03:00Ville Vesilehtofix(rpc): Improve input validation and error handling (#13069)
131d2b2031e5f11b826dcc718138642f147a20096655fa9e63be82225fb3249c76f39ddda3e5bdec0a32025-04-28T14:20:56+02:00Xuan-Son Nguyenllama : (mrope) allow using normal 1D position for text token (#13138)
1325fa9e63be82225fb3249c76f39ddda3e5bdec0a3a4c340f974f9b7ac0c1aae897aabaa54549a97e52025-04-28T12:18:59+02:00Xuan-Son Nguyenclip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
133ca2bb89eac2097ab4620448737e58af8452e444b2d451c80590b9ac250322769ac13d3b4870dbcf72025-04-27T16:10:34+08:00HimariOclip : Add Qwen2.5VL support (#12402)
1346408210082cc0a61b992b487be7e2ff2efbb9e36aff9d107b066c9d464f7ab1324280acfdcebf5692025-04-18T16:02:55-04:00Daniel Tangmain : Fix Ctrl+D/newline handling (#12951)
13575afa0ae31f0a51aaadcc5ff146eb7a32a7f9088c772d549264c1be058411312a54049e0dc86a0372025-04-14T17:53:53+05:30Akarshan BiswasSYCL: Fix im2col (#12910)
1368ca6e1c3a4deb6bb27ee294bfd5706098d94ae88656babd6c21a3b9b3622324cfcc80a2ab78da25b2025-04-08T14:14:59+05:00characharmserver : webui : Improve Chat Input with Auto-Sizing Textarea (#12785)
1371466621e738779eefe1bb672e17dc55d63d166bb82974011f312057b446c27267105bd7ad38105992025-04-07T23:06:44+02:00Xuan-Son Nguyenllama : Support llama 4 text-only (#12791)
138e04643063b3d240b8c0fdba98677dff6ba346784dbb3a4739e53226346c772dd72666e68b78dc5832025-03-20T14:57:43ZWoof Dogwebui : Prevent rerendering on textarea input (#12299)
139c522ce4143a2b5c277f1e5f65cd570dbd0626466081bee8c643b1f6302e9edfe789ce2d5f0be6c772025-03-14T10:47:44+02:00Georgi Gerganovgraph : simplify attn input build for unified KV cache (#12381)
140e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b2048b5913d51beab82dfe29955f9008130b936c02025-03-13T12:35:44+02:00Georgi Gerganovllama : refactor llama_context, llama_kv_cache, llm_build_context (#12181)
1412048b5913d51beab82dfe29955f9008130b936c0f08f4b3187b691bb08a8884ed39ebaa94e9567072025-03-13T06:10:05-04:00Ishaan Gandhiserver : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
142b58934c1836b5ea51dbacbe899eee125775e77c963e489c025d61c7ca5ec06c5d10f36e2b76aaa1d2025-02-19T00:01:44+02:00igardevserver : (webui) Enable communication with parent html (if webui is in iframe) (#11940)
143c48f630d1c1942fce08aa7cb18a53ace443cd611bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c12025-02-13T14:46:59+01:00Daniel Beveniusllama : add --completion-bash option (#11846)
1442d219b389e8c8c40bce547b08c8aa7add60fde1f333820d7491cd31c707a340ff23b984a84e401542025-02-07T08:55:47-05:00Christian Fillionvocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
145b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7225bbbfa39930cda38a2e5d1f3e5b382267320092025-02-07T09:15:22+01:00Daniel Beveniuscommon : add default embeddings presets (#11677)
146466ea66f338d63109540dae1df97ccfdbf4cd08f5f0db9522f347b095f84c3033d6c1c1895402e252025-01-25T07:26:01+08:00jiahao suCANN: Add Ascend CANN build ci (#10217)
147aea8ddd5165d525a449e2fc3839db77a71f4a3189f7add1cde670ff744b791f5ed6649e86a0c586c2025-01-20T10:38:32-06:00Jeff Bolzvulkan: fix coopmat2 validation failures (#11284)
1486390a998bfc63241fde8509022b0768a71bf20bb44e18ef93995f3040660750b527e5becf85899d02025-01-18T18:20:57+08:00LostRuins Concedotts : add guide tokens support (#11186)
14944e18ef93995f3040660750b527e5becf85899d03edfa7d3753c29e44b964c0ff424d2ea8d5fdee62025-01-18T02:26:50-06:00Jeff Bolzvulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281)
150437e05f714cdd67757405221578d3f95f8228b63ca001f6656c1c3d29ef479b3aa5d669453e63be52025-01-13T17:16:39+03:30ebraminioserver : (UI) Support for RTL text as models input or output (#11208)
1511bf839b1e8b9d043306c65eddd9021fe4337733ef7cd13301c2a88f97073fd119072b4cc92c08df12025-01-08T18:47:05ZEric CurtinEnhance user input handling for llama-run (#11138)
152db68c93b57bfdf6da1fbdae81080382d6998cbc9c31fc8b966817b2f0b277fd28e04a189e388972a2024-12-19T03:50:12+01:00Daniel Beveniusggml : improve inputs log sched_print_assignments (ggml/1053)
1537ae33a616f44ecc081f3dcb589be20962d1d4a92ebdee9478ca7ba65497b9b96f7457698c6ee51152024-12-23T01:09:58+03:00Billel Mokeddemllama : add Falcon3 support (#10883)
1540bf2d10c5514ff61b99897a4a5054f846e384e1e7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec2024-12-18T19:27:21+02:00Georgi Gerganovtts : add OuteTTS support (#10784)
155ce8784bdb153ff7794dde5a50b0ebfa51baa6171e52522b8694ae73abf12feb18d29168674aa1c1b2024-12-08T23:04:29+01:00Xuan Son Nguyenserver : fix format_infill (#10724)
1563573fa8e7b7f0865638b52b4e9b4d2006f0558a2d9c3ba2b7749c00df477599aa141a98b4521aa2c2024-12-07T20:21:09+01:00Xuan Son Nguyenserver : (refactor) no more json in server_task input (#10691)
157605fa66c509f9f117bd654cf0b9b3ea08bb86e80b7420131bf8ab3e067bc660439ab1ab18be7edbd2024-11-28T15:25:24+08:00leo-ponyCANN: Fix SOC_TYPE compile bug (#10519)
1589a4b79bcfa4338b922fa8cf903bd5ac058aaf46f7066b4cce2898993e943ad6af5d8f1de5840c8e92024-11-26T18:08:37+08:00Shanshan ShenCANN: Improve the Inferencing Performance for Ascend NPU Device (#10454)
159cce5a9007572c6e9fa522296b77571d2e5071357dc39012cbaf8752fabecaeb60af78ccdd1dfb73b2024-11-24T18:03:25+02:00Georgi Gerganovflake.lock: Update (#10470)
1602eb76b2a5e4ea395b971a419c95b473ab6f253e49b75f03cd2ec9cc482084049d87a0f08f9f015172024-11-18T16:08:20+02:00Georgi Gerganovflake.lock: Update (#10346)
161bcdb7a23862b61aa307fc462fadfe1e2e653d010f245cc28d4eb900efad0bc740145f58d713c6e4f2024-11-16T18:26:54+05:00MaggotHATEserver: (web UI) Add samplers sequence customization (#10255)
1629901068ac78838745e604fffb4601d315a610456231f9360d94446cd083b6b116f63991b1328c4842024-11-15T05:48:49-04:00Xuan Son Nguyenserver : (web UI) add copy button for code block, fix api key (#10242)
1634b3a9212b602be3d4e2e3ca26efd796cef13c55e505f33274d60676320216b662a97672a76ec600e2024-11-10T21:45:25+02:00Georgi Gerganovflake.lock: Update (#10243)
164505f33274d60676320216b662a97672a76ec600e160687b3ed002eee83a04de83a9cd752f928ced12024-11-11T00:42:25+05:00MaggotHATEserver : (web UI) Add back sampler settings (#10239)
165e89213492d3e01705739789733f0f2d250b4c4498fc393f246c550d2481e53323a47644a94e8d01f2024-11-09T12:47:50+05:30amritahs-ibmggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156)
16607028f9d74d895da2ca4a1956624e3f07e04e620524afeec9dad7d765ce91f5cf30c73703867cb472024-10-28T17:41:24+02:00Georgi Gerganovflake.lock: Update (#10063)
167958367bf530d943a902afa1ce1c342476098576b40f2555797f97314de749873cdc29dc102be66e22024-10-24T21:51:22+02:00Xuan Son Nguyenserver : refactor slot input data, move tokenizer to HTTP thread (#10023)
168873279b1592e433c4d9eb5065091cc98473c7beec8c07d658a6cefc5a50cfdf6be7d7265036123032024-10-20T00:22:59Zgithub-actions[bot]flake.lock: Update
16919d900a7565b8f6b0a708836a57d26966cb9efe211d47057a51f3d9b9231e6b57d0ca36020c0ee992024-10-22T15:31:06+02:00Daniel Beveniusllama : rename batch to ubatch (#9950)
170bc219750845a59166d79f0d4ee3da1993b369b8a1db8c84fc62857e1e45c1c7ea93bcd5344cb3d312024-10-21T09:37:12+03:00Georgi Gerganovspeculative : fix handling of some input params (#9963)
17192be9f12164f18ce845a5bab60cefa5f7fec6836edc265661cd707327297b6ec4d83423c43cb50a52024-10-13T06:11:26+03:00Georgi Gerganovflake.lock: Update (#9870)
1726279dac039ddeb6d5ebd125a6274fd3c37a77ba8d5ac8cf2f2e30459489e6721a17d15b92a0c42a62024-10-07T19:35:42+03:00Georgi Gerganovflake.lock: Update (#9753)
173ace4f4be37abed4801fbd54a94cf38a7ae4624168277a817f18967581b02b2248989d773e8e999982024-09-30T17:48:49+03:00Georgi Gerganovflake.lock: Update (#9680)
1749a913110cf471a8287ac06c43cbe307d3cf6df9943bcdd9703ec19af7d2a519640b5ed6f4aac3d532024-09-28T12:08:43Znopperlllama : add support for Chameleon (#8543)
1753d6bf6919f7b10726421779cd344f2da05421c68904837e0cb2f5f01bf5d5901b7aa57a026860ae42024-09-25T01:06:52-06:00Gabe Goodhartllama : add IBM Granite MoE architecture (#9438)
176f3979df762b75a2b1c0f622a2cd15d1bc60f037f1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b592024-09-23T18:43:40+03:00Georgi Gerganovflake.lock: Update (#9586)
177722ec1eb51ed53be2ab1ef31c6a1da8261803c716026da52d6942b253df835070619775d849d02582024-09-20T08:38:10+02:00Sigbjørn Skjæretperplexity : do not escape input data by default (#9548)
178e6b7801bd189d102d901d3e72035611a25456ef1e665744317c77fc3483fc5224fe6d586b5166b332024-09-12T19:46:43+08:00Dou Xinpengcann: Add host buffer type for Ascend NPU (#9406)
179cb9c933eb2a0d2b514556bdcb934b56dfe5d67716cd4e034442f71718563e600070c2b6fc389e1002024-09-11T01:46:59+03:00Georgi Gerganovflake.lock: Update (#9360)
180d2d3200b385970cb2a4658fd9342a3b1212bdb4651d964a4efdb0e8d43f5b85a775951185f6b641e2024-08-09T20:21:56+08:00Mengqing Caocann : add Ascend NPU support (whisper/2336)
181faf69d4237c9ae4d7f572b4674d1002463e8acd3e536426ded3fb4a8cd13626e53508cd92928d6c22024-09-08T00:33:13+03:00Georgi Gerganovllama : sanitize invalid tokens (#9357)
1827605ae7daf31c02211bcfec2f46635ef6ec4b98a8962422b1c6f9b8b15f5aeaea42600bcc2d441772024-09-04T02:36:43+03:00Georgi Gerganovflake.lock: Update (#9261)
1839c1ba557335c3cab46807e6478eb7d17a63361f1c6d4cb46559b359d2682cf2a002e7fe01bb7a7672024-09-02T16:51:01+05:30Tusharbuild(nix): Package gguf-py (#5664)
1841d1ccce67613674c75c9c7e3fa4c1e24e428ba489fe94ccac92693d4ae1bc283ff0574e8b3f4e7652024-08-29T07:28:14+03:00Georgi Gerganovflake.lock: Update (#9162)
18518eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75554b049068de24201d19dde2fa83e35389d4585d2024-08-19T10:10:21+03:00Radoslav Gerganovrpc : prevent crashes on invalid input (#9040)
186ee2984bdaf10c14d440ad873a049bcc09b786d9bc8ddce85606d9fb6e30745b6e4fe103eecadc73f2024-08-16T14:06:30+03:30Farbod Bijarypy : fix wrong input type for raw_dtype in ggml to gguf scripts (#8928)
187268c5660062270a2c19a36fc655168aa287aaec27e72aa74fd676a093eb9970e761085ec22734c712024-07-30T23:35:30+03:00Someonenix: cuda: rely on propagatedBuildInputs (#8772)
1889f77d899b7b0d56496f679e54b797da6199fed8e203b7f1531303a060730ec1d1e01920e703023982024-07-22T14:32:02+03:00Ivan Filipovggml: add support for float16 input tensors in pooling operations (ggml/895)
189bfb4c74981f0a40d757b450b596a9fe4ca983d262b1f616b208a4a21c4ee7a7eb85d822ff1d787af2024-07-27T16:36:44+08:00wangshuai09cann: Fix Multi-NPU execution error (#8710)
1901bdd8ae19f50bc6f108fa247e90688e5c60559fcda3913d8f9475b0d4bcbeb4936c724af4eade0922024-07-17T19:23:50+08:00hipudding[CANN] Add Ascend NPU backend (#6035)
191aaab2419eaa17ab3aa38f4ba49c7eea406999e9973cf442e7bc9baca7b3e213b261551812f1676c92024-07-14T18:54:02+03:00Georgi Gerganovflake.lock: Update (#8475)
1926af51c0d96e6268769fc05c98d5b1a5e832c0017f53226245f421bd01b47cce43a47e791de82c6362024-07-12T14:48:04+03:00Georgi Gerganovmain : print error on empty input (#8456)
1937fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2a130eccef42b75a84da270411cefeed45c153e302024-07-09T01:36:38+03:00Georgi Gerganovflake.lock: Update (#8342)
194fde13b3bb9f569f07fd8af74696ee48a43d05131470939d483d1c89b7292f78bac1fd27c42c171ce2024-07-02T11:09:52-05:00John Balisfeat: cuda implementation for `ggml_conv_transpose_1d` (ggml/854)
1956f63d646c1a06a6e09f721009a2676864ae04e3151d2ebadbbf365b894f3888361df42dbacb12b7a2024-07-04T18:38:58+02:00Daniel Beveniustokenize : add --show-count (token) option (#8299)
196a27152b602b369e76f85b7cb7b872a321b7218f73e2618bc7bf9e9fbf58c32cc3c8dd7d5df1de27e2024-07-02T22:56:46+02:00MistApproachfix: add missing short command line argument -mli for multiline-input (#8261)
197ab3679112d4c49a215a3d31550a7720b202e901597877eb10bd8e7f8023420b5b5300bcbdadd62dc2024-06-27T18:37:29+03:00Georgi Gerganovflake.lock: Update (#8071)
1980c7b3595b9e5ad2355818e259f06b0dc3f0065b37b2f4a7d193ef2475259bbe7656fcccfab4b12172024-06-15T18:53:40+02:00Xuan Son NguyenAdd `cvector-generator` example (#7514)
19910ceba354a3b152ff425e9fa97f9caaef99a46b1e95beeb1fc4621826ddd616776dbdf717366bf5c2024-06-10T02:04:50+03:00Georgi Gerganovflake.lock: Update (#7838)
2001669810d7c2446af8425aa54ff6611bf6f14646c7c4e5b7eae26581869e782015d9deca947c349972024-06-03T00:13:12+03:00Georgi Gerganovflake.lock: Update (#7686)
2012ac95c9d5678d05e253691fb1f26471675bff5ad750f60c03e4d3f53fa51910551ce87a3d508d2d72024-06-01T21:50:18+05:30HanishKVCSimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
202dff451cfa1f297348751ce6b538670e1ae9a7d5bd298382ad977ec89c8de7b57459b9d7965d2c2722024-05-26T18:54:56+03:00Georgi Gerganovflake.lock: Update (#7540)
203b9adcbbf92fc7096bee23fe61496d25652ebf7659588f196b1d7b21bdff013fcf958c249576b26192024-05-26T06:26:34+05:30HanishKVCSimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
204d041d2ceaaf50e058622d92921b3e680ffa4e9e727891f6db03de6e3fd5941983838c29bef2533522024-05-24T18:59:06+03:00Georgi Gerganovflake.lock: Update (#7232)
2051e374365d170b7f692fd7753c145e21bc14486c8197ff91462dd05bb9a3be03578114abf0c3555362024-05-22T23:23:21+05:30HanishKVCSimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
206e932094d58f513d5996c3efc9f6fed8238894c572789baf480ba7dc9281b65f601f0918e58920f542024-05-20T08:56:05+03:00Georgi Gerganovserver : return error on too large embedding input (#7389)
207e23b974f4cf9270d05062d446f406e3ff55d9451854d365abab7194b5013a523f72da19860c3c5502024-05-19T20:51:03+10:00Brianlabeler.yml: Use settings from ggerganov/llama.cpp [no ci] (#7363)
20822842164bcae3251b81ad9e497a16ef66833cb9e47345248827f426038098d016ed11975021b49192024-05-09T12:56:00+02:00Sigbjørn Skjæretgguf-py : add special token modification capability (#7166)
209b3a995b416e13ae3123a117a743e11d0ede0ca4cbcdee0daa7c5e8e086b719e5eb4073b00df70e012024-05-06T18:36:06+03:00Georgi Gerganovflake.lock: Update (#7079)
2106e472f58e40cd4acf6023e15c75a2700535c5f0b4dba7e8114d84241c842b986e008af8b88d1a0192024-04-28T00:18:27Zgithub-actions[bot]flake.lock: Update
211e9b4a1bf68c18beff4e33f23ea62c1245b2969155cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb2024-04-21T00:17:47Zgithub-actions[bot]flake.lock: Update
21217e98d4c96a583d420f12046bc92102381dbd28e1958f7e06ca2d2e3ab5698cc67513ba359144d8e2024-04-15T17:12:26+08:00Neo Zhang Jianyufix mul_mat_id() for new input, make the ut pass (#6682)
213b909236c0bf0b6e872af95df9490492ecec310ace0717e751e12af13f4eedaae8bbbd608e40d7e542024-04-07T21:25:30+03:00Georgi Gerganovflake.lock: Update (#6517)
214f87f7b898651339fe173ddf016ca826163e899d833a52448061cfd2ea44da9e6cb30b2ec22e2f6d02024-04-01T19:05:57+03:00Georgi Gerganovflake.lock: Update (#6402)
215d39b308eaf0ac91c2e1f432bf66751193a470a56c87397664964e5a2a21de1877d504b23a2a353322024-03-27T19:14:28+01:00hutlinix: moved blas availability check to package inputs so it is still overridable
216557410b8f06380560155ac7fcb8316d71ddc983755c1b2a3bbd470e9e2a3a0618b92cf64a885f8062024-03-26T10:46:41-04:00compiladellama : greatly reduce output buffer memory usage (#6122)
217b06c16ef9f81d84da520232c125d4d8a1d2737361f2fd4e727a707f85d58e0b56075c3e6334d18d82024-03-25T18:52:45+01:00Christian Köglernix: fix blas support (#6281)
21843139cc528909c3de8c144ed174e09a1f7912a802f34b865b62b1d2b5eb8a27885e4de220deeacbd2024-03-25T17:22:27+02:00Georgi Gerganovflake.lock: Update (#6266)
2192d15886bb092c3b780c676b5cc57ff3337af9c83d199ca79f279e84ebe27caafe0aa59c461d889692024-03-17T06:37:44Zgithub-actions[bot]flake.lock: Update
2205e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93cac9ee6a4ad740bc1ee484ede43e9f92b5af244c12024-03-18T16:33:44+01:00slarenbackend : set max split inputs to GGML_MAX_SRC (#6137)
2212bf8d0f7c4cc1235755ad06961ca761e458c5e55496bc79bc2b79bfd6124b8687a8dbd6a646e9b062024-03-18T11:03:04+01:00slarenbackend : offload large batches to GPU (#6083)
222f30ea47a87ed4446ad55adb265755dc9102956a2d8fd0ccf6ac8b07791ffd1575eed436930854ae32024-03-13T18:54:21+01:00slarenllama : add pipeline parallelism support (#6017)
223c78541479cf835dd9eb568ccd9a2083198a7203d621e86b331f8b0e71f79fd82a4ae1cd54c3e43962024-03-10T16:43:08+02:00Georgi Gerganovnix: update flake.lock (#5969)
224c2101a2e909ac7c08976d414e64e96c90ee5fa9e515f7d0d4fce41c752fc253acf30707c3be2531e2024-03-08T17:31:00-05:00compiladellama : support Mamba Selective State Space Models (#5328)
22521b08674331e1ea1b599f17c5ca91f0ed173be316a87ac3a52668e117d97bcea07b529c93188b3032024-03-05T16:08:35+08:00Neo Zhang Jianyu[SYCL] fix mul_mat fault in CI/unit-test (#5862)
22629ae62d2ae163e2b68aa0ad3bf2ab4636de0c957e0843afe1b37890b631bc7d3d2da2ed36c862b912024-03-04T22:31:20+02:00Georgi Gerganovllama : fix embeddings (#5796)
227fa974646e1a2024fc7dc9e6f27cf1f2f5d4a37639731134296af3a6839cd682e51d9c2109a871de52024-03-03T06:11:31+02:00Georgi Gerganovflake.lock: Update (#5842)
2282774b0c97427ee3ad3e2ee121354d078794e89d95f706718566e3a5147916dc381f3b99de0ffad472024-02-25T20:41:35+01:00slarenadd google magika inference example (ggml/748)
229c39373398803c669056304090050fe3f44b41bf9e3965cf35aac00d4e24998c8a3d0093ae1d98bd32024-02-25T00:17:11Zgithub-actions[bot]flake.lock: Update
2309e359a4f47c1b2dceb99e29706c9f7403d32ab5e4c4cb30736582cacb1a164a9d4bc8e17b1014be72024-02-24T19:16:04+01:00Pierrick Hymbertserver: continue to update other slots on embedding concurrent request (#5699)
231580111d42b3b6ad0a390bfb267d6e3077506eb3188c46cbdac05cebd936511b1d3c74112e721615f2024-02-21T05:08:22-08:00postmastersllama : add `gemma` model (#5631)
232c8e0d7efeb7634ecc2e9832e879ab9fca4510e718f1be0d42f23016cb6819dbae01126699c4bd9bc2024-02-18T00:17:07Zgithub-actions[bot]flake.lock: Update
23397a336507ed9b971d72262bec7e2b8b7016a054ac88c74f967028ae3d5ebade40ae586d20a961abc2024-02-11T00:17:31Zgithub-actions[bot]flake.lock: Update
2349392ebd49ea5ae236a55b47cbf6a13247e8a3b8c5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d42024-02-04T00:17:24Zgithub-actions[bot]flake.lock: Update
235a4b07c057a553b1ac253051efc3f040351e2eae1549a1e6cd5b39fe0dc3d4ea5515c65f17797a31e2024-01-29T14:00:10+02:00Georgi Gerganovgguf : add input validation, prevent integer overflows (ggml/709)
2361387ea21178f9f154944013d4dd9764b54c69deb26d607608d794efa56df3bdb6043a2f94c1d632c2024-01-24T12:48:14+01:00slarenllama : pre-allocate input tensors in a separate buffer (#5100)
237942c0107a7301434c0a5e7da46bc4cf2393aa556b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b52024-01-21T05:17:27+02:00Georgi Gerganovflake.lock: Update (#5054)
238c37b3474e61d609d43cccc3bde5d559e80e4f5d1158f8c9e21302114bac3c646f80ea85b52ffa0bd2024-01-16T19:13:54+02:00Georgi Gerganovflake.lock: update flake-parts, flake-parts/nixpkgs-lib, and nixpkgs (#4920)
2396efb8eb30e7025b168f3fda3ff83b9b386428ad636e5a08b203542dca53cca4eaf172c5dc4bbc9912024-01-09T13:46:46-05:00Austinconvert.py : fix vanilla LLaMA model conversion (#4818)
240880e352277fc017df4d5794f0c21c44e1eae2b8466f35a2f48e1965a13835a523e677223dbf148be2023-12-21T18:07:34+01:00howlgerpy : open merges file as 'utf-8' (#4566)
24152c8bc3cf312e1caf02d37bfb9d9d865cbe33594e4b76bbe316ee50fb17d9ac29e654c0edf830eba2023-12-05T15:05:51+05:00MaggotHATEsampling : custom samplers order (#4285)
24271e3718abdb2771b50c9606d3a7569623a0b0afe238657db2364cfb728c694470a4a81702afea7602023-11-01T08:04:02+02:00Georgi Gerganovllama : refactor graph build code (#3837)
24334b2a5e1ee4fe6295fb4420eb91131d743694c656961c4bd0b5176e10ab03b35394f1e9eab7617922023-10-26T22:53:37+03:00Georgi Gerganovserver : do not release slot on image input (#3798)
244438c2ca83045a00ef244093d27e9ed41a8cb4ea99e70cc03229df19ca2d28ce23cc817198f8972782023-10-22T22:53:08+03:00Georgi Gerganovserver : parallel decoding and multimodal (#3677)
245d3956aea53369455008159cc405ed4c49697669222c69a27945e7acf9690dd3210d316f22182751c2023-10-22T20:09:51+02:00vvhg1main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623)
246d1031cf49c3b958b915fd558e23453471c29ac338cf19d60dc93809db8e51fedc811595eed9134c52023-10-20T21:07:23+03:00Georgi Gerganovsampling : refactor init to use llama_sampling_params (#3696)
2471a159553f921a9209fed8c714494e57b3649f232281ef73c258cc1eebec8a64264240432d5878c4b2023-10-17T17:11:01+02:00staviqtokenizer : special token handling (#3538)
2480e76a8992c8200237bbc6471a53fb8796b3872f72db94d98eda56982d80238840b0652b4137a2a842023-09-28T20:40:11+02:00xaedestrain : finetune LORA (#2632)
249ec893798b7a2a803466cc8f063051499ec3d96f745855b3f1c7bdd0320aa632334d0b3e8965c26c42023-09-28T19:04:36+03:00Georgi Gerganovllama : custom attention mask + parallel decoding + no context swaps (#3228)
25080834daecf4b9021770361a6d5e1b9c7a60e6854a40f2b656fab364ce0aff98dbefe9bd9c3721cc92023-09-20T22:48:22+09:00kangflake : Restore default package's buildInputs (#3262)
2514fe09dfe665c58a753dc9eb638dd4dca1cd3548880291a1d02a07f7f66666fb576c5b1e75aa48b462023-09-16T03:02:13+08:00Meng Zhangllama : add support for StarCoder model architectures (#3187)
25244c117f41ee01c5ac8fb86bba041f08d8b87b46d43033b7bb4858da4f591715b3babdf906c9b7cbc2023-08-28T21:51:47+02:00xaedestrain : mem usage and other improvements (#2439)
253edd4c1481708fcd788b0e423268304fd26e2b1251591e2e590762011b43b10a9b6e04f13f98f2aa52023-08-27T14:19:19+03:00Georgi Gerganovllama : more tokenizer fixes (#2810)
25450526f37eba0b28336700890242ff282b949cd8304f4b1eb10f3e25750ca3e530265ce2841730e6b2023-08-26T12:53:52-04:00Cebtenzzrellama : use std::abs in llama_sample_tail_free (#2800)
255b8ad1b66b23f9b2e6e4531e9a62753323036a556f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d262023-08-23T02:12:12-05:00Xiao-Yong Jinserver : allow json array in prompt or content for direct token input (#2306)
2562d7baaf50f3277e65cf71071f61ea34823d14c30f3c3b4b1672d860800639c87d3b5d175646924692023-08-08T06:44:48-05:00AustinMrozvim : streaming and more (#2495)
2570c06204fb39aa5560e883e0ae74be9518c57d88e1fed755b1fb9babb6dbc1b4023e492950cd5a5be2023-07-25T07:19:11-05:00Xiao-Yong Jinmain : add `--in-prefix-bos` to prefix BOS to user inputs; keep EOS (#2304)
2589cf022a1889e50113fd348dc96b4557fc75a6296e782c9e735f93ab4767ffc37462c523b73a17ddc2023-07-21T09:42:21+02:00Przemysław Pawełczykmake : fix embdinput library and server examples building on MSYS2 (#2235)
259c48c525f8711780f3f7c59bf92f1760f38317218206e01de117cc65ed8713ac9fdebc57ba4532ec32023-07-15T02:40:05+08:00Shangning Xuexamples : fixed path typos in embd-input (#2214)
2605656d10599bd756dc0f17284e418e704200b43f31d1630996920f889cdc08de26cebf2415958540e2023-07-10T11:49:56-04:00Evan Millermpi : add support for distributed inference via MPI (#2099)
2617f0e9a775ecc4c6ade271c217f63d6dc93e79eaab472f3fca558b6335adbd87210ed58cfb5da37cb2023-07-04T18:33:33-05:00Nigel Boschembd-input: Fix input embedding example unsigned int seed (#2105)
26279f634a19d1c32a6cfb1befc21551ee684fced6b04606a159947566b27810508433e6ca5dbc684ba2023-07-01T18:46:00+03:00Georgi Gerganovembd-input : fix returning ptr to temporary
263cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e9d23589d638dc74577d5ff880e6d4248b795f12e2023-06-28T23:53:37+08:00ningshanwutuobangllama : support input embeddings directly (#1910)
264794db3e7b982fee37e3995db9c3a216a57ff65e35ddf7ea1fb42bac21026de2f77e0f9c069b922342023-06-17T07:53:04-04:00Randall FitzgeraldServer Example Refactor and Improvements (#1570)
265e32089b2c20b1b87b22912f4a8b93fe01647d5b92347e45e7bdb09c9a7d74b2c0bc86c2b65f0c3432023-06-13T21:04:40+02:00xaedestrain : improved training-from-scratch example (#1652)
266fa84c4b3e80199a5683438f062009c031a06c4fa12b063f0ecf280e98028e444fc492ee6222cdcdc2023-06-11T08:19:17-06:00KerfuffleFix issue where interactive mode crashes when input exceeds ctx size (#1789)
267f954edda935a70a14cf0cc45ecc7fe7d60cf3e4bf048af0230ad5381bb20b9e3c1467ec6fc7debdf2023-05-13T14:56:40+02:00xaedesggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
26841654efea879bbdf4fd794e13335929d4cf0eb9056551bc11f46b2716fdf61bb48ac28414889dc0a2023-05-08T19:45:48-07:00DannyDaemonicInterface improvements and `--multiline-input` (previously `--author-mode`) (#1040)
2692edbdb0f99336cb41f0995061c7602ed54beb86320fbf2a2a08d8edefe9b3435fa86f8b2f63f85882023-05-04T23:41:12+08:0044670main : add --in-suffix option (#1318)
270e2cd5069999181a9e4a22cf420e0491878b3062f2d099e5193d73f800b646c39e2fad08c1c1f10962023-05-02T18:13:26+02:00Ron Evansmain : switch input_noecho to input_echo to remove negation (#979)
271f4d277ae17247ee51129ef1a9ff74d377cc90b1bc9a59b70a54e0bc05777df287feaea3dbe0310c42023-04-14T17:19:17+02:00Tomáš Pazdioramain : alternative instruct mode (Vicuna support, etc.) (#863)
272723dac55fa2ba7adc6e3fc8609781d1ad03789060f07cacb05f49704d35a39aa27cfd4b419eb6f8d2023-04-14T00:03:03-07:00comexpy : new conversion script (#545)
27395ea26f6e92d620a5437f576b80868aee7f808d682d146df9b43cf677e0dbce20b03cf864958a0cc2023-04-13T14:46:23+02:00SebastianApelbenchmark : add tool for timing q4_0 matrix multiplication (#653)
274f963b63afa0e057cfb9eba4d88407c6a0850a0d8aaf3b23debc1fe1a06733c8c6468fb84233cc44f2023-04-08T12:24:37-07:00comexRewrite loading code to try to satisfy everyone:
275aaf3b23debc1fe1a06733c8c6468fb84233cc44ff2d1c472946dee2aba9077e8df73346796752b102023-04-08T17:49:39+02:00Tomáš Pazdiorafix for windows utf-8 input (#840)
2767b8dbcb78b2f65c4676e41da215800d65846edd04b8efff0e3945090379aa2f897ff125c8f9cdbae2023-03-28T17:09:55+03:00anzz1main.cpp fixes, refactoring (#571)
27733e35b8fe8f09adcac0632e9cece62e1dd629f7d19726169b379bebc96189673a19b89ab1d3076592023-03-26T07:25:46+02:00Harald FernengelExit from interactive mode if input stream is bad (#491)
2782f7bf7dd7cd7299874d582f7f34834418abf405734ab5268432fd287caa68d60bdd8aef411def3fa2023-03-25T23:38:11+02:00anzz1CMake / CI additions (#497)
27934ab5268432fd287caa68d60bdd8aef411def3fac2b25b6912662d2637d9c6e6df3a5de931e0d7ce2023-03-25T22:29:22+02:00anzz1(Windows) Set console to UTF-8 on init (#420)
280e899bf54b291e8c84173a0e534a2c262f3f63229fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c2023-03-25T14:42:09+02:00anzz1bounds checking for input prefix (#492)
281fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c58e6c9f36f97d0a3e287b97256dc5f6b0e9fb5ae2023-03-25T14:03:19+02:00anzz1feat: '--in-prefix STRING' option (#426)
28204c6f5ed6fafd63601fa06757877ed5ccf9d59917a9b6c3a8bdc1cb75fefc826dfaa7331eb63695d2023-03-24T23:17:58+02:00Georgi GerganovImmediately start processing the prompt before user input has been provided (#476)
2832e17dfd80a473099dacc0f41c9146d233c6a597220a1a4e09c522a80e2a0db51643d25fa383260652023-03-23T15:22:47-05:00rabidcopyReplace EOS with newline to prevent context/memory being flushed by EOS in interactive mode (#333)
284305ba6f0e6daa3796aad9dd18053a1945dd4cc584122dffff958cd137175b58f1f27c0913528d7ba2023-03-22T18:16:35+01:00tjohnmanDon't force immediate interactive without `-i` (#354)
28516ffc013c62f22bdaa3cdc022d7a13fd952d73fc486ae645fd3eda8b9d7413d5ff34fb65a3e337fb2023-03-21T09:42:25-07:00comexImporter for GPTQ quantized LLaMA models (#301)
2865c19c70ba631a8f5d54feb6634e0eea178911a8424568371ae0d7caf85164abe4753f36a7dba02882023-03-19T13:44:30-06:00Rickey Bowers Jrfix coloring of last `n_batch` of prompt, and refactor line input (#221)