llm: introduce k/v context quantization (vRAM improvements) (#6279)

2025-12-10 07:46:59 +00:00 · 2024-12-04 10:57:19 +11:00
parent 2b82c5a8a1
commit 1bdab9fdb1
10 changed files with 147 additions and 21 deletions
--- a/llm/memory_test.go
+++ b/llm/memory_test.go
@@ -15,6 +15,7 @@ import (

 func TestEstimateGPULayers(t *testing.T) {
 	t.Setenv("OLLAMA_DEBUG", "1")
+	t.Setenv("OLLAMA_KV_CACHE_TYPE", "") // Ensure default f16

 	modelName := "dummy"
 	f, err := os.CreateTemp(t.TempDir(), modelName)