ollama/server/routes.go

package server

import (
	"embed"
	"encoding/json"
	"fmt"
	"io"
	"log"
	"math"
	"net"
	"net/http"
	"path"
	"runtime"
	"strings"
	"text/template"

	"github.com/gin-gonic/gin"
	"github.com/lithammer/fuzzysearch/fuzzy"

	"github.com/jmorganca/ollama/api"
	"github.com/jmorganca/ollama/llama"
)

//go:embed templates/*
var templatesFS embed.FS
var templates = template.Must(template.ParseFS(templatesFS, "templates/*.prompt"))

func generate(c *gin.Context) {
	var req api.GenerateRequest
	req.ModelOptions = api.DefaultModelOptions
	req.PredictOptions = api.DefaultPredictOptions
	if err := c.ShouldBindJSON(&req); err != nil {
		c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})
		return
	}

	if remoteModel, _ := getRemote(req.Model); remoteModel != nil {
		req.Model = remoteModel.FullName()
	}

	modelOpts := getModelOpts(req)
	modelOpts.NGPULayers = 1  // hard-code this for now

	model, err := llama.New(req.Model, modelOpts)
	if err != nil {
		fmt.Println("Loading the model failed:", err.Error())
		return
	}
	defer model.Free()

	templateNames := make([]string, 0, len(templates.Templates()))
	for _, template := range templates.Templates() {
		templateNames = append(templateNames, template.Name())
	}

	match, _ := matchRankOne(path.Base(req.Model), templateNames)
	if template := templates.Lookup(match); template != nil {
		var sb strings.Builder
		if err := template.Execute(&sb, req); err != nil {
			fmt.Println("Prompt template failed:", err.Error())
			return
		}

		req.Prompt = sb.String()
	}

	ch := make(chan string)
	model.SetTokenCallback(func(token string) bool {
		ch <- token
		return true
	})

	predictOpts := getPredictOpts(req)

	go func() {
		defer close(ch)
		_, err := model.Predict(req.Prompt, predictOpts)
		if err != nil {
			panic(err)
		}
	}()

	c.Stream(func(w io.Writer) bool {
		token, ok := <-ch
		if !ok {
			return false
		}

		resp := api.GenerateResponse{
			Response: token,
		}

		bts, err := json.Marshal(resp)
		if err != nil {
			return false
		}

		bts = append(bts, '\n')
		if _, err := w.Write(bts); err != nil {
			return false
		}

		return true
	})
}

func Serve(ln net.Listener) error {
	r := gin.Default()

	r.POST("api/pull", func(c *gin.Context) {
		var req api.PullRequest
		if err := c.ShouldBindJSON(&req); err != nil {
			c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})
			return
		}

		progressCh := make(chan api.PullProgress)
		go func() {
			defer close(progressCh)
			if err := pull(req.Model, progressCh); err != nil {
				c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})
				return
			}
		}()

		c.Stream(func(w io.Writer) bool {
			progress, ok := <-progressCh
			if !ok {
				return false
			}

			bts, err := json.Marshal(progress)
			if err != nil {
				return false
			}

			bts = append(bts, '\n')
			if _, err := w.Write(bts); err != nil {
				return false
			}

			return true
		})
	})

	r.POST("/api/generate", generate)

	log.Printf("Listening on %s", ln.Addr())
	s := &http.Server{
		Handler: r,
	}

	return s.Serve(ln)
}

func matchRankOne(source string, targets []string) (bestMatch string, bestRank int) {
	bestRank = math.MaxInt
	for _, target := range targets {
		if rank := fuzzy.LevenshteinDistance(source, target); bestRank > rank {
			bestRank = rank
			bestMatch = target
		}
	}

	return
}

func getModelOpts(req api.GenerateRequest) llama.ModelOptions {
	var opts llama.ModelOptions
	opts.ContextSize = req.ModelOptions.ContextSize
	opts.Seed = req.ModelOptions.Seed
	opts.F16Memory = req.ModelOptions.F16Memory
	opts.MLock = req.ModelOptions.MLock
	opts.Embeddings = req.ModelOptions.Embeddings
	opts.MMap = req.ModelOptions.MMap
	opts.LowVRAM = req.ModelOptions.LowVRAM

	opts.NBatch = req.ModelOptions.NBatch
	opts.VocabOnly = req.ModelOptions.VocabOnly
	opts.NUMA = req.ModelOptions.NUMA
	opts.NGPULayers = req.ModelOptions.NGPULayers
	opts.MainGPU = req.ModelOptions.MainGPU
	opts.TensorSplit = req.ModelOptions.TensorSplit

	return opts
}

func getPredictOpts(req api.GenerateRequest) llama.PredictOptions {
	var opts llama.PredictOptions

	if req.PredictOptions.Threads == -1 {
		opts.Threads = runtime.NumCPU()
	} else {
		opts.Threads = req.PredictOptions.Threads
	}

	opts.Seed = req.PredictOptions.Seed
	opts.Tokens = req.PredictOptions.Tokens
	opts.Penalty = req.PredictOptions.Penalty
	opts.Repeat = req.PredictOptions.Repeat
	opts.Batch = req.PredictOptions.Batch
	opts.NKeep = req.PredictOptions.NKeep
	opts.TopK = req.PredictOptions.TopK
	opts.TopP = req.PredictOptions.TopP
	opts.TailFreeSamplingZ = req.PredictOptions.TailFreeSamplingZ
	opts.TypicalP = req.PredictOptions.TypicalP
	opts.Temperature = req.PredictOptions.Temperature
	opts.FrequencyPenalty = req.PredictOptions.FrequencyPenalty
	opts.PresencePenalty = req.PredictOptions.PresencePenalty
	opts.Mirostat = req.PredictOptions.Mirostat
	opts.MirostatTAU = req.PredictOptions.MirostatTAU
	opts.MirostatETA = req.PredictOptions.MirostatETA
	opts.MMap = req.PredictOptions.MMap

	return opts
}
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`package server`

			`import (`
embed templates 2023-07-06 18:33:29 +00:00			`"embed"`
use prompt templates 2023-07-06 17:40:11 +00:00			`"encoding/json"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`"fmt"`
			`"io"`
			`"log"`
fix prompt templates 2023-07-07 00:03:00 +00:00			`"math"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`"net"`
			`"net/http"`
use prompt templates 2023-07-06 17:40:11 +00:00			`"path"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`"runtime"`
use prompt templates 2023-07-06 17:40:11 +00:00			`"strings"`
			`"text/template"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
			`"github.com/gin-gonic/gin"`
use prompt templates 2023-07-06 17:40:11 +00:00			`"github.com/lithammer/fuzzysearch/fuzzy"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
add llama.cpp go bindings 2023-07-03 20:32:48 +00:00			`"github.com/jmorganca/ollama/api"`
use prompt templates 2023-07-06 17:40:11 +00:00			`"github.com/jmorganca/ollama/llama"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`)`

embed templates 2023-07-06 18:33:29 +00:00			`//go:embed templates/*`
			`var templatesFS embed.FS`
			`var templates = template.Must(template.ParseFS(templatesFS, "templates/*.prompt"))`
use prompt templates 2023-07-06 17:40:11 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`func generate(c *gin.Context) {`
			`var req api.GenerateRequest`
pass model and predict options 2023-07-07 00:09:48 +00:00			`req.ModelOptions = api.DefaultModelOptions`
			`req.PredictOptions = api.DefaultPredictOptions`
separate routes 2023-07-05 19:37:33 +00:00			`if err := c.ShouldBindJSON(&req); err != nil {`
			`c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})`
			`return`
			`}`
move prompt templates out of python bindings 2023-07-03 21:14:20 +00:00
generate progress 2023-07-06 22:43:04 +00:00			`if remoteModel, _ := getRemote(req.Model); remoteModel != nil {`
			`req.Model = remoteModel.FullName()`
			`}`

pass model and predict options 2023-07-07 00:09:48 +00:00			`modelOpts := getModelOpts(req)`
			`modelOpts.NGPULayers = 1 // hard-code this for now`

			`model, err := llama.New(req.Model, modelOpts)`
separate routes 2023-07-05 19:37:33 +00:00			`if err != nil {`
			`fmt.Println("Loading the model failed:", err.Error())`
			`return`
			`}`
free llama model 2023-07-06 18:14:32 +00:00			`defer model.Free()`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
use prompt templates 2023-07-06 17:40:11 +00:00			`templateNames := make([]string, 0, len(templates.Templates()))`
			`for _, template := range templates.Templates() {`
			`templateNames = append(templateNames, template.Name())`
			`}`

fix prompt templates 2023-07-07 00:03:00 +00:00			`match, _ := matchRankOne(path.Base(req.Model), templateNames)`
use prompt templates 2023-07-06 17:40:11 +00:00			`if template := templates.Lookup(match); template != nil {`
			`var sb strings.Builder`
			`if err := template.Execute(&sb, req); err != nil {`
			`fmt.Println("Prompt template failed:", err.Error())`
			`return`
			`}`

			`req.Prompt = sb.String()`
			`}`

separate routes 2023-07-05 19:37:33 +00:00			`ch := make(chan string)`
pass model and predict options 2023-07-07 00:09:48 +00:00			`model.SetTokenCallback(func(token string) bool {`
			`ch <- token`
			`return true`
			`})`

			`predictOpts := getPredictOpts(req)`
client updates 2023-07-04 04:47:00 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`go func() {`
			`defer close(ch)`
pass model and predict options 2023-07-07 00:09:48 +00:00			`_, err := model.Predict(req.Prompt, predictOpts)`
client updates 2023-07-04 04:47:00 +00:00			`if err != nil {`
separate routes 2023-07-05 19:37:33 +00:00			`panic(err)`
client updates 2023-07-04 04:47:00 +00:00			`}`
separate routes 2023-07-05 19:37:33 +00:00			`}()`
client updates 2023-07-04 04:47:00 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`c.Stream(func(w io.Writer) bool {`
use prompt templates 2023-07-06 17:40:11 +00:00			`token, ok := <-ch`
separate routes 2023-07-05 19:37:33 +00:00			`if !ok {`
			`return false`
			`}`
use prompt templates 2023-07-06 17:40:11 +00:00
update generate response 2023-07-06 19:27:50 +00:00			`resp := api.GenerateResponse{`
			`Response: token,`
use prompt templates 2023-07-06 17:40:11 +00:00			`}`

			`bts, err := json.Marshal(resp)`
			`if err != nil {`
			`return false`
			`}`

			`bts = append(bts, '\n')`
			`if _, err := w.Write(bts); err != nil {`
			`return false`
			`}`

separate routes 2023-07-05 19:37:33 +00:00			`return true`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`})`
separate routes 2023-07-05 19:37:33 +00:00			`}`

			`func Serve(ln net.Listener) error {`
			`r := gin.Default()`

pull models 2023-07-06 16:24:49 +00:00			`r.POST("api/pull", func(c *gin.Context) {`
			`var req api.PullRequest`
			`if err := c.ShouldBindJSON(&req); err != nil {`
			`c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})`
			`return`
			`}`

display pull progress 2023-07-06 18:18:40 +00:00			`progressCh := make(chan api.PullProgress)`
pull models 2023-07-06 16:24:49 +00:00			`go func() {`
			`defer close(progressCh)`
			`if err := pull(req.Model, progressCh); err != nil {`
			`c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})`
			`return`
			`}`
			`}()`

			`c.Stream(func(w io.Writer) bool {`
			`progress, ok := <-progressCh`
			`if !ok {`
			`return false`
			`}`
simple pull response 2023-07-06 19:30:36 +00:00
			`bts, err := json.Marshal(progress)`
			`if err != nil {`
			`return false`
			`}`

			`bts = append(bts, '\n')`
			`if _, err := w.Write(bts); err != nil {`
			`return false`
			`}`

pull models 2023-07-06 16:24:49 +00:00			`return true`
			`})`
			`})`
separate routes 2023-07-05 19:37:33 +00:00
			`r.POST("/api/generate", generate)`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
			`log.Printf("Listening on %s", ln.Addr())`
			`s := &http.Server{`
			`Handler: r,`
			`}`

			`return s.Serve(ln)`
			`}`
use prompt templates 2023-07-06 17:40:11 +00:00
			`func matchRankOne(source string, targets []string) (bestMatch string, bestRank int) {`
fix prompt templates 2023-07-07 00:03:00 +00:00			`bestRank = math.MaxInt`
use prompt templates 2023-07-06 17:40:11 +00:00			`for _, target := range targets {`
fix prompt templates 2023-07-07 00:03:00 +00:00			`if rank := fuzzy.LevenshteinDistance(source, target); bestRank > rank {`
use prompt templates 2023-07-06 17:40:11 +00:00			`bestRank = rank`
			`bestMatch = target`
			`}`
			`}`

			`return`
			`}`
pass model and predict options 2023-07-07 00:09:48 +00:00
			`func getModelOpts(req api.GenerateRequest) llama.ModelOptions {`
			`var opts llama.ModelOptions`
			`opts.ContextSize = req.ModelOptions.ContextSize`
			`opts.Seed = req.ModelOptions.Seed`
			`opts.F16Memory = req.ModelOptions.F16Memory`
			`opts.MLock = req.ModelOptions.MLock`
			`opts.Embeddings = req.ModelOptions.Embeddings`
			`opts.MMap = req.ModelOptions.MMap`
			`opts.LowVRAM = req.ModelOptions.LowVRAM`

			`opts.NBatch = req.ModelOptions.NBatch`
			`opts.VocabOnly = req.ModelOptions.VocabOnly`
			`opts.NUMA = req.ModelOptions.NUMA`
			`opts.NGPULayers = req.ModelOptions.NGPULayers`
			`opts.MainGPU = req.ModelOptions.MainGPU`
			`opts.TensorSplit = req.ModelOptions.TensorSplit`

			`return opts`
			`}`

			`func getPredictOpts(req api.GenerateRequest) llama.PredictOptions {`
			`var opts llama.PredictOptions`

			`if req.PredictOptions.Threads == -1 {`
			`opts.Threads = runtime.NumCPU()`
			`} else {`
			`opts.Threads = req.PredictOptions.Threads`
			`}`

			`opts.Seed = req.PredictOptions.Seed`
			`opts.Tokens = req.PredictOptions.Tokens`
			`opts.Penalty = req.PredictOptions.Penalty`
			`opts.Repeat = req.PredictOptions.Repeat`
			`opts.Batch = req.PredictOptions.Batch`
			`opts.NKeep = req.PredictOptions.NKeep`
			`opts.TopK = req.PredictOptions.TopK`
			`opts.TopP = req.PredictOptions.TopP`
			`opts.TailFreeSamplingZ = req.PredictOptions.TailFreeSamplingZ`
			`opts.TypicalP = req.PredictOptions.TypicalP`
			`opts.Temperature = req.PredictOptions.Temperature`
			`opts.FrequencyPenalty = req.PredictOptions.FrequencyPenalty`
			`opts.PresencePenalty = req.PredictOptions.PresencePenalty`
			`opts.Mirostat = req.PredictOptions.Mirostat`
			`opts.MirostatTAU = req.PredictOptions.MirostatTAU`
			`opts.MirostatETA = req.PredictOptions.MirostatETA`
			`opts.MMap = req.PredictOptions.MMap`

			`return opts`
			`}`