ollama/server/routes.go

package server

import (
	"fmt"
	"io"
	"log"
	"net"
	"net/http"
	"runtime"

	"github.com/gin-gonic/gin"
	llama "github.com/jmorganca/ollama/llama"

	"github.com/jmorganca/ollama/api"
)

func pull(c *gin.Context) {
	// TODO

	c.JSON(http.StatusOK, gin.H{"message": "ok"})
}

func generate(c *gin.Context) {
	// TODO: these should be request parameters
	gpulayers := 0
	tokens := 512
	threads := runtime.NumCPU()
	// TODO: set prompt from template
	fmt.Println("Generating text...")

	var req api.GenerateRequest
	if err := c.ShouldBindJSON(&req); err != nil {
		c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})
		return
	}

	fmt.Println(req)

	l, err := llama.New(req.Model, llama.EnableF16Memory, llama.SetContext(128), llama.EnableEmbeddings, llama.SetGPULayers(gpulayers))
	if err != nil {
		fmt.Println("Loading the model failed:", err.Error())
		return
	}

	ch := make(chan string)

	go func() {
		defer close(ch)
		_, err := l.Predict(req.Prompt, llama.Debug, llama.SetTokenCallback(func(token string) bool {
			ch <- token
			return true
		}), llama.SetTokens(tokens), llama.SetThreads(threads), llama.SetTopK(90), llama.SetTopP(0.86), llama.SetStopWords("llama"))
		if err != nil {
			panic(err)
		}
	}()

	c.Stream(func(w io.Writer) bool {
		tok, ok := <-ch
		if !ok {
			return false
		}
		c.SSEvent("token", tok)
		return true
	})
}

func Serve(ln net.Listener) error {
	r := gin.Default()

	r.POST("api/pull", pull)

	r.POST("/api/generate", generate)

	log.Printf("Listening on %s", ln.Addr())
	s := &http.Server{
		Handler: r,
	}

	return s.Serve(ln)
}
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`package server`

			`import (`
			`"fmt"`
			`"io"`
			`"log"`
			`"net"`
			`"net/http"`
			`"runtime"`

			`"github.com/gin-gonic/gin"`
add llama.cpp go bindings 2023-07-03 20:32:48 +00:00			`llama "github.com/jmorganca/ollama/llama"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
add llama.cpp go bindings 2023-07-03 20:32:48 +00:00			`"github.com/jmorganca/ollama/api"`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`)`

separate routes 2023-07-05 19:37:33 +00:00			`func pull(c *gin.Context) {`
			`// TODO`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`c.JSON(http.StatusOK, gin.H{"message": "ok"})`
			`}`

			`func generate(c *gin.Context) {`
client updates 2023-07-04 04:47:00 +00:00			`// TODO: these should be request parameters`
			`gpulayers := 0`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`tokens := 512`
			`threads := runtime.NumCPU()`
separate routes 2023-07-05 19:37:33 +00:00			`// TODO: set prompt from template`
			`fmt.Println("Generating text...")`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`var req api.GenerateRequest`
			`if err := c.ShouldBindJSON(&req); err != nil {`
			`c.JSON(http.StatusBadRequest, gin.H{"message": err.Error()})`
			`return`
			`}`
move prompt templates out of python bindings 2023-07-03 21:14:20 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`fmt.Println(req)`

			`l, err := llama.New(req.Model, llama.EnableF16Memory, llama.SetContext(128), llama.EnableEmbeddings, llama.SetGPULayers(gpulayers))`
			`if err != nil {`
			`fmt.Println("Loading the model failed:", err.Error())`
			`return`
			`}`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`ch := make(chan string)`
client updates 2023-07-04 04:47:00 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`go func() {`
			`defer close(ch)`
			`_, err := l.Predict(req.Prompt, llama.Debug, llama.SetTokenCallback(func(token string) bool {`
			`ch <- token`
			`return true`
			`}), llama.SetTokens(tokens), llama.SetThreads(threads), llama.SetTopK(90), llama.SetTopP(0.86), llama.SetStopWords("llama"))`
client updates 2023-07-04 04:47:00 +00:00			`if err != nil {`
separate routes 2023-07-05 19:37:33 +00:00			`panic(err)`
client updates 2023-07-04 04:47:00 +00:00			`}`
separate routes 2023-07-05 19:37:33 +00:00			`}()`
client updates 2023-07-04 04:47:00 +00:00
separate routes 2023-07-05 19:37:33 +00:00			`c.Stream(func(w io.Writer) bool {`
			`tok, ok := <-ch`
			`if !ok {`
			`return false`
			`}`
			`c.SSEvent("token", tok)`
			`return true`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00			`})`
separate routes 2023-07-05 19:37:33 +00:00			`}`

			`func Serve(ln net.Listener) error {`
			`r := gin.Default()`

			`r.POST("api/pull", pull)`

			`r.POST("/api/generate", generate)`
wip go engine Co-authored-by: Patrick Devine <pdevine@sonic.net> 2023-07-03 19:22:44 +00:00
			`log.Printf("Listening on %s", ln.Addr())`
			`s := &http.Server{`
			`Handler: r,`
			`}`

			`return s.Serve(ln)`
			`}`