local-llm-server/llm_server/routes/ooba_request_handler.py

from typing import Tuple

import flask
from flask import jsonify, request

from llm_server import opts
from llm_server.database.database import do_db_log
from llm_server.database.log_to_db import log_to_db
from llm_server.routes.helpers.client import format_sillytavern_err
from llm_server.routes.request_handler import RequestHandler


class OobaRequestHandler(RequestHandler):
    def __init__(self, *args, **kwargs):
        super().__init__(*args, **kwargs)

    def handle_request(self, return_ok: bool = True):
        assert not self.used
        if self.offline:
            msg = 'The model you requested is not a valid choice. Please retry your query.'
            print(msg)
            self.handle_error(msg)

        request_valid, invalid_response = self.validate_request()
        if not request_valid:
            return invalid_response

        # Reconstruct the request JSON with the validated parameters and prompt.
        prompt = self.request_json_body.get('prompt', '')
        llm_request = {**self.parameters, 'prompt': prompt}

        _, backend_response = self.generate_response(llm_request)
        if return_ok:
            # Always return 200 so ST displays our error messages
            return backend_response[0], 200
        else:
            # The OpenAI route needs to detect 429 errors.
            return backend_response

    def handle_ratelimited(self, do_log: bool = True):
        msg = f'Ratelimited: you are only allowed to have {opts.simultaneous_requests_per_ip} simultaneous requests at a time. Please complete your other requests before sending another.'
        backend_response = self.handle_error(msg)
        if do_log:
            log_to_db(self.client_ip, self.token, self.request_json_body.get('prompt', ''), backend_response[0].data.decode('utf-8'), None, self.parameters, dict(self.request.headers), 429, self.request.url, self.backend_url, is_error=True)
        return backend_response[0], 429

    def handle_error(self, error_msg: str, error_type: str = 'error') -> Tuple[flask.Response, int]:
        disable_st_error_formatting = request.headers.get('LLM-ST-Errors', False) == 'true'
        if disable_st_error_formatting:
            # TODO: how to format this
            response_msg = error_msg
        else:
            response_msg = format_sillytavern_err(error_msg, error_type=error_type, backend_url=self.backend_url)

        return jsonify({
            'results': [{'text': response_msg}]
        }), 200  # return 200 so we don't trigger an error message in the client's ST
set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`from typing import Tuple`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`import flask`
unify error message handling 2023-09-27 14:48:47 -06:00			`from flask import jsonify, request`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
			`from llm_server import opts`
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`from llm_server.database.database import do_db_log`
			`from llm_server.database.log_to_db import log_to_db`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`from llm_server.routes.helpers.client import format_sillytavern_err`
			`from llm_server.routes.request_handler import RequestHandler`


			`class OobaRequestHandler(RequestHandler):`
			`def __init__(self, args, *kwargs):`
			`super().__init__(args, *kwargs)`

finish openai endpoints 2023-10-01 16:04:53 -06:00			`def handle_request(self, return_ok: bool = True):`
update database, tokenizer handle null prompt, convert top_p to vllm on openai, actually validate prompt on streaming, 2023-09-25 22:32:48 -06:00			`assert not self.used`
handle model offline 2023-10-04 13:18:47 -06:00			`if self.offline:`
fix exceptoin 2023-10-04 16:04:03 -06:00			`msg = 'The model you requested is not a valid choice. Please retry your query.'`
handle model offline 2023-10-04 13:18:47 -06:00			`print(msg)`
c 2023-10-04 13:21:43 -06:00			`self.handle_error(msg)`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`request_valid, invalid_response = self.validate_request()`
			`if not request_valid:`
			`return invalid_response`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
			`# Reconstruct the request JSON with the validated parameters and prompt.`
			`prompt = self.request_json_body.get('prompt', '')`
			`llm_request = {**self.parameters, 'prompt': prompt}`

option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`_, backend_response = self.generate_response(llm_request)`
finish openai endpoints 2023-10-01 16:04:53 -06:00			`if return_ok:`
			`# Always return 200 so ST displays our error messages`
			`return backend_response[0], 200`
			`else:`
			`# The OpenAI route needs to detect 429 errors.`
			`return backend_response`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
fix double logging 2023-09-28 01:34:15 -06:00			`def handle_ratelimited(self, do_log: bool = True):`
don't use db pooling, add LLM-ST-Errors header to disable formatted errors 2023-09-26 23:59:22 -06:00			`msg = f'Ratelimited: you are only allowed to have {opts.simultaneous_requests_per_ip} simultaneous requests at a time. Please complete your other requests before sending another.'`
unify error message handling 2023-09-27 14:48:47 -06:00			`backend_response = self.handle_error(msg)`
fix double logging 2023-09-28 01:34:15 -06:00			`if do_log:`
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`log_to_db(self.client_ip, self.token, self.request_json_body.get('prompt', ''), backend_response[0].data.decode('utf-8'), None, self.parameters, dict(self.request.headers), 429, self.request.url, self.backend_url, is_error=True)`
finish openai endpoints 2023-10-01 16:04:53 -06:00			`return backend_response[0], 429`
unify error message handling 2023-09-27 14:48:47 -06:00
			`def handle_error(self, error_msg: str, error_type: str = 'error') -> Tuple[flask.Response, int]:`
			`disable_st_error_formatting = request.headers.get('LLM-ST-Errors', False) == 'true'`
don't use db pooling, add LLM-ST-Errors header to disable formatted errors 2023-09-26 23:59:22 -06:00			`if disable_st_error_formatting:`
unify error message handling 2023-09-27 14:48:47 -06:00			`# TODO: how to format this`
			`response_msg = error_msg`
don't use db pooling, add LLM-ST-Errors header to disable formatted errors 2023-09-26 23:59:22 -06:00			`else:`
functional 2023-09-30 19:41:50 -06:00			`response_msg = format_sillytavern_err(error_msg, error_type=error_type, backend_url=self.backend_url)`
set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00
			`return jsonify({`
unify error message handling 2023-09-27 14:48:47 -06:00			`'results': [{'text': response_msg}]`
fix error handling 2023-09-27 14:36:49 -06:00			`}), 200 # return 200 so we don't trigger an error message in the client's ST`