local-llm-server/llm_server/routes/request_handler.py

import time
from typing import Tuple, Union

import flask
from flask import Response, request

from llm_server import opts
from llm_server.cluster.cluster_config import cluster_config, get_a_cluster_backend
from llm_server.custom_redis import redis
from llm_server.database.database import get_token_ratelimit
from llm_server.database.log_to_db import log_to_db
from llm_server.helpers import auto_set_base_client_api
from llm_server.llm.oobabooga.ooba_backend import OobaboogaBackend
from llm_server.llm.vllm.vllm_backend import VLLMBackend
from llm_server.routes.auth import parse_token
from llm_server.routes.helpers.http import require_api_key, validate_json
from llm_server.routes.queue import priority_queue


class RequestHandler:
    def __init__(self, incoming_request: flask.Request, selected_model: str = None, incoming_json: Union[dict, str] = None):
        self.request = incoming_request
        # self.enable_backend_blind_rrd = request.headers.get('LLM-Blind-RRD', False) == 'true'

        # Routes need to validate it, here we just load it
        if incoming_json:
            self.request_valid_json, self.request_json_body = validate_json(incoming_json)
        else:
            self.request_valid_json, self.request_json_body = validate_json(self.request)
        if not self.request_valid_json:
            raise Exception(f'Not valid JSON. Routes are supposed to reject invalid JSON.')

        self.start_time = time.time()
        self.client_ip = self.get_client_ip()
        self.token = self.get_auth_token()
        self.token_priority, self.token_simultaneous_ip = get_token_ratelimit(self.token)
        self.parameters = None
        self.used = False

        # This is null by default since most handlers need to transform the prompt in a specific way.
        self.prompt = None

        self.selected_model = selected_model
        self.backend_url = get_a_cluster_backend(selected_model)
        self.cluster_backend_info = cluster_config.get_backend(self.backend_url)

        if not self.cluster_backend_info.get('mode'):
            print('keyerror: mode -', selected_model, self.backend_url, self.cluster_backend_info)
        if not self.cluster_backend_info.get('model'):
            print('keyerror: model -', selected_model, self.backend_url, self.cluster_backend_info)
        if not self.cluster_backend_info.get('model_config'):
            print('keyerror: model_config -', selected_model, self.backend_url, self.cluster_backend_info)

        if not self.cluster_backend_info.get('mode') or not self.cluster_backend_info.get('model') or not self.cluster_backend_info.get('model_config'):
            self.offline = True
        else:
            self.offline = False
            self.selected_model = self.cluster_backend_info['model']
            self.backend = get_backend_handler(self.cluster_backend_info['mode'], self.backend_url)
            if self.token and not self.token.startswith('SYSTEM__'):
                # "recent_prompters" is only used for stats.
                redis.zadd('recent_prompters', {self.client_ip: time.time()})

    def check_online(self) -> bool:
        self.cluster_backend_info = cluster_config.get_backend(self.backend_url)
        return self.cluster_backend_info['online']

    def get_auth_token(self):
        if self.request_json_body.get('X-API-KEY'):
            return self.request_json_body['X-API-KEY']
        elif self.request.headers.get('X-Api-Key'):
            return self.request.headers['X-Api-Key']
        elif self.request.headers.get('Authorization'):
            return parse_token(self.request.headers['Authorization'])

    def get_client_ip(self):
        if self.request.headers.get('Llm-Connecting-Ip'):
            return self.request.headers['Llm-Connecting-Ip']
        if self.request.headers.get('X-Connecting-IP'):
            return self.request.headers.get('X-Connecting-IP')
        elif self.request.headers.get('Cf-Connecting-Ip'):
            return self.request.headers.get('Cf-Connecting-Ip')
        elif self.request.headers.get('X-Forwarded-For'):
            return self.request.headers.get('X-Forwarded-For').split(',')[0]
        else:
            return self.request.remote_addr

    def get_parameters(self):
        parameters, parameters_invalid_msg = self.backend.get_parameters(self.request_json_body)
        return parameters, parameters_invalid_msg

    def validate_request(self, prompt: str = None, do_log: bool = False) -> Tuple[bool, Tuple[Response | None, int]]:
        """
        This needs to be called at the start of the subclass handle_request() method.
        :param prompt:
        :param do_log:
        :return:
        """
        invalid_request_err_msgs = []

        self.parameters, parameters_invalid_msg = self.get_parameters()  # Parameters will be None if invalid.
        if self.parameters and not parameters_invalid_msg:
            # Backends shouldn't check max_new_tokens, but rather things specific to their backend.
            # Let the RequestHandler do the generic checks.
            if self.parameters.get('max_new_tokens', 0) > opts.max_new_tokens:
                invalid_request_err_msgs.append(f'`max_new_tokens` must be less than or equal to {opts.max_new_tokens}')

            if prompt:
                prompt_valid, invalid_prompt_err_msg = self.backend.validate_prompt(prompt)
                if not prompt_valid:
                    invalid_request_err_msgs.append(invalid_prompt_err_msg)

            request_valid, invalid_request_err_msg = self.backend.validate_request(self.parameters, prompt, self.request)
            if not request_valid:
                invalid_request_err_msgs.append(invalid_request_err_msg)
        else:
            invalid_request_err_msgs.append(parameters_invalid_msg)

        if len(invalid_request_err_msgs):
            if len(invalid_request_err_msgs) > 1:
                # Format multiple error messages each on a new line.
                e = [f'\n{x}.' for x in invalid_request_err_msgs]
                combined_error_message = '\n'.join(e)
            else:
                # Otherwise, just grab the first and only one.
                combined_error_message = invalid_request_err_msgs[0] + '.'
            backend_response = self.handle_error(combined_error_message, 'Validation Error')

            if do_log:
                log_to_db(self.client_ip, self.token, self.request_json_body.get('prompt', ''), backend_response[0].data.decode('utf-8'), 0, self.parameters, dict(self.request.headers), 0, self.request.url, self.backend_url, is_error=True)
            return False, backend_response
        return True, (None, 0)

    def generate_response(self, llm_request: dict) -> Tuple[Tuple[bool, flask.Response | None, str | None, float], Tuple[Response, int]]:
        prompt = llm_request['prompt']
        if not self.is_client_ratelimited():
            # Validate again before submission since the backend handler may have changed something.
            # Also, this is the first time we validate the prompt.
            request_valid, invalid_response = self.validate_request(prompt, do_log=True)
            if not request_valid:
                return (False, None, None, 0), invalid_response
            event = priority_queue.put(self.backend_url, (llm_request, self.client_ip, self.token, self.parameters), self.token_priority, self.selected_model)
        else:
            event = None

        if not event:
            return (False, None, None, 0), self.handle_ratelimited()

        # TODO: add wait timeout
        success, response, error_msg = event.wait()
        if error_msg == 'closed':
            return (False, None, None, 0), (self.handle_error('Request Timeout')[0], 408)

        end_time = time.time()
        elapsed_time = end_time - self.start_time

        if response:
            try:
                # Be extra careful when getting attributes from the response object
                response_status_code = response.status_code
            except:
                response_status_code = 0
        else:
            response_status_code = None

        # ===============================================

        # We encountered an error
        if not success or not response or error_msg:
            if not error_msg or error_msg == '':
                error_msg = 'Unknown error.'
            else:
                error_msg = error_msg.strip('.') + '.'
            backend_response = self.handle_error(error_msg)
            log_to_db(ip=self.client_ip,
                      token=self.token,
                      prompt=prompt,
                      response=backend_response[0].data.decode('utf-8'),
                      gen_time=None,
                      parameters=self.parameters,
                      headers=dict(self.request.headers),
                      backend_response_code=response_status_code,
                      request_url=self.request.url,
                      backend_url=self.backend_url,
                      is_error=True)
            return (False, None, None, 0), backend_response

        # ===============================================

        response_valid_json, response_json_body = validate_json(response)
        return_json_err = False

        # The backend didn't send valid JSON
        if not response_valid_json:
            return_json_err = True

        # Make sure the backend didn't crap out.
        results = response_json_body.get('results', [])
        if len(results) and not results[0].get('text'):
            return_json_err = True

        if return_json_err:
            error_msg = 'The backend did not return valid JSON.'
            backend_response = self.handle_error(error_msg)
            log_to_db(self.client_ip, self.token, prompt, backend_response[0].data.decode('utf-8'), elapsed_time, self.parameters, dict(self.request.headers), response_status_code, self.request.url, self.backend_url, is_error=True)
            return (False, None, None, 0), backend_response

        # ===============================================

        self.used = True
        return (success, response, error_msg, elapsed_time), self.backend.handle_response(success, self.request, response_json_body, response_status_code, self.client_ip, self.token, prompt, elapsed_time, self.parameters, dict(self.request.headers))

    def is_client_ratelimited(self) -> bool:
        if self.token_priority == 0:
            return False

        queued_ip_count = int(priority_queue.get_queued_ip_count(self.client_ip))
        x = redis.hget('processing_ips', self.client_ip)
        if x:
            processing_ip = int(x)
        else:
            processing_ip = 0

        if queued_ip_count + processing_ip >= self.token_simultaneous_ip:
            print(f'Rejecting request from {self.client_ip} - {queued_ip_count + processing_ip} already queued/processing.')
            return True
        else:
            return False

    def handle_request(self) -> Tuple[flask.Response, int]:
        # Must include this in your child.
        # assert not self.used
        # if self.offline:
        #     msg = f'{self.selected_model} is not a valid model choice.'
        #     print(msg)
        #     return format_sillytavern_err(msg)
        raise NotImplementedError

    def handle_ratelimited(self, do_log: bool = True) -> Tuple[flask.Response, int]:
        raise NotImplementedError

    def handle_error(self, error_msg: str, error_type: str = 'error') -> Tuple[flask.Response, int]:
        raise NotImplementedError


def get_backend_handler(mode, backend_url: str):
    if mode == 'oobabooga':
        return OobaboogaBackend(backend_url)
    elif mode == 'vllm':
        return VLLMBackend(backend_url)
    else:
        raise Exception


def delete_dict_key(d: dict, k: Union[str, list]):
    if isinstance(k, str):
        if k in d.keys():
            del d[k]
    elif isinstance(k, list):
        for item in k:
            if item in d.keys():
                del d[item]
    else:
        raise ValueError
    return d


def before_request():
    auto_set_base_client_api(request)
    if request.endpoint != 'v1.get_stats':
        response = require_api_key()
        if response is not None:
            return response
refactor generation route 2023-08-30 18:53:26 -06:00			`import time`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`from typing import Tuple, Union`
refactor generation route 2023-08-30 18:53:26 -06:00
adjust logging, add more vllm stuff 2023-09-13 11:22:33 -06:00			`import flask`
cache stats in background 2023-09-17 18:55:36 -06:00			`from flask import Response, request`
adjust logging, add more vllm stuff 2023-09-13 11:22:33 -06:00
refactor generation route 2023-08-30 18:53:26 -06:00			`from llm_server import opts`
fix import error 2023-10-04 16:29:19 -06:00			`from llm_server.cluster.cluster_config import cluster_config, get_a_cluster_backend`
mvp 2023-09-29 00:09:44 -06:00			`from llm_server.custom_redis import redis`
fix the queue?? 2023-10-05 21:37:18 -06:00			`from llm_server.database.database import get_token_ratelimit`
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`from llm_server.database.log_to_db import log_to_db`
add config setting for hostname 2023-09-23 23:24:08 -06:00			`from llm_server.helpers import auto_set_base_client_api`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`from llm_server.llm.oobabooga.ooba_backend import OobaboogaBackend`
implement vllm backend 2023-09-11 20:47:19 -06:00			`from llm_server.llm.vllm.vllm_backend import VLLMBackend`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`from llm_server.routes.auth import parse_token`
cache stats in background 2023-09-17 18:55:36 -06:00			`from llm_server.routes.helpers.http import require_api_key, validate_json`
update openai endpoints 2023-10-01 14:15:01 -06:00			`from llm_server.routes.queue import priority_queue`
refactor generation route 2023-08-30 18:53:26 -06:00

add openai-compatible backend 2023-09-12 16:40:09 -06:00			`class RequestHandler:`
update openai endpoints 2023-10-01 14:15:01 -06:00			`def __init__(self, incoming_request: flask.Request, selected_model: str = None, incoming_json: Union[dict, str] = None):`
refactor generation route 2023-08-30 18:53:26 -06:00			`self.request = incoming_request`
add model selection to openai endpoint 2023-10-09 23:51:26 -06:00			`# self.enable_backend_blind_rrd = request.headers.get('LLM-Blind-RRD', False) == 'true'`
implement streaming for vllm 2023-09-23 17:57:23 -06:00
improve openai endpoint, exclude system tokens more places 2023-09-25 09:32:23 -06:00			`# Routes need to validate it, here we just load it`
implement streaming for vllm 2023-09-23 17:57:23 -06:00			`if incoming_json:`
			`self.request_valid_json, self.request_json_body = validate_json(incoming_json)`
			`else:`
			`self.request_valid_json, self.request_json_body = validate_json(self.request)`
			`if not self.request_valid_json:`
improve openai endpoint, exclude system tokens more places 2023-09-25 09:32:23 -06:00			`raise Exception(f'Not valid JSON. Routes are supposed to reject invalid JSON.')`
implement streaming for vllm 2023-09-23 17:57:23 -06:00
refactor generation route 2023-08-30 18:53:26 -06:00			`self.start_time = time.time()`
			`self.client_ip = self.get_client_ip()`
allow setting simultaneous IP limit per-token, fix token use tracker, fix tokens on streaming 2023-09-25 00:55:20 -06:00			`self.token = self.get_auth_token()`
fix ratelimiting 2023-10-02 02:05:15 -06:00			`self.token_priority, self.token_simultaneous_ip = get_token_ratelimit(self.token)`
fix 2023-10-04 13:37:39 -06:00			`self.parameters = None`
			`self.used = False`
adjust stats 2023-09-30 20:42:48 -06:00
get streaming working again 2023-10-16 16:22:52 -06:00			`# This is null by default since most handlers need to transform the prompt in a specific way.`
			`self.prompt = None`

fix exception 2023-10-09 10:31:35 -06:00			`self.selected_model = selected_model`
fix exception when not valid model 2023-10-05 12:28:00 -06:00			`self.backend_url = get_a_cluster_backend(selected_model)`
			`self.cluster_backend_info = cluster_config.get_backend(self.backend_url)`

adjust stats 2023-09-30 20:42:48 -06:00			`if not self.cluster_backend_info.get('mode'):`
c 2023-10-04 12:44:09 -06:00			`print('keyerror: mode -', selected_model, self.backend_url, self.cluster_backend_info)`
g 2023-10-04 12:59:19 -06:00			`if not self.cluster_backend_info.get('model'):`
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`print('keyerror: model -', selected_model, self.backend_url, self.cluster_backend_info)`
			`if not self.cluster_backend_info.get('model_config'):`
			`print('keyerror: model_config -', selected_model, self.backend_url, self.cluster_backend_info)`
adjust stats 2023-09-30 20:42:48 -06:00
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`if not self.cluster_backend_info.get('mode') or not self.cluster_backend_info.get('model') or not self.cluster_backend_info.get('model_config'):`
handle model offline 2023-10-04 13:18:47 -06:00			`self.offline = True`
			`else:`
			`self.offline = False`
c 2023-10-04 13:21:43 -06:00			`self.selected_model = self.cluster_backend_info['model']`
			`self.backend = get_backend_handler(self.cluster_backend_info['mode'], self.backend_url)`
			`if self.token and not self.token.startswith('SYSTEM__'):`
			`# "recent_prompters" is only used for stats.`
			`redis.zadd('recent_prompters', {self.client_ip: time.time()})`
refactor generation route 2023-08-30 18:53:26 -06:00
trying to fix workers still processing after backend goes offline 2023-10-15 15:11:37 -06:00			`def check_online(self) -> bool:`
			`self.cluster_backend_info = cluster_config.get_backend(self.backend_url)`
			`return self.cluster_backend_info['online']`

allow setting simultaneous IP limit per-token, fix token use tracker, fix tokens on streaming 2023-09-25 00:55:20 -06:00			`def get_auth_token(self):`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`if self.request_json_body.get('X-API-KEY'):`
fix API key handling 2023-09-26 22:49:53 -06:00			`return self.request_json_body['X-API-KEY']`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`elif self.request.headers.get('X-Api-Key'):`
			`return self.request.headers['X-Api-Key']`
fix API key handling 2023-09-26 22:49:53 -06:00			`elif self.request.headers.get('Authorization'):`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`return parse_token(self.request.headers['Authorization'])`
allow setting simultaneous IP limit per-token, fix token use tracker, fix tokens on streaming 2023-09-25 00:55:20 -06:00
refactor generation route 2023-08-30 18:53:26 -06:00			`def get_client_ip(self):`
fix ratelimiting 2023-10-02 02:05:15 -06:00			`if self.request.headers.get('Llm-Connecting-Ip'):`
			`return self.request.headers['Llm-Connecting-Ip']`
improve openai endpoint, exclude system tokens more places 2023-09-25 09:32:23 -06:00			`if self.request.headers.get('X-Connecting-IP'):`
			`return self.request.headers.get('X-Connecting-IP')`
			`elif self.request.headers.get('Cf-Connecting-Ip'):`
			`return self.request.headers.get('Cf-Connecting-Ip')`
			`elif self.request.headers.get('X-Forwarded-For'):`
			`return self.request.headers.get('X-Forwarded-For').split(',')[0]`
refactor generation route 2023-08-30 18:53:26 -06:00			`else:`
			`return self.request.remote_addr`

set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`def get_parameters(self):`
			`parameters, parameters_invalid_msg = self.backend.get_parameters(self.request_json_body)`
			`return parameters, parameters_invalid_msg`
actually we don't want to emulate openai 2023-09-12 01:04:11 -06:00
rewrite tokenizer, restructure validation 2023-09-24 13:02:30 -06:00			`def validate_request(self, prompt: str = None, do_log: bool = False) -> Tuple[bool, Tuple[Response \| None, int]]:`
			`"""`
			`This needs to be called at the start of the subclass handle_request() method.`
			`:param prompt:`
			`:param do_log:`
			`:return:`
			`"""`
			`invalid_request_err_msgs = []`

			`self.parameters, parameters_invalid_msg = self.get_parameters() # Parameters will be None if invalid.`
			`if self.parameters and not parameters_invalid_msg:`
			`# Backends shouldn't check max_new_tokens, but rather things specific to their backend.`
			`# Let the RequestHandler do the generic checks.`
			`if self.parameters.get('max_new_tokens', 0) > opts.max_new_tokens:`
			invalid_request_err_msgs.append(f'`max_new_tokens` must be less than or equal to {opts.max_new_tokens}')

			`if prompt:`
			`prompt_valid, invalid_prompt_err_msg = self.backend.validate_prompt(prompt)`
			`if not prompt_valid:`
			`invalid_request_err_msgs.append(invalid_prompt_err_msg)`

			`request_valid, invalid_request_err_msg = self.backend.validate_request(self.parameters, prompt, self.request)`
			`if not request_valid:`
			`invalid_request_err_msgs.append(invalid_request_err_msg)`
			`else:`
			`invalid_request_err_msgs.append(parameters_invalid_msg)`

			`if len(invalid_request_err_msgs):`
			`if len(invalid_request_err_msgs) > 1:`
			`# Format multiple error messages each on a new line.`
			`e = [f'\n{x}.' for x in invalid_request_err_msgs]`
			`combined_error_message = '\n'.join(e)`
			`else:`
			`# Otherwise, just grab the first and only one.`
			`combined_error_message = invalid_request_err_msgs[0] + '.'`
unify error message handling 2023-09-27 14:48:47 -06:00			`backend_response = self.handle_error(combined_error_message, 'Validation Error')`
fix error handling 2023-09-27 14:36:49 -06:00
rewrite tokenizer, restructure validation 2023-09-24 13:02:30 -06:00			`if do_log:`
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`log_to_db(self.client_ip, self.token, self.request_json_body.get('prompt', ''), backend_response[0].data.decode('utf-8'), 0, self.parameters, dict(self.request.headers), 0, self.request.url, self.backend_url, is_error=True)`
don't use db pooling, add LLM-ST-Errors header to disable formatted errors 2023-09-26 23:59:22 -06:00			`return False, backend_response`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`return True, (None, 0)`

			`def generate_response(self, llm_request: dict) -> Tuple[Tuple[bool, flask.Response \| None, str \| None, float], Tuple[Response, int]]:`
actually validate prompt length lol 2023-09-14 18:31:13 -06:00			`prompt = llm_request['prompt']`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`if not self.is_client_ratelimited():`
rewrite tokenizer, restructure validation 2023-09-24 13:02:30 -06:00			`# Validate again before submission since the backend handler may have changed something.`
			`# Also, this is the first time we validate the prompt.`
			`request_valid, invalid_response = self.validate_request(prompt, do_log=True)`
			`if not request_valid:`
			`return (False, None, None, 0), invalid_response`
fix the queue?? 2023-10-05 21:37:18 -06:00			`event = priority_queue.put(self.backend_url, (llm_request, self.client_ip, self.token, self.parameters), self.token_priority, self.selected_model)`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`else:`
			`event = None`

			`if not event:`
			`return (False, None, None, 0), self.handle_ratelimited()`

functional 2023-09-30 19:41:50 -06:00			`# TODO: add wait timeout`
set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`success, response, error_msg = event.wait()`
remove timed-out items from queue 2023-10-17 11:46:39 -06:00			`if error_msg == 'closed':`
			`return (False, None, None, 0), (self.handle_error('Request Timeout')[0], 408)`
functional 2023-09-30 19:41:50 -06:00
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`end_time = time.time()`
			`elapsed_time = end_time - self.start_time`

			`if response:`
			`try:`
			`# Be extra careful when getting attributes from the response object`
			`response_status_code = response.status_code`
			`except:`
			`response_status_code = 0`
			`else:`
			`response_status_code = None`

			`# ===============================================`

			`# We encountered an error`
			`if not success or not response or error_msg:`
			`if not error_msg or error_msg == '':`
			`error_msg = 'Unknown error.'`
			`else:`
			`error_msg = error_msg.strip('.') + '.'`
unify error message handling 2023-09-27 14:48:47 -06:00			`backend_response = self.handle_error(error_msg)`
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`log_to_db(ip=self.client_ip,`
			`token=self.token,`
			`prompt=prompt,`
			`response=backend_response[0].data.decode('utf-8'),`
			`gen_time=None,`
			`parameters=self.parameters,`
			`headers=dict(self.request.headers),`
			`backend_response_code=response_status_code,`
			`request_url=self.request.url,`
			`backend_url=self.backend_url,`
			`is_error=True)`
don't use db pooling, add LLM-ST-Errors header to disable formatted errors 2023-09-26 23:59:22 -06:00			`return (False, None, None, 0), backend_response`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00
			`# ===============================================`

			`response_valid_json, response_json_body = validate_json(response)`
check if the backend crapped out, print some more stuff 2023-09-14 14:26:25 -06:00			`return_json_err = False`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00
			`# The backend didn't send valid JSON`
			`if not response_valid_json:`
check if the backend crapped out, print some more stuff 2023-09-14 14:26:25 -06:00			`return_json_err = True`

			`# Make sure the backend didn't crap out.`
			`results = response_json_body.get('results', [])`
			`if len(results) and not results[0].get('text'):`
			`return_json_err = True`

			`if return_json_err:`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`error_msg = 'The backend did not return valid JSON.'`
unify error message handling 2023-09-27 14:48:47 -06:00			`backend_response = self.handle_error(error_msg)`
fix background logger, add gradio chat example 2023-10-04 19:24:47 -06:00			`log_to_db(self.client_ip, self.token, prompt, backend_response[0].data.decode('utf-8'), elapsed_time, self.parameters, dict(self.request.headers), response_status_code, self.request.url, self.backend_url, is_error=True)`
don't use db pooling, add LLM-ST-Errors header to disable formatted errors 2023-09-26 23:59:22 -06:00			`return (False, None, None, 0), backend_response`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00
			`# ===============================================`

			`self.used = True`
			`return (success, response, error_msg, elapsed_time), self.backend.handle_response(success, self.request, response_json_body, response_status_code, self.client_ip, self.token, prompt, elapsed_time, self.parameters, dict(self.request.headers))`

			`def is_client_ratelimited(self) -> bool:`
fix ratelimiting 2023-10-02 02:05:15 -06:00			`if self.token_priority == 0:`
			`return False`

rewrite redis usage 2023-09-28 03:44:30 -06:00			`queued_ip_count = int(priority_queue.get_queued_ip_count(self.client_ip))`
			`x = redis.hget('processing_ips', self.client_ip)`
			`if x:`
			`processing_ip = int(x)`
			`else:`
			`processing_ip = 0`
fix ratelimiting 2023-10-02 02:05:15 -06:00
			`if queued_ip_count + processing_ip >= self.token_simultaneous_ip:`
finish openai endpoints 2023-10-01 16:04:53 -06:00			`print(f'Rejecting request from {self.client_ip} - {queued_ip_count + processing_ip} already queued/processing.')`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`return True`
fix ratelimiting 2023-10-02 02:05:15 -06:00			`else:`
			`return False`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`def handle_request(self) -> Tuple[flask.Response, int]:`
			`# Must include this in your child.`
handle model offline 2023-10-04 13:18:47 -06:00			`# assert not self.used`
			`# if self.offline:`
			`# msg = f'{self.selected_model} is not a valid model choice.'`
			`# print(msg)`
			`# return format_sillytavern_err(msg)`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`raise NotImplementedError`
refactor generation route 2023-08-30 18:53:26 -06:00
fix double logging 2023-09-28 01:34:15 -06:00			`def handle_ratelimited(self, do_log: bool = True) -> Tuple[flask.Response, int]:`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`raise NotImplementedError`
actually we don't want to emulate openai 2023-09-12 01:04:11 -06:00
unify error message handling 2023-09-27 14:48:47 -06:00			`def handle_error(self, error_msg: str, error_type: str = 'error') -> Tuple[flask.Response, int]:`
set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`raise NotImplementedError`

refactor generation route 2023-08-30 18:53:26 -06:00
functional 2023-09-30 19:41:50 -06:00			`def get_backend_handler(mode, backend_url: str):`
mvp 2023-09-29 00:09:44 -06:00			`if mode == 'oobabooga':`
functional 2023-09-30 19:41:50 -06:00			`return OobaboogaBackend(backend_url)`
mvp 2023-09-29 00:09:44 -06:00			`elif mode == 'vllm':`
functional 2023-09-30 19:41:50 -06:00			`return VLLMBackend(backend_url)`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`else:`
			`raise Exception`
actually we don't want to emulate openai 2023-09-12 01:04:11 -06:00
refactor generation route 2023-08-30 18:53:26 -06:00
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`def delete_dict_key(d: dict, k: Union[str, list]):`
			`if isinstance(k, str):`
			`if k in d.keys():`
			`del d[k]`
			`elif isinstance(k, list):`
			`for item in k:`
			`if item in d.keys():`
			`del d[item]`
			`else:`
			`raise ValueError`
			`return d`
cache stats in background 2023-09-17 18:55:36 -06:00

			`def before_request():`
add config setting for hostname 2023-09-23 23:24:08 -06:00			`auto_set_base_client_api(request)`
cache stats in background 2023-09-17 18:55:36 -06:00			`if request.endpoint != 'v1.get_stats':`
			`response = require_api_key()`
			`if response is not None:`
			`return response`