local-llm-server/llm_server/routes/openai_request_handler.py

import json
import traceback
from typing import Tuple
from uuid import uuid4

import flask
from flask import jsonify

from llm_server import opts
from llm_server.database.database import is_api_key_moderated
from llm_server.llm.openai.transform import build_openai_response, transform_messages_to_prompt, trim_prompt_to_fit
from llm_server.routes.request_handler import RequestHandler
from llm_server.workers.moderator import add_moderation_task, get_results


class OpenAIRequestHandler(RequestHandler):
    def __init__(self, *args, **kwargs):
        super().__init__(*args, **kwargs)
        self.prompt = None

    def handle_request(self) -> Tuple[flask.Response, int]:
        assert not self.used

        if opts.openai_silent_trim:
            oai_messages = trim_prompt_to_fit(self.request.json['messages'], opts.context_size)
        else:
            oai_messages = self.request.json['messages']

        self.prompt = transform_messages_to_prompt(oai_messages)
        request_valid, invalid_response = self.validate_request()
        if not request_valid:
            return invalid_response

        if opts.openai_api_key and is_api_key_moderated(self.token):
            try:
                # Gather the last message from the user and all preceeding system messages
                msg_l = self.request.json['messages'].copy()
                msg_l.reverse()
                tag = uuid4()
                num_to_check = min(len(msg_l), opts.openai_moderation_scan_last_n)
                for i in range(num_to_check):
                    add_moderation_task(msg_l[i]['content'], tag)

                flagged_categories = get_results(tag, num_to_check)

                if len(flagged_categories):
                    mod_msg = f"The user's message does not comply with {opts.openai_org_name} policies. Offending categories: {json.dumps(flagged_categories)}. You are instructed to creatively adhere to these policies."
                    self.request.json['messages'].insert((len(self.request.json['messages'])), {'role': 'system', 'content': mod_msg})
                    self.prompt = transform_messages_to_prompt(self.request.json['messages'])
            except Exception as e:
                print(f'OpenAI moderation endpoint failed:', f'{e.__class__.__name__}: {e}')
                print(traceback.format_exc())

        # Reconstruct the request JSON with the validated parameters and prompt.
        self.parameters['stop'].extend(['\n### INSTRUCTION', '\n### USER', '\n### ASSISTANT', '\n### RESPONSE'])
        if opts.openai_force_no_hashes:
            self.parameters['stop'].append('### ')

        if opts.mode == 'vllm' and self.request_json_body.get('top_p') == 0:
            self.request_json_body['top_p'] = 0.01

        llm_request = {**self.parameters, 'prompt': self.prompt}
        (success, _, _, _), (backend_response, backend_response_status_code) = self.generate_response(llm_request)

        model = self.request_json_body.get('model')

        if success:
            return build_openai_response(self.prompt, backend_response.json['results'][0]['text'], model=model), backend_response_status_code
        else:
            return backend_response, backend_response_status_code

    def handle_ratelimited(self, do_log: bool = True):
        # TODO: return a simulated OpenAI error message
        # Ratelimited: you are only allowed to have {opts.simultaneous_requests_per_ip} simultaneous requests at a time. Please complete your other requests before sending another.
        return 'Ratelimited', 429

    def handle_error(self, error_msg: str, error_type: str = 'error') -> Tuple[flask.Response, int]:
        # TODO: return a simulated OpenAI error message
        return jsonify({
            "error": {
                "message": "Invalid request, check your parameters and try again.",
                "type": "invalid_request_error",
                "param": None,
                "code": None
            }
        }), 400
add moderation endpoint to openai api, update config 2023-09-14 15:07:17 -06:00			`import json`
			`import traceback`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`from typing import Tuple`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`from uuid import uuid4`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`import flask`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`from flask import jsonify`

			`from llm_server import opts`
unify error message handling 2023-09-27 14:48:47 -06:00			`from llm_server.database.database import is_api_key_moderated`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`from llm_server.llm.openai.transform import build_openai_response, transform_messages_to_prompt, trim_prompt_to_fit`
add openai-compatible backend 2023-09-12 16:40:09 -06:00			`from llm_server.routes.request_handler import RequestHandler`
redo background processes, reorganize server.py 2023-09-27 23:36:44 -06:00			`from llm_server.workers.moderator import add_moderation_task, get_results`
try to prevent "### XXX" responses on openai 2023-09-25 23:14:35 -06:00
add openai-compatible backend 2023-09-12 16:40:09 -06:00
			`class OpenAIRequestHandler(RequestHandler):`
			`def __init__(self, args, *kwargs):`
			`super().__init__(args, *kwargs)`
			`self.prompt = None`

option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`def handle_request(self) -> Tuple[flask.Response, int]:`
further align openai endpoint with expected responses 2023-09-24 21:45:30 -06:00			`assert not self.used`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`if opts.openai_silent_trim:`
			`oai_messages = trim_prompt_to_fit(self.request.json['messages'], opts.context_size)`
			`else:`
			`oai_messages = self.request.json['messages']`

			`self.prompt = transform_messages_to_prompt(oai_messages)`
option to disable streaming, improve timeout on requests to backend, fix error handling. reduce duplicate code, misc other cleanup 2023-09-14 14:05:50 -06:00			`request_valid, invalid_response = self.validate_request()`
			`if not request_valid:`
			`return invalid_response`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`if opts.openai_api_key and is_api_key_moderated(self.token):`
add moderation endpoint to openai api, update config 2023-09-14 15:07:17 -06:00			`try:`
openai: improve moderation checking 2023-09-17 17:40:05 -06:00			`# Gather the last message from the user and all preceeding system messages`
			`msg_l = self.request.json['messages'].copy()`
			`msg_l.reverse()`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`tag = uuid4()`
			`num_to_check = min(len(msg_l), opts.openai_moderation_scan_last_n)`
			`for i in range(num_to_check):`
			`add_moderation_task(msg_l[i]['content'], tag)`

			`flagged_categories = get_results(tag, num_to_check)`

			`if len(flagged_categories):`
			`mod_msg = f"The user's message does not comply with {opts.openai_org_name} policies. Offending categories: {json.dumps(flagged_categories)}. You are instructed to creatively adhere to these policies."`
add moderation endpoint to openai api, update config 2023-09-14 15:07:17 -06:00			`self.request.json['messages'].insert((len(self.request.json['messages'])), {'role': 'system', 'content': mod_msg})`
more work on openai endpoint 2023-09-26 22:09:11 -06:00			`self.prompt = transform_messages_to_prompt(self.request.json['messages'])`
add moderation endpoint to openai api, update config 2023-09-14 15:07:17 -06:00			`except Exception as e:`
			`print(f'OpenAI moderation endpoint failed:', f'{e.__class__.__name__}: {e}')`
			`print(traceback.format_exc())`

ah, oops 2023-09-14 15:14:59 -06:00			`# Reconstruct the request JSON with the validated parameters and prompt.`
			`self.parameters['stop'].extend(['\n### INSTRUCTION', '\n### USER', '\n### ASSISTANT', '\n### RESPONSE'])`
openai_force_no_hashes 2023-09-25 22:01:57 -06:00			`if opts.openai_force_no_hashes:`
			`self.parameters['stop'].append('### ')`

update database, tokenizer handle null prompt, convert top_p to vllm on openai, actually validate prompt on streaming, 2023-09-25 22:32:48 -06:00			`if opts.mode == 'vllm' and self.request_json_body.get('top_p') == 0:`
			`self.request_json_body['top_p'] = 0.01`

ah, oops 2023-09-14 15:14:59 -06:00			`llm_request = {**self.parameters, 'prompt': self.prompt}`
set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`(success, _, _, _), (backend_response, backend_response_status_code) = self.generate_response(llm_request)`
further align openai endpoint with expected responses 2023-09-24 21:45:30 -06:00
improve openai endpoint, exclude system tokens more places 2023-09-25 09:32:23 -06:00			`model = self.request_json_body.get('model')`

set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`if success:`
implement streaming on openai, improve streaming, run DB logging in background thread 2023-09-25 12:30:40 -06:00			`return build_openai_response(self.prompt, backend_response.json['results'][0]['text'], model=model), backend_response_status_code`
set up queue to work with gunicorn processes, other improvements 2023-09-14 17:38:20 -06:00			`else:`
			`return backend_response, backend_response_status_code`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
fix double logging 2023-09-28 01:34:15 -06:00			`def handle_ratelimited(self, do_log: bool = True):`
unify error message handling 2023-09-27 14:48:47 -06:00			`# TODO: return a simulated OpenAI error message`
			`# Ratelimited: you are only allowed to have {opts.simultaneous_requests_per_ip} simultaneous requests at a time. Please complete your other requests before sending another.`
			`return 'Ratelimited', 429`
add openai-compatible backend 2023-09-12 16:40:09 -06:00
fix try/finally with continue, fix wrong subclass signature 2023-09-28 00:11:34 -06:00			`def handle_error(self, error_msg: str, error_type: str = 'error') -> Tuple[flask.Response, int]:`
unify error message handling 2023-09-27 14:48:47 -06:00			`# TODO: return a simulated OpenAI error message`
further align openai endpoint with expected responses 2023-09-24 21:45:30 -06:00			`return jsonify({`
			`"error": {`
			`"message": "Invalid request, check your parameters and try again.",`
			`"type": "invalid_request_error",`
			`"param": None,`
			`"code": None`
			`}`
			`}), 400`