hf_text-generation-inference/server/text_generation/server.py

import asyncio
import os
import torch

from grpc import aio
from loguru import logger

from grpc_reflection.v1alpha import reflection
from pathlib import Path
from typing import List, Optional

from text_generation.cache import Cache
from text_generation.interceptor import ExceptionInterceptor
from text_generation.models import Model, get_model
from text_generation.pb import generate_pb2_grpc, generate_pb2


class TextGenerationService(generate_pb2_grpc.TextGenerationServiceServicer):
    def __init__(self, model: Model, cache: Cache, server_urls: List[str]):
        self.cache = cache
        self.model = model
        self.server_urls = server_urls
        # For some reason, inference_mode does not work well with GLOO which we use on CPU
        if model.device.type == "cuda":
            # Force inference mode for the lifetime of TextGenerationService
            self._inference_mode_raii_guard = torch._C._InferenceMode(True)

    async def ServiceDiscovery(self, request, context):
        return generate_pb2.ServiceDiscoveryResponse(urls=self.server_urls)

    async def ClearCache(self, request, context):
        self.cache.clear()
        return generate_pb2.ClearCacheResponse()

    async def Prefill(self, request, context):
        batch = self.model.batch_type.from_pb(
            request.batch, self.model.tokenizer, self.model.device
        )

        generations, next_batch = self.model.generate_token(batch)
        self.cache.set(next_batch)

        return generate_pb2.PrefillResponse(
            generations=[generation.to_pb() for generation in generations],
            batch=next_batch.to_pb() if next_batch else None,
        )

    async def Decode(self, request, context):
        if len(request.batches) == 0:
            raise ValueError("Must provide at least one batch")

        batches = []
        for batch_pb in request.batches:
            batch = self.cache.pop(batch_pb.id)
            if batch is None:
                raise ValueError(f"Batch ID {batch_pb.id} not found in cache.")
            batches.append(batch)

        if len(batches) > 1:
            batch = self.model.batch_type.concatenate(batches)
        else:
            batch = batches[0]

        generations, next_batch = self.model.generate_token(batch)
        self.cache.set(next_batch)

        return generate_pb2.DecodeResponse(
            generations=[generation.to_pb() for generation in generations],
            batch=next_batch.to_pb() if next_batch else None,
        )


def serve(
    model_id: str,
    revision: Optional[str],
    sharded: bool,
    quantize: bool,
    uds_path: Path,
):
    async def serve_inner(
        model_id: str,
        revision: Optional[str],
        sharded: bool = False,
        quantize: bool = False,
    ):
        unix_socket_template = "unix://{}-{}"
        if sharded:
            server_urls = [
                unix_socket_template.format(uds_path, rank)
                for rank in range(int(os.environ["WORLD_SIZE"]))
            ]
            local_url = server_urls[int(os.environ["RANK"])]
        else:
            local_url = unix_socket_template.format(uds_path, 0)
            server_urls = [local_url]

        try:
            model = get_model(model_id, revision, sharded, quantize)
        except Exception:
            logger.exception("Error when initializing model")
            raise

        server = aio.server(interceptors=[ExceptionInterceptor()])
        generate_pb2_grpc.add_TextGenerationServiceServicer_to_server(
            TextGenerationService(model, Cache(), server_urls), server
        )
        SERVICE_NAMES = (
            generate_pb2.DESCRIPTOR.services_by_name["TextGenerationService"].full_name,
            reflection.SERVICE_NAME,
        )
        reflection.enable_server_reflection(SERVICE_NAMES, server)
        server.add_insecure_port(local_url)

        await server.start()

        logger.info("Server started at {}".format(local_url))

        try:
            await server.wait_for_termination()
        except KeyboardInterrupt:
            logger.info("Signal received. Shutting down")
            await server.stop(0)

    asyncio.run(serve_inner(model_id, revision, sharded, quantize))
Init 2022-10-08 04:30:12 -06:00			`import asyncio`
feat: Improve error handling 2022-10-17 06:59:00 -06:00			`import os`
fix(server): better handling of inference mode (#57) 2023-02-07 07:38:22 -07:00			`import torch`
feat: Improve error handling 2022-10-17 06:59:00 -06:00
Init 2022-10-08 04:30:12 -06:00			`from grpc import aio`
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 04:01:23 -07:00			`from loguru import logger`
Init 2022-10-08 04:30:12 -06:00
			`from grpc_reflection.v1alpha import reflection`
			`from pathlib import Path`
feat(server): Support GPT-Neox (#39) 2023-01-31 10:53:56 -07:00			`from typing import List, Optional`
Init 2022-10-08 04:30:12 -06:00
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00			`from text_generation.cache import Cache`
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 04:01:23 -07:00			`from text_generation.interceptor import ExceptionInterceptor`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00			`from text_generation.models import Model, get_model`
			`from text_generation.pb import generate_pb2_grpc, generate_pb2`
Init 2022-10-08 04:30:12 -06:00

Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`class TextGenerationService(generate_pb2_grpc.TextGenerationServiceServicer):`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00			`def __init__(self, model: Model, cache: Cache, server_urls: List[str]):`
Init 2022-10-08 04:30:12 -06:00			`self.cache = cache`
			`self.model = model`
			`self.server_urls = server_urls`
fix(server): better handling of inference mode (#57) 2023-02-07 07:38:22 -07:00			`# For some reason, inference_mode does not work well with GLOO which we use on CPU`
			`if model.device.type == "cuda":`
			`# Force inference mode for the lifetime of TextGenerationService`
			`self._inference_mode_raii_guard = torch._C._InferenceMode(True)`
Init 2022-10-08 04:30:12 -06:00
			`async def ServiceDiscovery(self, request, context):`
			`return generate_pb2.ServiceDiscoveryResponse(urls=self.server_urls)`

			`async def ClearCache(self, request, context):`
			`self.cache.clear()`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`return generate_pb2.ClearCacheResponse()`
Init 2022-10-08 04:30:12 -06:00
feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 09:04:00 -07:00			`async def Prefill(self, request, context):`
feat(server): Support AutoModelForSeq2SeqLM 2022-11-04 11:03:04 -06:00			`batch = self.model.batch_type.from_pb(`
			`request.batch, self.model.tokenizer, self.model.device`
			`)`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00
feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 09:04:00 -07:00			`generations, next_batch = self.model.generate_token(batch)`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`self.cache.set(next_batch)`

feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 09:04:00 -07:00			`return generate_pb2.PrefillResponse(`
			`generations=[generation.to_pb() for generation in generations],`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`batch=next_batch.to_pb() if next_batch else None,`
Init 2022-10-08 04:30:12 -06:00			`)`

feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 09:04:00 -07:00			`async def Decode(self, request, context):`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`if len(request.batches) == 0:`
			`raise ValueError("Must provide at least one batch")`

			`batches = []`
			`for batch_pb in request.batches:`
			`batch = self.cache.pop(batch_pb.id)`
			`if batch is None:`
			`raise ValueError(f"Batch ID {batch_pb.id} not found in cache.")`
			`batches.append(batch)`

			`if len(batches) > 1:`
feat(server): Support AutoModelForSeq2SeqLM 2022-11-04 11:03:04 -06:00			`batch = self.model.batch_type.concatenate(batches)`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`else:`
			`batch = batches[0]`

feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 09:04:00 -07:00			`generations, next_batch = self.model.generate_token(batch)`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`self.cache.set(next_batch)`

feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 09:04:00 -07:00			`return generate_pb2.DecodeResponse(`
			`generations=[generation.to_pb() for generation in generations],`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`batch=next_batch.to_pb() if next_batch else None,`
			`)`

Init 2022-10-08 04:30:12 -06:00
v0.1.0 2022-10-18 07:19:03 -06:00			`def serve(`
feat(router): refactor API and add openAPI schemas (#53) 2023-02-03 04:43:37 -07:00			`model_id: str,`
feat(server): Support GPT-Neox (#39) 2023-01-31 10:53:56 -07:00			`revision: Optional[str],`
v0.1.0 2022-10-18 07:19:03 -06:00			`sharded: bool,`
feat(server): Support bitsandbytes 2022-10-27 06:25:29 -06:00			`quantize: bool,`
v0.1.0 2022-10-18 07:19:03 -06:00			`uds_path: Path,`
			`):`
Init 2022-10-08 04:30:12 -06:00			`async def serve_inner(`
feat(router): refactor API and add openAPI schemas (#53) 2023-02-03 04:43:37 -07:00			`model_id: str,`
feat(server): Support GPT-Neox (#39) 2023-01-31 10:53:56 -07:00			`revision: Optional[str],`
Init 2022-10-08 04:30:12 -06:00			`sharded: bool = False,`
feat(server): Support bitsandbytes 2022-10-27 06:25:29 -06:00			`quantize: bool = False,`
Init 2022-10-08 04:30:12 -06:00			`):`
v0.1.0 2022-10-18 07:19:03 -06:00			`unix_socket_template = "unix://{}-{}"`
Init 2022-10-08 04:30:12 -06:00			`if sharded:`
			`server_urls = [`
v0.1.0 2022-10-18 07:19:03 -06:00			`unix_socket_template.format(uds_path, rank)`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00			`for rank in range(int(os.environ["WORLD_SIZE"]))`
Init 2022-10-08 04:30:12 -06:00			`]`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00			`local_url = server_urls[int(os.environ["RANK"])]`
Init 2022-10-08 04:30:12 -06:00			`else:`
v0.1.0 2022-10-18 07:19:03 -06:00			`local_url = unix_socket_template.format(uds_path, 0)`
Init 2022-10-08 04:30:12 -06:00			`server_urls = [local_url]`

fix(server): better handling of inference mode (#57) 2023-02-07 07:38:22 -07:00			`try:`
			`model = get_model(model_id, revision, sharded, quantize)`
			`except Exception:`
			`logger.exception("Error when initializing model")`
			`raise`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 04:01:23 -07:00			`server = aio.server(interceptors=[ExceptionInterceptor()])`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`generate_pb2_grpc.add_TextGenerationServiceServicer_to_server(`
			`TextGenerationService(model, Cache(), server_urls), server`
Init 2022-10-08 04:30:12 -06:00			`)`
			`SERVICE_NAMES = (`
Refactored gRPC interface Added validation logic 2022-10-11 08:50:54 -06:00			`generate_pb2.DESCRIPTOR.services_by_name["TextGenerationService"].full_name,`
Init 2022-10-08 04:30:12 -06:00			`reflection.SERVICE_NAME,`
			`)`
			`reflection.enable_server_reflection(SERVICE_NAMES, server)`
			`server.add_insecure_port(local_url)`
fix(server): better handling of inference mode (#57) 2023-02-07 07:38:22 -07:00
Init 2022-10-08 04:30:12 -06:00			`await server.start()`
fix(server): better handling of inference mode (#57) 2023-02-07 07:38:22 -07:00
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 04:01:23 -07:00			`logger.info("Server started at {}".format(local_url))`
fix(server): better handling of inference mode (#57) 2023-02-07 07:38:22 -07:00
v0.1.0 2022-10-18 07:19:03 -06:00			`try:`
			`await server.wait_for_termination()`
			`except KeyboardInterrupt:`
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 04:01:23 -07:00			`logger.info("Signal received. Shutting down")`
v0.1.0 2022-10-18 07:19:03 -06:00			`await server.stop(0)`
Init 2022-10-08 04:30:12 -06:00
feat(router): refactor API and add openAPI schemas (#53) 2023-02-03 04:43:37 -07:00			`asyncio.run(serve_inner(model_id, revision, sharded, quantize))`