hf_text-generation-inference/server/text_generation/models/model.py

import torch

from abc import ABC, abstractmethod
from typing import List, Tuple, Optional, TypeVar, Type
from transformers import PreTrainedTokenizerBase

from text_generation.models.types import Batch, GeneratedText

B = TypeVar("B", bound=Batch)


class Model(ABC):
    def __init__(self, tokenizer: PreTrainedTokenizerBase, device: torch.device):
        self.tokenizer = tokenizer
        self.all_special_ids = set(tokenizer.all_special_ids)
        self.device = device

        # see `decode_token` method
        self.tokenizer.add_special_tokens(
            {"additional_special_tokens": ["<decode-token>"]}
        )
        self.special_decode_token_id = self.tokenizer.convert_tokens_to_ids(
            "<decode-token>"
        )
        self.special_decode_token_length = len("<decode-token>")

    @property
    @abstractmethod
    def batch_type(self) -> Type[B]:
        raise NotImplementedError

    @abstractmethod
    def generate_token(self, batch: B) -> Tuple[List[GeneratedText], Optional[B]]:
        raise NotImplementedError

    def decode_token(self, token_id: int) -> str:
        """Hack to hopefully support generate_stream for the maximum number of tokenizers"""
        # append token to special decode token and decode both
        result = self.tokenizer.decode(
            [self.special_decode_token_id, token_id], skip_special_tokens=False
        )
        # slice to remove special decode token
        return result[self.special_decode_token_length :]
feat(server): Support generic AutoModelForCausalLM 2022-11-04 07:22:47 -06:00			`import torch`

fix(models): Revert buggy support for AutoModel 2022-11-03 09:07:54 -06:00			`from abc import ABC, abstractmethod`
feat(server): Support AutoModelForSeq2SeqLM 2022-11-04 11:03:04 -06:00			`from typing import List, Tuple, Optional, TypeVar, Type`
fix(server): Minor refactorization using new_zeros (#24) - Fix some type hints, in particular base tokenizer class - Make use of `tensor.new_zero/empty` methods - Simplify env var string parsing in launcher 2023-01-17 01:10:22 -07:00			`from transformers import PreTrainedTokenizerBase`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00
			`from text_generation.models.types import Batch, GeneratedText`

feat(server): Support AutoModelForSeq2SeqLM 2022-11-04 11:03:04 -06:00			`B = TypeVar("B", bound=Batch)`

feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00
fix(models): Revert buggy support for AutoModel 2022-11-03 09:07:54 -06:00			`class Model(ABC):`
fix(server): Minor refactorization using new_zeros (#24) - Fix some type hints, in particular base tokenizer class - Make use of `tensor.new_zero/empty` methods - Simplify env var string parsing in launcher 2023-01-17 01:10:22 -07:00			`def __init__(self, tokenizer: PreTrainedTokenizerBase, device: torch.device):`
feat(server): Support generic AutoModelForCausalLM 2022-11-04 07:22:47 -06:00			`self.tokenizer = tokenizer`
feat(server): add special token bool (#85) 2023-02-24 07:55:57 -07:00			`self.all_special_ids = set(tokenizer.all_special_ids)`
feat(server): Support generic AutoModelForCausalLM 2022-11-04 07:22:47 -06:00			`self.device = device`

fix(server): fix generate_stream by forcing tokens to be decoded correctly (#100) 2023-03-06 05:22:58 -07:00			# see `decode_token` method
			`self.tokenizer.add_special_tokens(`
			`{"additional_special_tokens": ["<decode-token>"]}`
			`)`
			`self.special_decode_token_id = self.tokenizer.convert_tokens_to_ids(`
			`"<decode-token>"`
			`)`
			`self.special_decode_token_length = len("<decode-token>")`

feat(server): Support AutoModelForSeq2SeqLM 2022-11-04 11:03:04 -06:00			`@property`
fix(models): Revert buggy support for AutoModel 2022-11-03 09:07:54 -06:00			`@abstractmethod`
feat(server): Support AutoModelForSeq2SeqLM 2022-11-04 11:03:04 -06:00			`def batch_type(self) -> Type[B]:`
fix(models): Revert buggy support for AutoModel 2022-11-03 09:07:54 -06:00			`raise NotImplementedError`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 11:24:00 -06:00
feat(server): Support AutoModelForSeq2SeqLM 2022-11-04 11:03:04 -06:00			`@abstractmethod`
			`def generate_token(self, batch: B) -> Tuple[List[GeneratedText], Optional[B]]:`
			`raise NotImplementedError`
fix(server): fix generate_stream by forcing tokens to be decoded correctly (#100) 2023-03-06 05:22:58 -07:00
			`def decode_token(self, token_id: int) -> str:`
			`"""Hack to hopefully support generate_stream for the maximum number of tokenizers"""`
			`# append token to special decode token and decode both`
			`result = self.tokenizer.decode(`
			`[self.special_decode_token_id, token_id], skip_special_tokens=False`
			`)`
			`# slice to remove special decode token`
			`return result[self.special_decode_token_length :]`