5-stage pipelinenormalizer → pre_tokenizer → model → post_processor → decoder
from_pretrained to just use oneTokenizer.from_pretrained / from_file; encode() returns an Encoding
Encoding has more than idsids, tokens, attention_mask, offsets, word_ids
offsets = superpowermap tokens back to exact characters for NER/QA spans
model picks the algorithmBPE / WordPiece / Unigram / WordLevel + a matching trainer
train_from_iteratortrain straight from a datasets stream, no temp files
TemplateProcessing for [CLS]/[SEP]$A/$B templates + type ids
decoder must match pre-tokenizerByteLevel/WordPiece/Metaspace pairs
save = one tokenizer.jsonwrap in PreTrainedTokenizerFast for Transformers