Instructions to use kerasformers/deberta_large with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- KerasFormers
How to use kerasformers/deberta_large with KerasFormers:
# No code snippets available yet for this library. # To use this model, check the repository files and the library's documentation. # Want to help? PRs adding snippets are welcome at: # https://github.com/huggingface/huggingface.js
- Keras
How to use kerasformers/deberta_large with Keras:
# Available backend options are: "jax", "torch", "tensorflow". import os os.environ["KERAS_BACKEND"] = "jax" import keras model = keras.saving.load_model("hf://kerasformers/deberta_large") - Notebooks
- Google Colab
- Kaggle
See our collection for all versions of DeBERTa (v1 / v2 / v3).
Run DeBERTa with Keras 3: JAX, PyTorch, or TensorFlow
kerasformers/deberta_large
Papers: DeBERTa: Decoding-enhanced BERT with Disentangled Attention (arXiv:2006.03654) · DeBERTaV3 (arXiv:2111.09543) · HF Papers
DeBERTa is Microsoft's disentangled-attention text encoder (content + relative position). v1 uses byte-level BPE; v2/v3 use SentencePiece. v3 adds ELECTRA-style pretraining with gradient-disentangled embedding sharing. Import from deberta / deberta_v2 / deberta_v3 to match the generation.
For more details on the model, please go to the upstream model card.
Pure-Keras 3 conversion of microsoft/deberta-large for kerasformers. One implementation runs unmodified on TensorFlow / Torch / JAX.
This is a fill-mask / encoder checkpoint (DebertaMaskedLM, v1 large). Task heads (sequence/token classify, QA, …) load via hf: fine-tunes.
✨ Quick start (fill-mask)
import os
os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
from kerasformers.models.deberta import (
DebertaMaskedLM,
DebertaTokenizer,
)
mlm = DebertaMaskedLM.from_weights("kerasformers/deberta_large")
tokenizer = DebertaTokenizer.from_weights("kerasformers/deberta_large")
inputs = tokenizer("The capital of France is [MASK].")
logits = mlm(inputs) # (1, L, vocab_size)
mask = int((inputs["input_ids"][0] == tokenizer.mask_token_id).argmax())
print(tokenizer.decode([int(logits[0, mask].argmax())]))
Load any DeBERTa variant the same way with from_weights("kerasformers/<variant>"):
| Variant | Hub | Generation |
|---|---|---|
deberta_base |
kerasformers/deberta_base |
v1 |
deberta_large |
kerasformers/deberta_large |
v1 |
deberta_v2_xlarge |
kerasformers/deberta_v2_xlarge |
v2 |
deberta_v2_xxlarge |
kerasformers/deberta_v2_xxlarge |
v2 |
deberta_v3_xsmall |
kerasformers/deberta_v3_xsmall |
v3 |
deberta_v3_small |
kerasformers/deberta_v3_small |
v3 |
deberta_v3_base |
kerasformers/deberta_v3_base |
v3 |
deberta_v3_large |
kerasformers/deberta_v3_large |
v3 |
Tips
- Set
KERAS_BACKENDbefore importing Keras / kerasformers. - Prefer
Tokenizer.from_weights(...)so vocab and mask token match. - Do not mix packages across generations (v1 ≠ v2 ≠ v3).
- See DeBERTa docs and Loading Weights.
- Community / upstream safetensors still work via the
hf:prefix, e.g.DebertaMaskedLM.from_weights("hf:microsoft/deberta-large").
Special Thanks
A huge thank you to the Microsoft DeBERTa authors for creating and releasing these models.
License: MIT.
- Downloads last month
- -
Model tree for kerasformers/deberta_large
Base model
microsoft/deberta-large