Papers by Georgy Andryushchenko
Evaluating Tokenizer Adaptation Methods for Large Language Models on Low-Resource Programming Languages (2025.acl-srw)
Copied to clipboard
| Challenge: | Large language models (LLMs) trained on high-resource programming languages perform sub-optimally for low-resourced programming languages (LRPLs). |
| Approach: | They evaluate the impact of tokenizer adaptation methods on improving code generation for LRPLs. |
| Outcome: | The proposed methods outperform the original models and fine-tuned models in LRPLs, but performance declines in non-target languages like Python after tokenizer adaptation. |