Papers by Intesar Tahmid
Evaluating Large Vision Language Models on Bangla Medical Visual Question Answering (2026.findings-acl)
Copied to clipboard
Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Mahir Jawad, Anam Borhan Uddin, Md Fahim, Md Farhad Alam Bhuiyan
| Challenge: | Recent advances in Large Language Models and Large Vision Language Model (LVLMs) have demonstrated promising capabilities in complex reasoning tasks, but low-resource contexts like Bangla are underexplored. |
| Approach: | They propose a multilingual medical visual question answering dataset using Bangla. |
| Outcome: | The proposed model performs well on generalized visual tasks but struggles with fine-grained diagnostic reasoning, achieving low accuracy in specialized categories. |