Portrait of Patrick Amadeus Irawan

Patrick Amadeus Irawan

PhD Researcher
MBZUAI
patrick.irawan@mbzuai.ac.ae


← Back to home

Publications

Efficient multimodal learning Self-improving systems Multilingual and multicultural evaluation Multimodal reasoning and robustness

2026

  1. Figure from LinguDistill: Recovering Linguistic Ability in Vision Language Models via Selective Cross-Modal Distillation Preprint
    Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva
    Preprint, 2026.
    LinguDistill restores linguistic competence in VLMs through selective cross-modal distillation without sacrificing multimodal capability.
  2. Figure from Counting to Four is still a Chore for VLMs CVPR 2026 Workshop
    Duy Le Dinh Anh, Patrick Amadeus Irawan, Tuan Van Vo
    Computer Vision and Pattern Recognition Conference (CVPR) Workshop, 2026.
    The study traces simple counting failures in VLMs and tests whether an attention-budget intervention improves grounding.
  3. Figure from Anthropogenic Regional Adaptation in Multimodal Vision-Language Model Preprint
    Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, and others, including Patrick Amadeus Irawan
    Preprint, 2026.
    Regional data filtering and model merging improve Southeast Asian cultural relevance without sacrificing global performance.
  4. Figure from Can Large Language Models Understand, Reason About, and Generate Code-Switched Text? Preprint
    Genta Indra Winata, David Anugraha, Patrick Amadeus Irawan, Anirban Das, Haneul Yoo, and others
    Preprint, 2026.
    CodeMixQA tests LLM understanding, reasoning, and generation across 16 code-switched language-pair variants.
  5. Figure from Vision Language Models are Confused Tourists CVPR 2026 Findings
    Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji
    Computer Vision and Pattern Recognition Conference (CVPR), 2026 Findings.
    This study shows where VLMs misread culturally conflicting visual situations and which grounding failures standard benchmarks miss.
  6. Figure from M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG CVPR 2026
    David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata
    Computer Vision and Pattern Recognition Conference (CVPR), 2026.
    M4-RAG tests when multimodal retrieval helps multilingual and multicultural question answering and when it fails.

2025

  1. Figure from Seeing Culture: A Benchmark for Visual Reasoning and Grounding EMNLP 2025
    Burak Satar, Zhixin Ma, Patrick Amadeus Irawan, Wilfried A. Mulyawan, Jing Jiang, Ee-Peng Lim, Chong-Wah Ngo
    Conference on Empirical Methods in Natural Language Processing (EMNLP), 2025.
    Seeing Culture tests culture-sensitive visual reasoning and grounding beyond object recognition.
  2. Figure from Entropy2Vec: Crosslingual Language Modeling Entropy as End-to-End Learnable Language Representations MRL @ EMNLP 2025
    Patrick Amadeus Irawan, Ryandito Diandaru, Belati Jagad Bintang Syuhada, Randy Zakya Suchrady, Alham Fikri Aji, Genta Indra Winata, Fajri Koto, Samuel Cahyawijaya
    Multilingual Representation Learning Workshop at EMNLP, 2025.
    Entropy2Vec turns language-model uncertainty into dense cross-lingual representations for multilingual NLP tasks.
  3. Figure from WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines NAACL 2025
    Genta Indra Winata, Frederikus Hudi, Patrick Amadeus Irawan, David Anugraha, Rifki Afina Putri, Yutong Wang, Adam Nohejl, Ubaidillah Ariq Prathama, Nedjma Ousidhoum, and others
    North American Chapter of the Association for Computational Linguistics (NAACL), 2025.
    WorldCuisines tests multilingual and multicultural VQA through food imagery and cultural context instead of English-centric priors.
  4. Figure from ProxyLM: Predicting Language Model Performance on Multilingual Tasks via Proxy Models NAACL 2025
    David Anugraha, Genta Indra Winata, Chenyue Li, Patrick Amadeus Irawan, En-Shiun Annie Lee
    North American Chapter of the Association for Computational Linguistics (NAACL), 2025.
    ProxyLM uses cheaper proxy models to estimate multilingual model performance at lower evaluation cost.
  5. Figure from Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models COLING 2025
    Patrick Amadeus Irawan, Genta Indra Winata, Samuel Cahyawijaya, Ayu Purwarianti
    International Conference on Computational Linguistics (COLING), 2025.
    The pipeline generates VQA explanations more efficiently for use as synthetic supervision in grounded reasoning.
  6. Figure from Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability Preprint
    Genta Indra Winata, David Anugraha, Emmy Liu, Alham Fikri Aji, Shou-Yi Hung, Aditya Parashar, Patrick Amadeus Irawan, and others
    Preprint, 2025.
    DataRubrics scores dataset quality and accountability so audits are easier to compare.

2024

  1. Figure from SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages EMNLP 2024
    Holy Lovenia, Rahmad Mahendra, Salsabil Maulana Akbar, Lester James V Miranda, Jennifer Santoso, Elyanah Aco, ..., Patrick Amadeus Irawan, and others
    Conference on Empirical Methods in Natural Language Processing (EMNLP), 2024.
    SEACrowd provides multilingual and multimodal datasets and benchmarks for low-resource Southeast Asian evaluation.
  2. Figure from Leveraging IoT and Machine Learning for Efficient Rice Stock Monitoring and Prediction APSIPA ASC 2024
    Nana Sutisna, Aditya Prawira Nugroho, Christopher Jeffrey, Patrick Amadeus Irawan, Rizky Ramadhana, Ronggur Mahendra, Michael Jonathan, Infall Syafalni, Trio Adiono
    Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), 2024.
    The system combines sensors and machine learning to monitor and predict rice stocks.