When a model becomes safer, does it still know what it knows?
I study calibration under safety alignment: where confidence stops matching accuracy, who absorbs that cost, and how reliable deference can be recovered.
Calibration under alignment
Measuring whether safety training makes confidence less reliable—and where the loss concentrates.
Multilingual and cultural evaluation
Testing claims beyond English with data grounded in Southeast Asian languages and lived context.
Reliable multimodal systems
Building uncertainty-aware systems across vision, language, navigation, and earth observation.
Research that defines the direction
Two projects that connect representation, real-world variation, and measurable reliability.
Progressive Cross-Attention Network for Flood Segmentation Using Multispectral Satellite Imagery
ProCANet reached a state-of-the-art IoU score of 0.815 on the Sen1Floods11 flood benchmark.
- Contribution
- Designed progressive cross-attention fusion and led the paper.
- Evidence
- 0.815 IoU on Sen1Floods11.
Abstract
We present ProCANet, which applies self-attention and cross-attention in stages to combine multispectral features for flood segmentation.
Crowdsource, Crawl, or Generate? Creating SEA-VL, a Multicultural Vision-Language Dataset for Southeast Asia
A Southeast Asian vision-language benchmark with 1.28 million culturally relevant images across 11 regional languages.
- Contribution
- Built regional data infrastructure and benchmark quality controls.
- Evidence
- 1.28M images across 11 regional languages.
Abstract
Southeast Asia remains underrepresented in vision-language research despite its linguistic and cultural diversity. SEA-VL addresses this gap through open, high-quality datasets grounded in regional languages and cultures.
Publication archive
2026
CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data
A community-built, human-annotated web benchmark covering 109 languages.
Details
Authors Pedro Ortiz Suarez, Laurie Burchell, Catherine Arnett, Rafael Mosquera-Gómez, Sara Hincapie-Monsalve, Thom Vaughan, Damian Stewart, Malte Ostendorff, Idris Abdulmumin, Vukosi Marivate, Shamsuddeen Hassan Muhammad, Atnafu Lambebo Tonja, Hend Al-Khalifa, Nadia Ghezaiel Hammouda, Verrah Otiende, Tack Hwa Wong, Jakhongir Saydaliev, Melika Nobakhtian, Muhammad Ravi Shulthan Habibi, Chalamalasetti Kranti, Carol Muchemi, Khang Nguyen, Faisal Muhammad Adam, Luis Frentzen Salim, Reem Alqifari, Cynthia Amol, Joseph Marvin Imperial, Ilker Kesen, Ahmad Mustafid, Pavel Stepachev, Leshem Choshen, David Anugraha, Hamada Nayel, Seid Muhie Yimam, Vallerie Alexandra Putra, My Chiffon Nguyen, Azmine Toushik Wasi, Gouthami Vadithya, Rob van der Goot, Lanwenn ar C'horr, Karan Dua, Andrew Yates, Mithil Bangera, Yeshil Bangera, Hitesh Laxmichand Patel, Shu Okabe, Fenal Ashokbhai Ilasariya, Dmitry Gaynullin, Genta Indra Winata, Yiyuan Li, Juan Pablo Martínez, Amit Agarwal, Ikhlasul Akmal Hanif, Raia Abu Ahmad, Esther Adenuga, Filbert Aurelian Tjiaranata, Weerayut Buaphet, Michael Anugraha, Sowmya Vajjala, Benjamin Rice, Azril Hafizi Amirudin, Jesujoba O. Alabi, Srikant Panda, Yassine Toughrai, Bruhan Kyomuhendo, Daniel Ruffinelli, Akshata A, Manuel Goulão, Ej Zhou, Ingrid Gabriela Franco Ramirez, Cristina Aggazzotti, Konstantin Dobler, Jun Kevin, Quentin Pagès, Nicholas Andrews, Nuhu Ibrahim, Mattes Ruckdeschel, Amr Keleg, Mike Zhang, Casper Muziri, Saron Samuel, Sotaro Takeshita, Kun Kerdthaisong, Luca Foppiano, Rasul Dent, Tommaso Green, Ahmad Mustapha Wali, Kamohelo Makaaka, Vicky Feliren, Inshirah Idris, Hande Celikkanat, Abdulhamid Abubakar, Jean Maillard, Benoît Sagot, Thibault Clérice, Kenton Murray, Sarah Luger
Abstract CommonLID is a community-built, human-annotated benchmark for identifying 109 languages in web data.
DOI 10.18653/v1/2026.acl-long.1527
Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
GG-EZ improved cultural relevance for Southeast Asia by 5–15% while retaining more than 98% of global benchmark performance.
Details
Authors Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Mohamed Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan
Abstract Anthropogenic Regional Adaptation improves a model’s relevance to a specific region while preserving its ability to generalise globally.
DOI 10.48550/arXiv.2604.11490
2025
Multi-modal deep learning approaches to semantic segmentation of mining footprints with multispectral satellite imagery
Mapped mining areas at 37 sites worldwide using deep learning and multispectral satellite images.
Details
Authors Muhamad Risqi U. Saputra, Irfan Dwiki Bhaswara, Bahrul Ilmi Nasution, Michelle Ang Li Ern, Nur Laily Romadhotul Husna, Tahjudil Witra, Vicky Feliren, John R. Owen, Deanna Kemp, Alex M. Lechner
Abstract Earlier remote sensing studies often covered one mine, one type of mining feature, or only the outer boundary of several mines. We studied 37 mining sites worldwide, covering commodities from gold to coal. We built a multispectral dataset with refined boundaries, shapes, and class labels, then trained models to separate mining and non-mining land. We tested U-Net, DeepLabV3+, FPN, SegFormer, and the IBM-NASA Prithvi model across several band combinations and transfer-learning setups. An ImageNet-pretrained FPN with a DenseNet-121 backbone performed best when trained on RGB and near-infrared bands. We also assessed performance across climate groups and mining commodities.
DOI 10.1016/j.rse.2024.114584
Crowdsource, Crawl, or Generate? Creating SEA-VL, a Multicultural Vision-Language Dataset for Southeast Asia
A Southeast Asian vision-language benchmark with 1.28 million culturally relevant images across 11 regional languages.
Details
Authors Samuel Cahyawijaya, Holy Lovenia, Joel Ruben Antony Moniz, Tack Hwa Wong, Mohammad Rifqi Farhansyah, Thant Thiri Maung, Frederikus Hudi, David Anugraha, Muhammad Ravi Shulthan Habibi, Muhammad Reza Qorib, Amit Agarwal, Joseph Marvin Imperial, Hitesh Laxmichand Patel, Vicky Feliren, Bahrul Ilmi Nasution, Manuel Antonio Rufino, Genta Indra Winata, Rian Adam Rajagede, Carlos Rafael Catalan, Mohamed Fazli Mohamed Imam, Priyaranjan Pattnayak, Salsabila Zahirah Pranida, Kevin Pratama, Yeshil Bangera, Adisai Na-Thalang, Patricia Nicole Monderin, Yueqi Song, Christian Simon, Lynnette Hui Xian Ng, Richardy Lobo Sapan, Taki Hasan Rafi, Bin Wang, Supryadi, Kanyakorn Veerakanjana, Piyalitt Ittichaiwong, Matthew Theodore Roque, Karissa Vincentio, Takdanai Kreangphet, Phakphum Artkaew, Kadek Hendrawan Palgunadi, Yanzhi Yu, Rochana Prih Hastuti, William Nixon, Mithil Bangera, Adrian Xuan Wei Lim, Aye Hninn Khine, Hanif Muhammad Zhafran, Teddy Ferdinan, Audra Aurora Izzani, Ayushman Singh, Evan Evan, Jauza Akbar Krito, Michael Anugraha, Fenal Ashokbhai Ilasariya, Haochen Li, John Amadeo Daniswara, Filbert Aurelian Tjiaranata, Eryawan Presma Yulianrifat, Can Udomcharoenchaikit, Fadil Risdian Ansori, Mahardika Krisna Ihsani, Giang Nguyen, Anab Maulana Barik, Dan John Velasco, Rifo Ahmad Genadi, Saptarshi Saha, Chengwei Wei, Isaiah Edri W. Flores, Kenneth Chen Ko Han, Anjela Gail D. Santos, Wan Shen Lim, Kaung Si Phyo, Tim Santos, Meisyarah Dwiastuti, Jiayun Luo, Jan Christian Blaise Cruz, Ming Shan Hee, Ikhlasul Akmal Hanif, M. Alif Al Hakim, Muhammad Rizky Sya'ban, Kun Kerdthaisong, Lester James Validad Miranda, Fajri Koto, Tirana Noor Fatyanosa, Alham Fikri Aji, Jostin Jerico Rosal, Jun Kevin, Robert Wijaya, Onno P. Kampman, Ruochen Zhang, Börje F. Karlsson, Peerat Limkonchotiwat
Abstract Southeast Asia remains underrepresented in vision-language research despite its linguistic and cultural diversity. SEA-VL addresses this gap through open, high-quality datasets grounded in regional languages and cultures.
DOI 10.18653/v1/2025.acl-long.916
Progressive Cross-Attention Network for Flood Segmentation Using Multispectral Satellite Imagery
ProCANet reached a state-of-the-art IoU score of 0.815 on the Sen1Floods11 flood benchmark.
Details
Authors Vicky Feliren, Fithrothul Khikmah, Irfan Dwiki Bhaswara, Bahrul Ilmi Nasution, Alex M. Lechner, Muhamad Risqi U. Saputra
Abstract We present ProCANet, which applies self-attention and cross-attention in stages to combine multispectral features for flood segmentation.
DOI 10.1109/LGRS.2024.3495974
Enhancing urban resilience through integrated flood policy and planning
A mixed-method study of how retention ponds reduce urban flood risk.
Details
Authors Eka Permanasari, Marco Wijaya, Vicky Feliren, Fithrotul Khikmah, Alex M. Lechner, Altaf Virani, Muhamad Risqi U. Saputra
Abstract This study examines how retention ponds in South Bandung can support long-term urban flood management.
DOI 10.2166/aqua.2025.292
2021
The Effect of Plastic Bag Ban Policy Towards Waste Complaints in Jakarta
Measured the policy’s effect on waste complaints submitted through JAKI and Qlue.
Details
Authors Vicky Feliren, Yudhistira Nugraha, Bahrul Ilmi Nasution, Clarissa Febria Finola, J.I. Kanggrawan, A. L. Suherman
Abstract Jakarta introduced a plastic bag ban on 1 July 2020. This study measures its effect on waste complaints.
DOI 10.1109/ICISS53185.2021.9533236