Optimizing K-Means Clustering through Distance Metric Simulation for Strategic Enrollment Segmentation in Private Universities
Abstract
K-Means clustering is a widely used unsupervised learning technique for identifying patterns and grouping data based on feature similarities. However, the effectiveness of K-Means significantly depends on the choice of distance metric. This study conducts a comprehensive simulation to evaluate and compare the performance of four distance metrics—Euclidean, Cityblock (Manhattan), Canberra, and Mahalanobis—in the context of strategic market segmentation for private universities. The dataset includes simulated and institutional data incorporating variables such as account creation, registration, graduation, student performance (social, science, and scholastic scores), income, and geographic distance. The results indicate that Euclidean and Cityblock distances yield efficient and interpretable clusters with low computational costs, whereas Mahalanobis distance, despite its capacity to model covariance, introduces computational overhead without proportional improvement in segmentation quality. Interestingly, Canberra distance produces compact clusters but offers no significant gain in separability. From the resulting segmentation, two clusters emerge as high-potential targets for marketing strategies: Cluster 0 (high-income and distant students) and Cluster 1 (diverse academic and socioeconomic profiles). The findings highlight the importance of aligning distance metric selection with specific clustering objectives and offer practical insights for data-driven strategic enrollment planning in private higher education institutions.
Keywords
Full Text:
PDFReferences
[1] Azad Abdulhafedh. “Incorporating K-means, Hierarchical Clustering and PCA in Customer Segmentation”. Journal of Computer and Data Sciences 3.1 (Feb. 2021), pp. 12–30. DOI: https://doi.org/10.12691/jcd-3-1-3.
[2] Abiodun M. Ikotun, Absalom E. Ezugwu, Laith Abualigah, Belal Abuhaija, and Jia Heming. “K-means clustering algorithms: A comprehensive review, variants analysis, and advances in the era of big data”. Information Sciences 622 (Apr. 1, 2023), pp. 178–210. DOI: https://doi.org/10.1016/j.ins.2022.11.139. URL: https://www.sciencedirect.com/science/article/pii/S0020025522014633.
[3] Satria Abadi, Kamarul Shukri Mat The, Badlihisham Mohd Nasir, Miftachul Huda, Natalie L. Ivanova, Thia Indra Sari, Andino Maseleno, Fiqih Satria, and Muhamad Muslihudin. “Application model of k-means clustering: insights into promotion strategy of vocational high school”. International Journal of Engineering & Technology 7.2 (Aug. 22, 2018), pp. 182–187. DOI: https://doi.org/10.14419/ijet.v7i2.11491. URL: https://www.sciencepubco.com/index.php/ijet/article/view/11491.
[4] Md. Zubair, MD. Asif Iqbal, Avijeet Shil, M. J. M. Chowdhury, Mohammad Ali Moni, and Iqbal H. Sarker. “An Improved K-means Clustering Algorithm Towards an Efficient Data-Driven Modeling”. Annals of Data Science (June 25, 2022). DOI: https://doi.org/10.1007/s40745-022-00428-2.
[5] M. Faisal, E. M. Zamzami, and Sutarman. “Comparative Analysis of Inter-Centroid K-Means Performance using Euclidean Distance, Canberra Distance and Manhattan Distance”. Journal of Physics: Conference Series 1566.1 (June 2020), p. 012112. DOI: https://doi.org/10.1088/1742-6596/1566/1/012112.
[6] Suraya Suraya, Muhammad Sholeh, and Dina Andayati. “Comparison of distance metric in k-mean algorithm for clustering wheat grain datasheet”. Jurnal Teknik Informatika C.I.T Medicom 15.2 (May 31, 2023), pp. 73–83. DOI: https://doi.org/10.35335/cit.Vol15.2023.408.pp73-83. URL: https://medikom.iocspublisher.org/index.php/JTI/article/view/408.
[7] Deny Jollyta, Prihandoko Prihandoko, Dadang Priyanto, Alyauma Hajjah, and Yulvia Nora Marlim. “Comparison of Distance Measurements Based on k-Numbers and Its Influence to Clustering”. MATRIK: Jurnal Manajemen, Teknik Informatika dan Rekayasa Komputer 23.1 (Nov. 2023), pp. 93–102. DOI: https://doi.org/10.30812/matrik.v23i1.3078. URL: https://journal.universitasbumigora.ac.id/matrik/article/view/3078.
[8] Akhmatshin Farid, Egarmin Pavel, Gerasimova Marina, Petrova Irina, and Mikitchak Sergey. “Clustering of k-means based on Euclidean distance metric and Mahalanobis metric”. E3S Web of Conferences (2024). DOI: https://doi.org/10.1051/e3sconf/202453103002. URL: https://www.e3s-conferences.org/articles/e3sconf/pdf/2024/61/e3sconf_uesf2024_03002.pdf.
[9] Hamid Ghorbani. “Mahalanobis Distance and its Application for Detecting Multivariate Outliers”. Facta Universitatis, Series: Mathematics and Informatics 34.3 (2019), pp. 583–595. DOI: https://doi.org/10.22190/FUMI1903583G. URL: https://casopisi.junis.ni.ac.rs/index.php/FUMathInf/article/view/5028/pdf.
[10] Mostafa Raeisi and Abu B. Sesay. “A Distance Metric for Uneven Clusters of Unsupervised K-Means Clustering Algorithm”. IEEE Access 10 (2022), pp. 86286–86297. DOI: https://doi.org/10.1109/ACCESS.2022.3198992. URL: https://ieeexplore.ieee.org/document/9857918.
[11] Sunardi, Ahmad Fadlil, and Nanik Tristanti. “Comparative Analysis of Euclidean, Manhattan, Canberra, and Squared Chord Methods in Face Recognition”. Revue d’Intelligence Artificielle 37.3 (2023), pp. 593–599. DOI: https://doi.org/10.18280/ria.370308.
[12] Marhayati Marhayati, Arini Mayan Fa’ani, Sulistya Umie Ruhmanasari, and Siti Faridah. “Application of K-Means Cluster Analysis for Grouping State Islamic University in Indonesia based on the Readiness Indicators for World Class University (WCU)”. CAUCHY: Jurnal Matematika Murni dan Aplikasi 8.2 (2023), pp. 30–48. DOI: https://doi.org/10.18860/ca.v8i2.18046. URL: https://ejournal.uin-malang.ac.id/index.php/Math/article/view/18046.
[13] T. Soni Madhulatha. An Overview on Clustering Methods. arXiv:1205.1117. 2012. DOI: https://doi.org/10.48550/arXiv.1205.1117. URL: https://arxiv.org/abs/1205.1117.
[14] S. A. Afghani and W. Y. M. Putra. “Clustering with Euclidean Distance, Manhattan-Distance, Mahalanobis-Euclidean Distance, and Chebyshev Distance with Their Accuracy”. Indonesian Journal of Statistics and Its Applications 5.2 (2021), pp. 369–376. DOI: https://doi.org/10.29244/ijsa.v5i2p369-376.
[15] A. F. Pulungan, M. Zarlis, and S. Suwilo. “Analysis of Braycurtis, Canberra and Euclidean Distance in KNN Algorithm”. Sinkron: Jurnal dan Penelitian Teknik Informatika 4.1 (2019), pp. 74–77. DOI: https://doi.org/10.33395/sinkron.v4i1.10207.
[16] Brian H. Russell and Laurence R. Lines. “Mahalanobis clustering, with applications to AVO classification and seismic reservoir parameter estimation”. CREWES Research Report 15 (2003). URL: https://www.crewes.org/Documents/ResearchReports/2003/2003-52.pdf.
[17] Rosmayati Mohemad, Nazratul Naziah Mohd Muhait, Noor Maizura Mohamad Noor, and Zulaiha Ali Othman. “Performance analysis in text clustering using k-means and k-medoids algorithms for Malay crime documents”. International Journal of Electrical and Computer Engineering (IJECE) 12.5 (Oct. 1, 2022), pp. 5014–5026. DOI: https://doi.org/10.11591/ijece.v12i5.pp5014-5026. URL: https://ijece.iaescore.com/index.php/IJECE/article/view/27817.
[18] Suraya Suraya, Muhammad Sholeh, and Uning Lestari. “Evaluation of Data Clustering Accuracy using K-Means Algorithm”. International Journal of Multidisciplinary Approach Research and Science 2.1 (2024), pp. 385–396. DOI: https://doi.org/10.59653/ijmars.v2i01.504. URL: https://risetpress.com/index.php/ijmars/article/view/504.
[19] A. O. Oluwatobi, V. A. Alli-Johnson, C. A. Ayedun, and O. A. Akinjare. “Assessment of the effectiveness of maintenance management systems in delivering quality maintenance services in higher institutions”. Journal of Physics: Conference Series 1299.1 (2019), p. 012015. DOI: https://doi.org/10.1088/1742-6596/1299/1/012015.
[20] Musarrafah Paramadina, Sudarmin Sudarmin, and Muhammad Kasim Aidid. “Perbandingan Analisis Cluster Metode Average Linkage dan Metode Ward (Kasus: IPM Provinsi Sulawesi Selatan)”. VARIANSI: Journal of Statistics and Its Application on Teaching and Research 1.2 (2019), pp. 22–31. DOI: https://doi.org/10.35580/variansiunm9357. URL: https://ojs.unm.ac.id/jvariansi/article/view/9357/5411.
[21] Hanik Malikhatin, Agus Rusgiyono, and Di Asih I Maruddani. “Clustering of Prospective TKI Workers Using k-Modes Algorithm and Dunn Index for Categorical Data”. Jurnal Gaussian 10.3 (2021), pp. 359–366. DOI: https://doi.org/10.14710/j.gauss.10.3.359-366. URL: https://ejournal3.undip.ac.id/index.php/gaussian/article/view/32790.
[22] Chalawatul Ais, Abdulloh Hamid, and Dian Candra Rini Novitasari. “Analysis of Livestock Meat Production in Indonesia Using Fuzzy C-Means Clustering”. Jurnal Ilmu Komputer dan Informasi 15.1 (2022), pp. 1–8. DOI: https://doi.org/10.21609/jiki.v15i1.993.
DOI: https://doi.org/10.18860/cauchy.v10i2.33089
Refbacks
- There are currently no refbacks.
Copyright (c) 2025 Regita Putri Permata, Amalia Nur Alifah

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.
Editorial Office
Mathematics Department,
Maulana Malik Ibrahim State Islamic University of Malang
Gajayana Street 50 Malang, East Java, Indonesia 65144
e-mail: cauchy@uin-malang.ac.id

CAUCHY: Jurnal Matematika Murni dan Aplikasi is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.








