<?xml version="1.0" encoding="UTF-8"?>
<article article-type="Research Article">
  <front>
    <journal-meta>
      <journal-id journal-id-type="publisher">journal-of-statistics-and-management-systems</journal-id>
      <journal-title-group>
        <journal-title> Journal of Statistics and Management Systems</journal-title>
      </journal-title-group>
      <issn publication-format="electronic">2169-0014</issn>
      <issn publication-format="print">0972-0510</issn>
      <publisher>
        <publisher-name>Taru Publications</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.47974/JSMS-1607</article-id>
      <title-group>
        <article-title>Comparison of machine learning classification algorithms under different data distributions</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author" corresp="yes">
          <name>
            <surname>Murat</surname>
            <given-names>Ceyda</given-names>
          </name>
          <aff>Department of Statistics, Gazi University, Ankara, 06500, Turkey</aff>
        </contrib>
        <contrib contrib-type="author">
          <name>
            <surname>Gökpınar</surname>
            <given-names>Esra</given-names>
          </name>
          <aff>Department of Statistics, Gazi University, Ankara, 06500, Turkey</aff>
        </contrib>
      </contrib-group>
      <volume>29</volume>
      <issue>5</issue>
      <fpage>553</fpage>
      <lpage>572</lpage>
      <pub-date date-type="pub">
        <day>20</day>
        <month>03</month>
        <year>2026</year>
      </pub-date>
      <abstract>
        <p>In this study, we compare the performance of various machine learning algorithms through simulations conducted on datasets with different distributional characteristics. Widely used models such as Logistic Regression, Naive Bayes, k-Nearest Neighbors, Decision Trees, Support Vector Machines, Random Forest, AdaBoost, Gradient Boosting, and XGBoost are examined. The results indicate that the performance of classification algorithms is strongly influenced by the underlying data distribution and class balance. Specifically, Logistic Regression, Naive Bayes, and Support Vector Machines achieved high accuracy on normally distributed datasets, whereas tree-based methods such as Random Forest, Gradient Boosting, and XGBoost demonstrated greater robustness and superior outcomes on non-normal distributions and imbalanced class structures.</p>
      </abstract>
      <kwd-group>
        <kwd>Machine learning</kwd>
        <kwd>Classification algorithms</kwd>
        <kwd>Simulation study</kwd>
        <kwd>Data distribution</kwd>
      </kwd-group>
      <custom-meta-group>
        <custom-meta>
          <meta-name>access</meta-name>
          <meta-value>open</meta-value>
        </custom-meta>
        <custom-meta>
          <meta-name>retracted</meta-name>
          <meta-value>no</meta-value>
        </custom-meta>
      </custom-meta-group>
    </article-meta>
  </front>
</article>
