<?xml version="1.0" encoding="utf-8"?>
<journal>
<title>Iranian Electric Industry Journal of Quality and Productivity</title>
<title_fa>نشریه کیفیت و بهره وری صنعت برق ایران</title_fa>
<short_title>ieijqp</short_title>
<subject>Engineering &amp; Technology</subject>
<web_url>http://ieijqp.ir</web_url>
<journal_hbi_system_id>1</journal_hbi_system_id>
<journal_hbi_system_user>admin</journal_hbi_system_user>
<journal_id_issn>2322-2344</journal_id_issn>
<journal_id_issn_online>2717-1639</journal_id_issn_online>
<journal_id_pii>8</journal_id_pii>
<journal_id_doi>10.61186/ieijqp</journal_id_doi>
<journal_id_iranmedex></journal_id_iranmedex>
<journal_id_magiran></journal_id_magiran>
<journal_id_sid>14</journal_id_sid>
<journal_id_nlai>8888</journal_id_nlai>
<journal_id_science>13</journal_id_science>
<language>fa</language>
<pubdate>
	<type>jalali</type>
	<year>1405</year>
	<month>1</month>
	<day>1</day>
</pubdate>
<pubdate>
	<type>gregorian</type>
	<year>2026</year>
	<month>4</month>
	<day>1</day>
</pubdate>
<volume>15</volume>
<number>1</number>
<publish_type>online</publish_type>
<publish_edition>1</publish_edition>
<article_type>fulltext</article_type>
<articleset>
	<article>


	<language>fa</language>
	<article_id_doi></article_id_doi>
	<title_fa>بهینه‌سازی پویای تخصیص سفارش در زنجیره تأمین چندتأمین‌کننده تحت عدم‌قطعیت هزینه: مقایسه برنامه‌ریزی پویا و یادگیری تقویتی</title_fa>
	<title>Dynamic Order Allocation Optimization in Multi-Supplier Supply Chains under Cost Uncertainty: A Comparative Study of Dynamic Programming and Reinforcement Learning</title>
	<subject_fa>صنایع و مدیریت</subject_fa>
	<subject></subject>
	<content_type_fa>پژوهشي</content_type_fa>
	<content_type>Research</content_type>
	<abstract_fa>&lt;p style=&quot;text-align: justify;&quot;&gt;&lt;span style=&quot;font-size:12px;&quot;&gt;&lt;span style=&quot;font-family:Tahoma;&quot;&gt;مدیریت سفارش&#8204;دهی در زنجیره&#8204;های تأمین چندمنبعی تحت تأثیر نوسانات تصادفی هزینه&#8204;ها، چالش&#8204;های ساختاری جدی را ایجاد می&#8204;کند؛ در این پژوهش، مسئله به&#8204;عنوان یک تصمیم&#8204;گیری راهبردی در شرایط عدم&#8204;قطعیت تعریف شده است؛ به&#8204;گونه&#8204;ای که اگرچه داده&#8204;های تاریخی هزینه&#8204;ها در دسترس است، اما به&#8204;دلیل نوسانات ساختاری و تغییرات پیوسته&#8204;ی بازار، توزیع حاصل از داده&#8204;های گذشته نمی&#8204;تواند نماینده&#8204;ی دقیقی برای آینده باشد و تصمیم&#8204;گیرنده در لحظه&#8204;ی انتخاب، به توزیع پایدار و قطعی هزینه&#8204;های آتی دسترسی ندارد. در رویکرد برنامه&#8204;ریزی پویا، ماتریس&#8204;های احتمال انتقال از داده&#8204;های تاریخی استخراج شده و به&#8204;عنوان معیار مرجع بهینه (مدل&#8204;محور) عمل می&#8204;کنند. در مقابل، رویکرد یادگیری تقویتی مبتنی بر Q بدون نیاز به برآورد صریح توزیع احتمالی و صرفاً از طریق تعامل با محیط شبیه&#8204;سازی&#8204;شده (بر پایه&#8204;ی داده&#8204;های واقعی)، سیاست تصمیم&#8204;گیری را می&#8204;آموزد. اعتبارسنجی مدل در صنعت پلیمر و با استفاده از داده&#8204;های واقعی در ۴۷ افق زمانی نشان می&#8204;دهد که چارچوب پیشنهادی، حتی در شرایط پایه با هزینه&#8204;های نزدیک تأمین&#8204;کنندگان، به&#8204;طور میانگین ۰٫۲۳٪ صرفه&#8204;جویی معنادار (۰٫۰۰۱&gt;p-value) ایجاد می&#8204;کند که معادل کاهش بیش از ۷۳ هزار واحد پولی در هر افق است. افزون بر این، تحلیل&#8204;های حساسیت نشان می&#8204;دهد که با افزایش اختلاف هزینه&#8204;ای میان تأمین&#8204;کنندگان، پتانسیل صرفه&#8204;جویی به&#8204;طور چشمگیری تا ۴۰٪ افزایش می&#8204;یابد. اگرچه برنامه&#8204;ریزی پویا بهینه&#8204;ترین عملکرد نظری را ارائه می&#8204;دهد، اما روش یادگیری Q باوجود عدم نیاز به مدل&#8204;سازی توزیع آینده، تطبیق&#8204;پذیری سریع و پایداری بالایی در برابر شوک&#8204;های بازار از خود نشان می&#8204;دهد. این پژوهش با پر کردن شکاف میان بهینه&#8204;سازی تئوریک و روش&#8204;های داده&#8204;محور، مبنایی عملی و مقاوم برای پیاده&#8204;سازی سیستم&#8204;های پشتیبانی تصمیم در زنجیره&#8204;های تأمین با اطلاعات ناقص و هزینه&#8204;های تصادفی ناپایدار فراهم می&#8204;آورد.&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;</abstract_fa>
	<abstract>&lt;div style=&quot;text-align: justify;&quot;&gt;&lt;span style=&quot;font-family:Tahoma;&quot;&gt;&lt;span style=&quot;font-size:12px;&quot;&gt;&lt;span style=&quot;line-height:normal&quot;&gt;&lt;span newroman=&quot;&quot; time=&quot;&quot;&gt;&lt;span style=&quot;letter-spacing:-.2pt&quot;&gt;Order management in multi-source supply chains under stochastic cost fluctuations poses significant structural challenges. This study defines the problem as a strategic decision-making process under uncertainty, wherein historical cost data are available, yet due to structural market volatility and continuous price variations, the distribution derived from past data cannot accurately represent the future, and the decision-maker lacks access to a stable and deterministic distribution of future costs at the time of choice. In the dynamic programming approach, transition probability matrices are extracted from historical data and serve as an optimal model-based benchmark. In contrast, the Q-learning reinforcement learning approach learns the decision policy without explicit probabilistic distribution estimation, solely through interaction with a simulated environment built upon real data. Model validation in the polymer industry using real data across 47 planning horizons demonstrates that the proposed framework achieves an average cost saving of 0.23% (p-value &lt; 0.001) even under baseline conditions with close supplier costs, equivalent to a reduction of over 73,000 monetary units per horizon. Furthermore, sensitivity analyses reveal that as the cost gap between suppliers widens, the saving potential increases substantially, reaching up to 40%. Although dynamic programming provides the optimal theoretical performance, the Q-learning method exhibits rapid adaptability and high stability against market shocks without requiring future distribution modeling. By bridging the gap between theoretical optimization and data-driven methods, this research provides a practical and robust foundation for implementing decision support systems in supply chains with incomplete information and unstable stochastic costs.&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/div&gt;</abstract>
	<keyword_fa>زنجیره تأمین, برنامه‌ریزی پویا, یادگیری تقویتی, Q-learning, تصمیم‌گیری مارکوف, مدیریت سفارش‌دهی</keyword_fa>
	<keyword>Supply Chain, Dynamic Programming, Reinforcement Learning, Q-Learning, Markov Decision Process, Ordering Management</keyword>
	<start_page>73</start_page>
	<end_page>89</end_page>
	<web_url>http://ieijqp.ir/browse.php?a_code=A-10-1670-1&amp;slc_lang=fa&amp;sid=1</web_url>


<author_list>
	<author>
	<first_name>Leila</first_name>
	<middle_name></middle_name>
	<last_name>Hosseini</last_name>
	<suffix></suffix>
	<first_name_fa>لیلا</first_name_fa>
	<middle_name_fa></middle_name_fa>
	<last_name_fa>حسینی</last_name_fa>
	<suffix_fa></suffix_fa>
	<email>lysahoseini@stu.yazd.ac.ir</email>
	<code>1159522502</code>
	<orcid>10031947532846007776</orcid>
	<coreauthor>No</coreauthor>
	<affiliation>Department of Industrial Engineering, Faculty of Engineering, Yazd University, Yazd, Iran</affiliation>
	<affiliation_fa>گروه مهندسی صنایع، دانشکده مهندسی، دانشگاه یزد، یزد، ایران</affiliation_fa>
	 </author>


	<author>
	<first_name>mohammad saber</first_name>
	<middle_name></middle_name>
	<last_name>Fallah nezahd</last_name>
	<suffix></suffix>
	<first_name_fa>محمد صابر</first_name_fa>
	<middle_name_fa></middle_name_fa>
	<last_name_fa>فلاح نژاد</last_name_fa>
	<suffix_fa></suffix_fa>
	<email>Fallahnezhad@yazd.ac.ir</email>
	<code>1159522502</code>
	<orcid>10031947532846007777</orcid>
	<coreauthor>Yes
</coreauthor>
	<affiliation>Department of Industrial Engineering, Faculty of Engineering, Yazd University, Yazd, Iran</affiliation>
	<affiliation_fa>گروه مهندسی صنایع، دانشکده مهندسی، دانشگاه یزد، یزد، ایران</affiliation_fa>
	 </author>


	<author>
	<first_name>Vali</first_name>
	<middle_name></middle_name>
	<last_name>Derhami</last_name>
	<suffix></suffix>
	<first_name_fa>ولی</first_name_fa>
	<middle_name_fa></middle_name_fa>
	<last_name_fa>درهمی</last_name_fa>
	<suffix_fa></suffix_fa>
	<email>vderhami@yazd.ac.ir</email>
	<code>1159522502</code>
	<orcid>10031947532846007778</orcid>
	<coreauthor>No</coreauthor>
	<affiliation>Department of Computer Engineering, Faculty of Engineering, Yazd University, Yazd, Iran</affiliation>
	<affiliation_fa>گروه مهندسی کامپیوتر، دانشکده مهندسی، دانشگاه یزد، یزد، ایران</affiliation_fa>
	 </author>


	<author>
	<first_name></first_name>
	<middle_name></middle_name>
	<last_name></last_name>
	<suffix></suffix>
	<first_name_fa>محمد صالح</first_name_fa>
	<middle_name_fa></middle_name_fa>
	<last_name_fa>اولیا</last_name_fa>
	<suffix_fa></suffix_fa>
	<email>owliams@yazd.ac.ir</email>
	<code>1159522502</code>
	<orcid>10031947532846007779</orcid>
	<coreauthor>No</coreauthor>
	<affiliation>Department of Industrial Engineering, Faculty of Engineering, Yazd University, Yazd, Iran</affiliation>
	<affiliation_fa>گروه مهندسی صنایع، دانشکده مهندسی، دانشگاه یزد، یزد، ایران</affiliation_fa>
	 </author>


</author_list>


	</article>
</articleset>
</journal>
