<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GPU Inference | Mobina Kashaniyan</title><link>https://mobinakashaniyan.github.io/tag/gpu-inference/</link><atom:link href="https://mobinakashaniyan.github.io/tag/gpu-inference/index.xml" rel="self" type="application/rss+xml"/><description>GPU Inference</description><generator>Wowchemy (https://wowchemy.com)</generator><language>en-us</language><lastBuildDate>Sun, 01 Nov 2026 00:00:00 +0000</lastBuildDate><image><url>https://mobinakashaniyan.github.io/media/logo_hu_49df124fc4898e21.png</url><title>GPU Inference</title><link>https://mobinakashaniyan.github.io/tag/gpu-inference/</link></image><item><title>Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling</title><link>https://mobinakashaniyan.github.io/publication/sample-count-is-not-enough-candidate-generation-strategy-shapes-the-energy-and-performance-of-llm-test-time-scaling/</link><pubDate>Sun, 01 Nov 2026 00:00:00 +0000</pubDate><guid>https://mobinakashaniyan.github.io/publication/sample-count-is-not-enough-candidate-generation-strategy-shapes-the-energy-and-performance-of-llm-test-time-scaling/</guid><description>&lt;p&gt;&lt;strong&gt;New preprint:&lt;/strong&gt; &lt;a href="https://arxiv.org/abs/2609.19499" target="_blank" rel="noopener"&gt;arXiv:2609.19499&lt;/a&gt; — &lt;em&gt;Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling&lt;/em&gt; by &lt;strong&gt;Mobina Kashaniyan&lt;/strong&gt; and &lt;strong&gt;Ali Jannesari&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;This paper studies &lt;strong&gt;LLM test-time scaling&lt;/strong&gt; from a &lt;strong&gt;systems and energy&lt;/strong&gt; perspective. It shows that the &lt;strong&gt;candidate count N is not enough&lt;/strong&gt; to describe the cost of multi-candidate inference.&lt;/p&gt;
&lt;p&gt;In sampling-based test-time scaling, the same budget of &lt;strong&gt;N candidates&lt;/strong&gt; can be generated as one large batch or as many small sequential calls. Those schedules have the same candidate count, but they can differ dramatically in &lt;strong&gt;latency, throughput, GPU-hours, utilization, and GPU-device energy&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;We evaluate &lt;strong&gt;Phi-3-mini&lt;/strong&gt; and &lt;strong&gt;Qwen2.5-1.5B&lt;/strong&gt; on &lt;strong&gt;GSM8K&lt;/strong&gt;, then fix &lt;strong&gt;N=8&lt;/strong&gt; and compare generation schedules &lt;strong&gt;1×8, 2×4, 4×2, and 8×1&lt;/strong&gt;. On &lt;strong&gt;A100 GPUs&lt;/strong&gt;, eight serial calls use about &lt;strong&gt;4.64–4.86×&lt;/strong&gt; the energy and &lt;strong&gt;5.77–6.12×&lt;/strong&gt; the P95 latency of one batched eight-candidate call. Similar trends appear on SciQ with V100 GPUs.&lt;/p&gt;
&lt;p&gt;This work was accepted to the &lt;strong&gt;3rd IEEE/ACM SC26 Workshop on Energy Efficiency with Sustainable Performance (EESP)&lt;/strong&gt;, co-located with &lt;strong&gt;SC26&lt;/strong&gt; in Chicago, USA, and is freely available on arXiv as &lt;strong&gt;&lt;a href="https://arxiv.org/abs/2609.19499" target="_blank" rel="noopener"&gt;2609.19499&lt;/a&gt;&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;It is relevant to researchers working on &lt;strong&gt;test-time scaling, test-time compute, candidate generation, batched LLM inference, GPU energy measurement, sustainable AI, green AI, high-performance computing, distributed/parallel computing, and efficient large language model systems&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Keywords:&lt;/strong&gt; arXiv:2609.19499, LLM test-time scaling, test-time compute, candidate-generation strategy, generation schedule, batched inference, multi-candidate sampling, self-consistency, best-of-N, GPU energy, energy-efficient AI, sustainable AI, SC26, EESP, high-performance computing, A100, GSM8K, SciQ, cs.LG, cs.DC, cs.PF.&lt;/p&gt;
&lt;h2 id="links"&gt;Links&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="https://arxiv.org/abs/2609.19499" target="_blank" rel="noopener"&gt;arXiv Abstract&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://arxiv.org/pdf/2609.19499" target="_blank" rel="noopener"&gt;arXiv PDF&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://doi.org/10.48550/arXiv.2609.19499" target="_blank" rel="noopener"&gt;DOI&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://arxiv.org/html/2609.19499" target="_blank" rel="noopener"&gt;HTML (experimental)&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://mobinakashaniyan.github.io/papers/sample-count-is-not-enough-candidate-generation-llm-test-time-scaling.pdf" target="_blank" rel="noopener"&gt;Local mirror PDF&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://mobinakashaniyan.github.io/post/sample-count-is-not-enough-candidate-generation-llm-test-time-scaling/" target="_blank" rel="noopener"&gt;Research Summary&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="venue"&gt;Venue&lt;/h2&gt;
&lt;p&gt;Mobina Kashaniyan, Ali Jannesari. &lt;em&gt;Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling.&lt;/em&gt; In Proc. of the 3rd IEEE/ACM SC26 Workshop on Energy Efficiency with Sustainable Performance (EESP), co-located with SC26, Chicago, USA, pages 1–8, November 2026. arXiv:2609.19499.&lt;/p&gt;
&lt;h2 id="how-to-cite"&gt;How to Cite&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bibtex" data-lang="bibtex"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@inproceedings&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;kashaniyan2026sample&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of {LLM} Test-Time Scaling}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Kashaniyan, Mobina and Jannesari, Ali}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;booktitle&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Proceedings of the 3rd IEEE/ACM SC26 Workshop on Energy Efficiency with Sustainable Performance (EESP)}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;pages&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{1--8}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2026}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;note&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{arXiv:2609.19499}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;doi&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{10.48550/arXiv.2609.19499}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;url&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{https://arxiv.org/abs/2609.19499}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Kashaniyan, M., &amp;amp; Jannesari, A. (2026). Sample count is not enough: Candidate-generation strategy shapes the energy and performance of LLM test-time scaling. In &lt;em&gt;Proceedings of the 3rd IEEE/ACM SC26 Workshop on Energy Efficiency with Sustainable Performance (EESP)&lt;/em&gt; (pp. 1–8). IEEE/ACM. &lt;a href="https://doi.org/10.48550/arXiv.2609.19499" target="_blank" rel="noopener"&gt;https://doi.org/10.48550/arXiv.2609.19499&lt;/a&gt;&lt;/p&gt;</description></item></channel></rss>