<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Efficient AI | Ravid Shwartz-Ziv</title><link>https://www.ravid-shwartz-ziv.com/tag/efficient-ai/</link><atom:link href="https://www.ravid-shwartz-ziv.com/tag/efficient-ai/index.xml" rel="self" type="application/rss+xml"/><description>Efficient AI</description><generator>Source Themes Academic (https://sourcethemes.com/academic/)</generator><language>en-us</language><lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://www.ravid-shwartz-ziv.com/img/ravid-shwartz-ziv-social-v2.png</url><title>Efficient AI</title><link>https://www.ravid-shwartz-ziv.com/tag/efficient-ai/</link></image><item><title>Model Compression and Efficient AI</title><link>https://www.ravid-shwartz-ziv.com/research/model-compression-efficient-ai/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.ravid-shwartz-ziv.com/research/model-compression-efficient-ai/</guid><description>&lt;p>Efficient AI is not one technique. A system can reduce the precision of its weights, reuse or remove redundant layers, change the structure of a linear transformation, or select a better internal representation for a downstream task. Each choice saves a different resource and risks losing a different capability.&lt;/p>
&lt;p>My work connects three levels of compression:&lt;/p>
&lt;h2 id="models-and-weights">Models and weights&lt;/h2>
&lt;p>&lt;strong>
&lt;a href="https://www.ravid-shwartz-ziv.com/publication/task-aware-quantization/">You Had One Job&lt;/a>&lt;/strong> treats mixed-precision quantization as a task-conditioned allocation problem. It uses hidden representations and output sensitivity to identify which transformer layers deserve more precision under a fixed bit budget.&lt;/p>
&lt;p>&lt;strong>
&lt;a href="https://www.ravid-shwartz-ziv.com/publication/inuit/">When Attention Collapses / Inheritune&lt;/a>&lt;/strong> studies redundant transformer layers and how useful layers can be reused to construct smaller language models. &lt;strong>
&lt;a href="https://www.ravid-shwartz-ziv.com/publication/ndlinear/">NdLinear&lt;/a>&lt;/strong> replaces a flattened linear map with transformations along the dimensions of a tensor, reducing parameters when the structure of the task supports that factorization.&lt;/p>
&lt;h2 id="representations">Representations&lt;/h2>
&lt;p>&lt;strong>
&lt;a href="https://www.ravid-shwartz-ziv.com/publication/layer-by-layer/">Layer by Layer&lt;/a>&lt;/strong> shows that intermediate representations can outperform final-layer embeddings. &lt;strong>
&lt;a href="https://www.ravid-shwartz-ziv.com/publication/attention-sinks-compression-valleys/">Attention Sinks and Compression Valleys&lt;/a>&lt;/strong> connects large residual-stream activations, attention sinks, and representational compression across model depth.&lt;/p>
&lt;p>Representational compression is not automatically a smaller model. It explains which information is retained and where a model&amp;rsquo;s computation becomes concentrated. That understanding can guide practical choices about layers, embeddings, and downstream systems.&lt;/p>
&lt;h2 id="inference">Inference&lt;/h2>
&lt;p>Efficient inference also depends on how a model generates. &lt;strong>
&lt;a href="https://www.ravid-shwartz-ziv.com/publication/minp/">Min-p&lt;/a>&lt;/strong> adapts a sampling cutoff to the model&amp;rsquo;s confidence. My essay &lt;strong>
&lt;a href="https://www.the-information-bottleneck.com/p/speculative-decoding-from-zero-to" target="_blank" rel="noopener">Speculative decoding, from zero to DSpark&lt;/a>&lt;/strong> explains how drafting, verification, and scheduling turn otherwise idle computation into higher serving throughput.&lt;/p>
&lt;p>
&lt;a href="https://www.ravid-shwartz-ziv.com/#work">Explore selected systems&lt;/a> or
&lt;a href="https://www.ravid-shwartz-ziv.com/publication/">see all publications&lt;/a>.&lt;/p></description></item><item><title>Don't Repeat Yourself: Stopping Verbatim Loops at Sampling Time</title><link>https://www.ravid-shwartz-ziv.com/publication/dry-sampling/</link><pubDate>Mon, 24 Aug 2026 03:33:39 +0000</pubDate><guid>https://www.ravid-shwartz-ziv.com/publication/dry-sampling/</guid><description/></item><item><title>XTC: Head-Aware Sampling by Excluding Top Choices</title><link>https://www.ravid-shwartz-ziv.com/publication/xtc-sampling/</link><pubDate>Mon, 24 Aug 2026 03:27:30 +0000</pubDate><guid>https://www.ravid-shwartz-ziv.com/publication/xtc-sampling/</guid><description/></item><item><title>UAT-LITE: Inference-Time Uncertainty-Aware Attention for Pretrained Transformers</title><link>https://www.ravid-shwartz-ziv.com/publication/uat-lite/</link><pubDate>Tue, 03 Feb 2026 00:51:26 +0000</pubDate><guid>https://www.ravid-shwartz-ziv.com/publication/uat-lite/</guid><description/></item><item><title>You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations</title><link>https://www.ravid-shwartz-ziv.com/publication/task-aware-quantization/</link><pubDate>Sun, 09 Nov 2025 19:58:24 +0000</pubDate><guid>https://www.ravid-shwartz-ziv.com/publication/task-aware-quantization/</guid><description>&lt;p>The workshop version is identified in the
&lt;a href="https://arxiv.org/abs/2511.06516" target="_blank" rel="noopener">arXiv record&lt;/a>. The original preprint was released in November 2025; the latest revision was submitted in June 2026.&lt;/p></description></item><item><title>NdLinear: Preserving Multi-Dimensional Structure for Parameter-Efficient Neural Networks</title><link>https://www.ravid-shwartz-ziv.com/publication/ndlinear/</link><pubDate>Fri, 21 Mar 2025 17:52:44 +0000</pubDate><guid>https://www.ravid-shwartz-ziv.com/publication/ndlinear/</guid><description/></item></channel></rss>