<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Jupyter Notebook on AI</title>
        <link>https://ai.programnotes.cn/tags/jupyter-notebook/</link>
        <description>Recent content in Jupyter Notebook on AI</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-CN</language>
        <lastBuildDate>Thu, 06 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ai.programnotes.cn/tags/jupyter-notebook/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>GitHub Trending 榜首：airllm</title>
        <link>https://ai.programnotes.cn/p/github-trending-%E6%A6%9C%E9%A6%96airllm/</link>
        <pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate>
        
        <guid>https://ai.programnotes.cn/p/github-trending-%E6%A6%9C%E9%A6%96airllm/</guid>
        <description>&lt;h2 id=&#34;项目简介&#34;&gt;项目简介
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;airllm&lt;/strong&gt; 是由 lyogavin 开源的一个大语言模型推理优化库，目标是让超大参数模型在消费级 GPU 上也能跑起来。它的核心卖点非常直观：单张 4GB 显存即可运行 70B 模型，405B 的 Llama 3.1 只需要 8GB，而 671B 的 DeepSeek-V3 也只需约 12GB 显存。最近该项目还因为支持了 2.8T 参数的 Kimi K3，在 3.72GB 显存下完成端到端推理，再次引爆了社区关注。&lt;/p&gt;
&lt;h2 id=&#34;技术亮点&#34;&gt;技术亮点
&lt;/h2&gt;&lt;p&gt;AirLLM 的关键思路是&lt;strong&gt;分层流式加载&lt;/strong&gt;：推理时只在 GPU 上保留当前计算所需的一层，计算完就卸载，下一层再从磁盘或缓存中加载。配合 safetensors、压缩与量化（4bit/8bit block-wise），它在不显著损失精度的前提下，把显存占用降到了极限。项目提供统一的 &lt;code&gt;AutoModel.from_pretrained(...)&lt;/code&gt; 接口，几乎支持所有主流开源模型：Llama、Qwen、DeepSeek、Mistral/Mixtral、Phi、Gemma、ChatGLM、Baichuan、InternLM 等。&lt;/p&gt;
&lt;h2 id=&#34;快速上手&#34;&gt;快速上手
&lt;/h2&gt;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;pip install airllm
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;kn&#34;&gt;from&lt;/span&gt; &lt;span class=&#34;nn&#34;&gt;airllm&lt;/span&gt; &lt;span class=&#34;kn&#34;&gt;import&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;AutoModel&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;n&#34;&gt;model&lt;/span&gt; &lt;span class=&#34;o&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;AutoModel&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;from_pretrained&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;s2&#34;&gt;&amp;#34;Qwen/Qwen3-32B&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# 甚至可以尝试更大的模型：&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# model = AutoModel.from_pretrained(&amp;#34;deepseek-ai/DeepSeek-V3&amp;#34;)  # 671B, ~12GB&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id=&#34;为什么值得看&#34;&gt;为什么值得看
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;显存需求与模型总参数量解耦，只取决于单层大小。&lt;/li&gt;
&lt;li&gt;无需自己量化、蒸馏或剪枝，一行代码即可运行超大模型。&lt;/li&gt;
&lt;li&gt;支持 CPU 推理、MacOS Apple Silicon、FP8 与 MoE 逐 expert 加载。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;数据快照&#34;&gt;数据快照
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;仓库：&lt;a class=&#34;link&#34; href=&#34;https://github.com/lyogavin/airllm&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;@lyogavin/airllm&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;语言：Jupyter Notebook&lt;/li&gt;
&lt;li&gt;协议：Apache-2.0&lt;/li&gt;
&lt;li&gt;今日新增 Star：833&lt;/li&gt;
&lt;li&gt;总 Star：29,334&lt;/li&gt;
&lt;li&gt;Fork：3,141&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        
    </channel>
</rss>
