跳转到主内容
Compact microcontroller board generating a sequence of abstract face-like images on a laboratory display

4 MB 扩散模型在 RP2350 微控制器上实现图像生成

一个创客项目将潜在扩散 Transformer 及解码器压缩进 RP2350,展示经过精细优化的边缘 AI 能缩小到何种程度。

发布时间

06 9月 2026

阅读时间

3 分钟阅读

分享这篇文章:

目录

项目实现了什么

Hackaday 于 2026 年 9 月 5 日报道,开发者 Tim 已让生成式图像模型在 RP2350 微控制器上运行。项目文档称,完整模型和推理代码占用不到 4 MB 闪存,并在 Raspberry Pi Pico 2 等开发板使用的双核 Cortex-M33 上,以 520 KB RAM 执行。

成果的范围经过刻意限制。它生成 128×128 RGB 人脸图像,支持五种条件类别,每张图像根据模型和设置大约需要 10 至 20 秒。结果可以通过 USB 输出,也可以借助 VGA 适配板显示。这些限制很关键:它是一项紧凑的研究与工程演示,并不能替代通用云端图像服务。

扩散模型如何装进微控制器

系统并不直接在像素空间生成最终图像。变分自编码器先将图像压缩为 16×16×8 的潜在表示。一个小型扩散 Transformer 随后通过八个步骤,把该表示从噪声逐渐推向选定类别,最后由解码器重建 128×128 输出。设备端只需要解码器。

两个模型版本约有 170 万和 290 万参数。权重被量化为 8 位整数,条件值及其他固定数据则存入查找表。实现利用 DMA 从闪存流式读取权重,并行处理潜在 token,同时使用两个 Cortex-M33 核心。开发者还报告称,利用激活稀疏性使该实现的推理速度提升约 15%,但这一测量只适用于此实现,不应推广到其他模型或硬件。

它为何对边缘 AI 有意义

这个项目的价值在于,它展示了大型托管模型背后常被隐藏的工程取舍。极小的内存预算迫使模型缩小输出范围、重复利用紧凑表示,并把部分运行时计算转换为预先计算的表格。同样的原则可用于传感器、玩具、工业控制器及其他嵌入式系统;在这些场景中,隐私、连接条件、功耗或可预测延迟可能比开放式能力更重要。

它也说明了训练和推理之间的界线。模型在设备之外借助强大得多的硬件完成训练;RP2350 只运行最终量化网络。因此,本地推理可以减少使用阶段所需的数据传输和网络连接,却不会让模型开发本身变得廉价。

开发者接下来应关注什么

作者把量化感知训练、更小的条件设计和进一步架构调优列为潜在改进方向。复现成果还需要公共代码仓库中的固件和模型文件,以及一块 RP2350 开发板;由于支持 USB 输出,VGA 硬件并非必需。

更广泛的启示很务实:只要任务范围足够明确,并围绕硬件预算设计完整技术栈,有用的生成能力就能装进微控制器。

来源

标签:

#RP2350 #edge AI #diffusion models #microcontrollers #Raspberry Pi Pico 2 #embedded systems

21

浏览

0

分享

0

点赞

相关文章