过去,生成图片通常要靠手机或GPU服务器。现在,开发者 cpldcpu 把一个极小的图像生成模型塞进了 RP2350 微控制器——也就是常见于家电、传感器和嵌入式设备、资源远少于普通电脑的小型计算机。按作者在 Reddit 的介绍,它无需联网,最长约20秒即可生成一张128×128像素的人脸图像,再通过显示器或USB输出。
模型只有240万至400万个参数,并量化为 int8——用较低精度的数字保存和计算参数,以节省内存与算力。它采用 latent flow transformer,在压缩后的“潜在空间”里逐步把噪声变成图像表示。最巧的一步是边算边搬:引擎计算当前层时,通过 DMA(无需CPU逐项参与的数据搬运机制)从闪存预取下一层权重;同时利用 ReLU² 激活产生的稀疏性,跳过部分计算。
这更像一份极限压缩与软硬件协同的直观样板,而非通用图片生成器。上述速度和画质提升均为作者自述;材料未披露功耗、内存占用及与其他方案的对比。