日前,由 Ebrahim Hussain 和 Aaditya Subedi 领导的定制芯片人工智能研究实验室Architect Labs宣布,其人工智能系统根据人工编写的规范生成并完全验证了端到端的、可用于生产的人工智能加速器 Redwood。
仅由两位人类架构师提供技术规范,人工智能系统就在不到两周的时间内完成了芯片的设计和全面验证。它还参与了固件和定制内核的设计,并将现代人工智能模型映射到硬件上。最终的加速器目前运行在FPGA平台上,对包括Llama和Qwen在内的数十亿参数模型进行推理。
据相关人士所说,Redwood 代表着半导体行业的一个重要里程碑:一个人工智能系统自主设计出了一款可运行人工智能模型的量产型人工智能芯片。这种方法在人工智能模型和为其优化的硬件之间建立了一个反馈回路,有望将芯片设计速度提升到超越传统开发周期的水平。
性能测试结果也表明,Redwood 不仅仅是概念验证。基于三星的 8nm 工艺,Redwood 的吞吐量是 NVIDIA Jetson Orin Nano 的 1.75 倍,功耗却降低了 1.9 倍,这意味着在相同的 AI 模型下,其每瓦性能提升了 3.4 倍。
芯片设计可能需要数年时间和数亿美元,而专业人才的日益匮乏使得先进半导体研发集中在少数几家大型公司手中。因此,人工智能工作负载往往需要适配远在最新型号问世之前设计的硬件。
Redwood 采取了不同的方法,从一开始就将硬件和软件进行协同设计。内核、固件和 RTL 代码共同开发和优化,使芯片能够根据 AI 工作负载进行定制,而不是强迫软件去适应现有的硬件。
这形成了一个持续的反馈循环,改进的 AI 模型可以为更好的硬件设计提供信息,而更高效的硬件可以实现更好的 AI 性能,从而有可能加速开发周期的两端。
“四十年前我刚入行时,芯片设计只需要一两个工程师。从那时起,设计的复杂性、耗时和风险都呈指数级增长。即使EDA工具和技术不断进步,一个芯片项目仍然需要耗费数年时间和庞大的工程团队,”英特尔前工程高级副总裁Sunil Shenoy说道。“Redwood真正实现了范式转变,树立了技术前沿的标杆。Architect Labs正在以我以前难以想象的速度,将曾经只有少数巨头才能掌握的能力普及化。他们的方法有望将硬件带回未来。”
走进Redwood :前沿人工智能加速器
Redwood 是一个端到端的 AI 推理平台,专为需要在严格的功耗限制下实现实时性能的物理 AI 应用(例如机器人、无人机和边缘设备)而设计。
其核心是一个可扩展的矩阵和向量计算引擎网格,这些引擎通过专用的片上网络连接起来。完整的AI推理流程,包括注意力机制、键值缓存和即时量化,都直接在芯片上运行,无需依赖主机处理器。
计算引擎、网络、固件和定制内核作为一个统一的系统进行设计和优化,使硬件能够紧密匹配现代人工智能工作负载。Redwood 还可以扩展到更大的数据中心 SoC,或作为独立的芯片组运行。
关于自主Redwood设计的关键统计数据:
自主设计和验证: 100% 的 RTL、UVM 验证环境、形式验证、固件、驱动程序和自定义计算内核均由 Architect Labs 的 AI 系统根据人工编写的规范在不到两周的时间内端到端生成,而该项目由两名人类架构师参与。
达到签核级验证标准,硬件零缺陷:从单个IP到整个SoC,每个模块的代码和功能覆盖率均超过95%,验证过程使用了商用EDA工具、Architect Labs专有的形式化验证引擎以及硬件在环验证。从仿真到FPGA平台的首批RTL代码均未发现任何缺陷。
在真实硬件上运行真实的AI模型: Redwood Nano部署在AMD Versal FPGA上,运行频率为250MHz,可对包括Qwen在内的开放权重模型执行实时单批次推理。Architect Labs在今年的设计自动化大会(DAC)上进行了现场硬件演示,是展会上为数不多能够展示AI设计的加速器并实时运行模型推理的公司之一。
超越当今领先的AI芯片:在与NVIDIA Jetson Orin Nano采用相同工艺的三星8纳米工艺平台上,Redwood的吞吐量提升了1.75倍,功耗降低了1.9倍,每瓦性能提升了3.4倍(以运行相同模型的Jetson基准测试为基准)。这些预测结果基于FPGA的直接测量数据,而非仅基于仿真。
架构迭代以天为单位,而不是以季度为单位:对高级规范的任何更改都会导致硬件在 48 小时内完全重新生成、重新验证和重新部署,但受 EDA 工具运行时间限制的 SoC 级运行除外。
递归式自我改进:部署在 Redwood 上的 AI 模型以 API 端点的形式公开,发现了加速器本身的计时和内核优化,推理成本几乎为零,从而闭合了 AI 和驱动它的硅芯片之间的闭环。
“每个计算时代的进步都离不开底层硬件的支持,但也受限于谁有能力制造相应的芯片,” Kindred Ventures 的创始人兼管理合伙人 Steve Jang 表示。“Redwood 芯片的问世初步证明,这道门槛可以打破:两个人——从一份书面规范和目标 AI 模型入手——利用 Architect Labs 的系统,在短短几周内就完成了极具竞争力的 AI 加速器的设计、验证和部署。无论你是前沿研究实验室、机器人制造商还是云运营商,为你的产品或平台量身定制芯片的概念如今正逐渐成为现实。”
一种从根本上革新的硅芯片软件设计方法
Architect Labs 的 AI 系统能够并行优化整个计算堆栈,从模型和内核到固件和 RTL 代码,而非采用传统芯片设计中常见的顺序、孤立的工作流程。这使得软件和芯片能够在流片过程中进行协同优化,设计迭代时间可能从数月缩短至数周。
这种方法可以根据效率在软件和硬件之间切换功能,例如,用专用硬件逻辑替换数千个软件周期,或者将调度任务移至编译器。Redwood 证明,这些权衡取舍现在可以在几天内通过硬件完成设计、验证和测试,从而为将该方法扩展到更复杂的芯片奠定了基础。
“三十年前,像台积电这样的晶圆代工厂让任何拥有设计方案的人都能获得世界一流的制造能力,由此催生了以英伟达、博通和苹果等公司为代表的无晶圆厂半导体产业,”Architect Labs联合创始人兼首席执行官Ebrahim Hussain表示。“同样,我们正在引领无设计半导体产业的发展,像Redwood这样的芯片可以与运行的工作负载共同设计和演进。我们设想,拥有密集型工作负载或专用AI模型的软件公司可以获得共同设计的定制芯片,而无需组建庞大的设计团队,无需在架构上投入十年时间,也无需退而求其次使用现成的通用解决方案,从而节省性能、功耗和成本。每一项重要的工作负载都值得拥有专属的定制芯片。我们正在构建这样一个未来。”
Architect Labs表示,公司已将同样的方法应用于财富 500 强合作伙伴,以软件开发的速度共同设计定制芯片,并将原本需要数月才能运行的程序压缩到数周内即可完成。Redwood 是这项技术首次公开展示其成果。
附完整论文翻译:
现代人工智能工作负载及其运行所需的硬件以不同的时间尺度演进:架构定义比量产芯片早数年,而目标工作负载的变化却以月为单位。因此,设计决策是在高度不确定性下做出的,并且要付出双重代价:一次是为规避风险而增加的通用性,另一次是当新的工作负载难以映射到已冻结的芯片上时。
通过商用EDA工具、我们自主研发的形式化引擎以及硬件在环验证,每个模块的覆盖率均达到95%。规范变更在48小时内完成重新验证并部署到硬件。Redwood Nano是其超低功耗FPGA版本,可运行Llama和Qwen等数十亿参数模型。在三星8nm工艺(Jetson Orin Nano的工艺等级)下,Redwood的吞吐量提升了1.75倍,功耗降低了1.9倍,与在相同模型上测得的Jetson基准相比,每瓦性能提升了3.4倍。
在Redwood上运行的Qwen也助力了下一代Redwood的设计,这是迈向递归式自我改进的早期一步。据我们所知,这是首个由AI系统端到端设计并运行现代AI模型的、可用于生产环境的AI加速器。
一、引言
EDA 行业目前报告称,人工智能 (AI) 在 RTL 生成、验证、调试和探索等方面带来了数量级的提升,包括将数月的工作量缩短至数天,并在设计和验证工作流程中实现高达 10 倍的生产力提升。然而,仅有 14% 的 IC/ASIC 项目实现了首芯片流片成功,这是近二十年来的最低水平,而 75% 的项目进度落后,因为芯片项目面临着日益复杂的设计挑战,这些挑战源于异构集成、先进节点物理效应以及日益严格的功耗、性能和面积 (PPA) 限制 。这种差异凸显了任务级生产力声明与整个项目结果之间的严重不匹配:AI 加速了单个活动,但尚未在日益复杂的 SoC 上展现出明显的端到端项目改进。
与此同时,公开展示的端到端 AI 生成设计仍然局限于简单的示例,例如玩具 RISC-V 内核或强化的数值数据通路。几乎没有一项技术在物理硬件上得到验证,而物理硬件最终是硬件设计的最终约束。我们认为,人工智能在硬件设计中的应用机会并非在于现有流程中的任务加速,而在于对整个流程本身进行重新构想。当架构、RTL、验证、固件和内核都基于单一规范生成,并针对同一目标进行优化时,导致程序延迟的顺序交接环节就会消失,软硬件协同设计将成为系统本身的属性,而非团队之间的协调过程。
为了解决这个问题,我们推出了 Redwood,这是一款前沿的 AI 加速器,由该系统完成端到端的设计、验证、编程和部署。两位架构师在一份高级规范中记录了工作负载和架构约束。基于该规范,系统自主生成了性能模型、RTL 代码、UVM 环境、形式化证明、固件、驱动程序和自定义计算内核。在不到两周的时间内,系统从零开始完成了完整的设计,每个模块的代码和功能覆盖率均达到 95%,并在 AMD Versal FPGA 上部署了 Redwood Nano 配置。第三周,Qwen3-0.6B 推理上线 。在此期间,每次架构变更都在 48 小时内重新生成、重新验证并重新部署到硬件上。 Redwood Nano 采用与 NVIDIA Jetson Orin Nano 类似的 8 纳米级三星工艺进行评估,预计其解码吞吐量将提升 1.75 倍,功耗降低 1.9 倍,每瓦性能提升 3.4 倍(与运行相同模型的 Jetson 基准相比)。
二、架构
Redwood 是一款基于 tile 的空间数据流加速器,它使用标准的 AXI4 内存映射接口:AXI-Lite 用于控制和配置,而支持完整突发传输的宽 AXI4 用于批量数据传输(图 1)。专用 DMA 引擎负责所有与外部 DRAM 之间的数据传输。全局 DMA (GDMA) 架构在外部存储器和片上西、北、东三个末级 SRAM 存储体 (LLC) 之间执行批量内存到内存的传输,而边缘 DMA 引擎则负责在计算架构上进行数据暂存。全局控制区域负责对加速器进行排序,并包含全局控制核心 (MCU)、全局任务管理器以及一个 48 位全局定时器 (HAC),该定时器会广播到每个 tile 以进行时间隔离调度。该区域负责启动、协调和清理诸如 FlashAttention 和 GEMM/GEMV 等内核。由于内存接口仅限于模块化 DMA 引擎,Redwood 可以集成到更大的 SoC 中,也可以封装成独立的芯片。 DMA 后端可以从 AXI4 重定向到 ACE 和 CHI 等协议,而不会影响计算架构。
计算架构是一个 N × M 的网格,由相同的 tile 组成,周围环绕着边缘 DMA 引擎。每个 tile 都包含一个基于 RISC-V 的 tile 控制核心 (CRV) 和专为 Transformer 推理而设计的计算引擎。矩阵引擎 (CMXM) 提供脉动 GEMM 和矩阵向量 (GEMV) 数据通路,并将数据流直接传输到向量引擎 (CVXM),后者提供 SIMD、转置和浮点激活单元。宽大的分块暂存存储器最大限度地减少了 Redwood 内部的数据移动。计算引擎与内核软件协同设计,因此它们可以直接映射到主要的 Transformer 算子——注意力机制、GEMM、归一化和激活——并将 FlashAttention 和 GEMM 等内核作为硬件调度任务执行,而不是作为通用指令流执行。高带宽、内部设计的、基于信用机制的片上网络 (NoC) 可承载 tile 到 tile、DMA 到 tile 和 tile 到 DMA 的流量。它提供低开销的广播和组播、基于表的流重定向以及逐链路流量控制。
A. Tile 架构
Redwood 架构中的每个 tile 都分为前端 (FE) 和后端 (BE),如图 2 所示。FE 负责控制和编程,而 BE 负责数据传输和计算。将稀疏控制与高带宽数据处理分离,使得 FE 能够在较低的时钟频率下运行,并且在某些情况下,FE 可以在内核执行期间关闭,从而实现显著的节能效果。内核软件运行在 tile 控制核心 (CRV) 上,而核心任务管理器 (CTM) 则连接 CRV 和 BE 功能单元,并协调跨多个可配置单元的任务。
Tile BE 内部的硬件单元是为现代 Transformer 工作负载协同设计的,包括设备端预填充和解码。计算单元包括用于矩阵运算的 GEMV 和 GEMM 引擎(由阵列化的基于整数的乘加 (MAC) 单元构建),以及用于逐元素运算的多通道 SIMD 引擎(由阵列化的浮点单元 (FPU) 构建),能够处理归约、基于查找表 (LUT) 的运算等(图 3)。一项优化采用了 FlashAttention-4 中的模拟 softmax 算法,该算法重用了现有的 SIMD 资源来执行原本会占用大量面积的操作。这些功能单元和 CRV 通过高带宽总线共享对本地 512 KB 核心内存 (CMEM) 的访问。本地入口和出口 DMA 引擎负责将数据移入和移出 CMEM。
B. 控制机制
要使用 Redwood tile 进行计算,首先需要将内核加载到前端指令紧耦合存储器 (ITCM:instruction tightly coupled memory ) 中。然后,核心调试、跟踪和控制 (CDTC:Core Debug, Trace, and Control ) 单元启动裸机 tile 控制核心 (CRV:control core )。CRV 等待 CDTC 向数据紧耦合存储器 (DTCM:data tightly coupled memory) 传递函数调用,然后执行选定的内核函数。内核函数通常会展开为多个 MMIO 写入操作,这些操作会将 CTM 任务排队,以便分发给相应的功能单元。只要内核函数的实现位于 ITCM 中,就可以将多个内核调用排队。整个前端-后端协调过程如图 4 所示。
前端 (FE) 和后端 (BE) 之间的这种解耦带来了以下优势:
CRV 保持简洁,实现了最小的 RISC-V 规范,面积和功耗开销都很低。
当添加、更改或移除 BE 功能单元时,CRV 解码器保持不变。
CRV 可以将任务列表交给 CTM,然后保持空闲状态直到被中断。
CTM 原生支持:
使用任务 ID 跟踪乱序完成情况,实现任意任务排序和隔离。
硬件跟踪和日志记录到跟踪缓冲区,并通过中断传递软件通知。
循环遍历队列任务的任意部分,以减少重复的 CRV 写入。
CTM 任务还可以通过 Redwood SoC 消息传递结构传输的外部“消息”进行隔离,该结构连接所有 CTM。跨内核和 CTM 的系统级消息传递如图 5 所示。
消息机制允许 CTM 在不涉及 CRV 或 MCU 的情况下对控制流进行排序。在图 6 的典型示例中,位于 (0,0) 的 tile 向东西 DMA 引擎发送交错消息,它们的 CTM 会等待“允许”消息才能释放下一个任务。通信也可以反向进行,DMA CTM 向 tile CTM 发送信号,使其向下游发送数据。消息机制可以配置为“即发即弃”或“基于确认”。编译器使用消息机制来协调预取、双缓冲和乱序计算。通过消息进行显式流量控制减少了对网格中复杂仲裁的需求,并将调度移至软件栈中。
三、编程模型
Redwood 采用灵活的编程模型,可在同一架构上运行不同的模型和工作负载。全局控制核心 (MCU) 的程序称为调度程序 (DP),而各个单元的程序称为内核。多个 DP 组成一个“DP 集”,多个内核组成一个“内核集”,从而分摊初始化开销。
主机处理器使用 Redwood 执行操作的流程如下(图 7):
1.(前提条件)将 DP 集从外部存储器加载到 MCU 的 ITCM 中。
2.(前提条件)将内核集从外部存储器加载到所有 tile 的 ITCM 中。
3. 主机处理器将调度 ID 和操作数写入 MCU 的 DTCM,并向 MCU 发送信号。
4. MCU 执行由调度 ID 选择的调度程序。调度程序可以:
对内部结构网格中的静态路由表进行编程。
配置全局任务管理器以执行预取、内存到内存复制和分散/聚集操作。
配置 DMA 引擎任务管理器以将数据移入和移出 tile 阵列。
通过将内核 ID 和操作数写入 tile 的 DTCM 并向 tile 控制核心发送信号来启动 tile 内核。
DP 可以通过轮询状态或依赖 tile 中断来判断 tile 阵列何时完成。一个正在运行的 DP 在其生命周期内可能会启动一个或多个内核。例如,FlashAttention 会反复启动 tile 来处理不同的 KV 块和磁头。
5. 当 DP 完成时,MCU 会中断主机处理器,以指示执行已完成,并且预留的输入输出缓冲区可供主机使用。
如果整个模型所需的 DP 或内核集不适合 ITCM,则主机处理器会在运行时将它们加载到分区中,并将它们分组以最大限度地减少交换。
四、评估
Redwood Nano 是 Redwood 的 FPGA 配置,专为超低功耗、低延迟边缘应用场景而设计和优化。它由一个 2 × 2 的 tile 阵列组成,每个 DMA 引擎都连接到一组 128 位 AXI4 接口。西侧和北侧接口优先考虑入口读取带宽,而东侧接口优先考虑出口写入带宽。Redwood Nano 在 250 MHz 的 AMD Versal VPK180 FPGA 上进行综合和部署(图 8)。为了评估性能,我们在 Redwood Nano 上运行 Qwen3-0.6B,并将其与 NVIDIA Jetson Orin Nano 进行比较。图 8 显示了 Redwood Nano 在 VPK180 FPGA 上的布局和实例化层次结构。
我们测量了峰值吞吐量和平均吞吐量下的 LLM 解码性能,单位为每秒输出的 token 数。对于 Redwood Nano,测量过程包括从主机向 FPGA 发送提示符、在 FPGA 上运行 Qwen 以及将每个输出 token 返回给主机。 NVIDIA Jetson Orin Nano 运行的是相同型号的处理器,GPU 时钟频率为 1020 MHz,性能测试使用 NVIDIA 的 Jetson WebUI 进行。表 I 列出了基准测试对比结果。
A. Redwood顶线峰值解码吞吐量分析
我们首先计算峰值理论性能。操作级屋顶线源自 Qwen3-0.6B 解码图。该模型包含 28 个解码器层,隐藏层宽度为 1024,中间层宽度为 3072,16 个查询头,8 个 KV 头,头维度为 128,词汇表大小为 151,936。每一层中,INT8 线性形状分别为:Q : [2048, 1024],K,V : [1024, 1024],O : [1024, 2048],gate,up : [3072, 1024],down : [1024, 3072]。
矩阵引擎包含四个 tile,每个 tile 有 64 条 INT8 MAC 通道。将乘法和加法视为两次运算,其峰值速率为:
512 位 SIMD 数据通路每个周期可接受 32 个 BF16 或 16 个 INT32 操作数,峰值速率为
对于每个未融合运算符










