DSP 芯片的现状、发展趋势与体系结构特点

2017-08-18 95 0

DSP 又称数字信号处理器,是一种具有特殊结构、适用于进行实时数字信号处理的微处理器。DSP 芯片的内部采用程序和数据分开的哈佛结构,具有专门的硬件乘法器,广泛采用流水线操作,并提供特殊的 DSP 指令,可以快速实现各种数字信号处理算法。

DSP 芯片的现状、发展趋势与体系结构特点

图 1 DSP 芯片外形与结构示意

一、DSP 芯片的现状和发展

第一个 DSP 芯片诞生于 20 世纪 70 年代末,以 AMI 公司的 S2811 和 Intel 公司的 2920 为代表的第一代 DSP 芯片,其片内都还没有单周期硬件乘法器。

(1)制造工艺。早期 DSP 采用 4 μm 的 N 沟道 MOS(NMOS)工艺,现在的 DSP 则普遍采用亚微米 CMOS 工艺,达到 0.25 μm 或 0.18 μm;DSP 芯片的引脚数量从 40 个左右增加到 200 个以上,需要设计的外围电路越来越少,每 MIPS 的成本、体积和功耗都有很大的下降。

(2)存储器容量。20 世纪 80 年代初的 DSP,片内程序存储器和数据存储器只有几百个单元,有的片内没有 ROM;目前 DSP 片内的数据和程序存储器可达几十 K 字,此外对片外程序存储器和数据存储器的寻址能力也大大增强。

(3)内部结构。目前 DSP 芯片内部广泛采用多总线、多处理单元和多级流水线结构,加上完善的接口功能,使 DSP 的系统功能、数据处理能力以及与外部设备的通信功能大大增强。有的 CPU 中包含 8 个并行的处理单元,一个时钟周期可以执行 8 条指令,每秒最高可进行 16 亿次定点运算。

(4)运行速度。近 20 年的发展使 DSP 的指令周期从 400 ns 缩短到 10 ns 以下,相应的运行速度从几 MIPS 提高到 2000 MIPS 以上。具有代表性的是 TI 公司的 TMS320C6201 DSP,执行一次 1024 点复数 FFT 运算的时间只有 66 μs。

(5)运算精度和动态范围。由于输入信号的动态范围大以及迭代算法可能产生误差积累,对单片 DSP 的精度提出了较高要求:DSP 的字长从 8 位增加到 16 位、24 位、32 位,累加器的长度也增加到 40 位;超长指令字(VLIW)结构和高性能浮点 DSP 的出现,扩大了数据处理的动态范围。

(6)开发工具。20 世纪 90 年代推出的 DSP 都有较为完善的软件和硬件开发工具,包括 Simulator 软件仿真器、Emulator 在线仿真器和 C 编译器。

(7)发展趋势。一是高度集成化,集滤波、A/D、D/A、ROM、RAM 和 DSP 内核于一体的模拟数字混合式 DSP 芯片将有较大发展和应用;二是低功耗低电压,进一步降低功耗、开发低电压 DSP 内核(目前有的 DSP 内核电压已降到 3.3 V 和 2.5 V),使其更适用于个人通信机、便携式计算机和便携式仪器仪表;三是开发专用 DSP 芯片,为满足系统级芯片的设计需要,基于 DSP 内核的 ASIC 会有较大发展;四是提供更加完善的开发环境,特别是开发效率更高的优化 C 编译器和代数式指令系统,以克服汇编语言程序可读性和可移植性较差的不足、缩短开发周期;五是扩大应用领域,DSP 芯片将向航空、航天、雷达、声纳、图像、影视、医疗设备、家用电器等众多领域渗透。

二、DSP 芯片的体系结构特点

(1)哈佛结构。早期的微处理器内部大多采用冯·诺依曼(von Neumann)结构,其片内程序空间和数据空间是合在一起的,取指令和取操作数都通过一条总线分时进行;高速运算时不但不能同时取指令和取操作数,而且会造成传输通道上的瓶颈现象。DSP 内部采用程序空间和数据空间分开的哈佛(Harvard)结构,允许同时取指令(来自程序存储器)和取操作数(来自数据存储器),而且还允许在程序空间和数据空间之间相互传送数据,即改进的哈佛结构。

(2)多总线结构。许多 DSP 芯片内部都采用多总线结构,以保证在一个机器周期内可以多次访问程序空间和数据空间。TMS320C54x 内部有 P、C、D、E 等 4 条总线(每条总线又包括地址总线和数据总线),可以在一个机器周期内从程序存储器取 1 条指令、从数据存储器读 2 个操作数并向数据存储器写 1 个操作数,大大提高了运行速度。对 DSP 来说,内部总线是十分重要的资源,总线越多,可以完成的功能就越复杂。

(3)流水线结构。DSP 执行一条指令需要通过取指、译码、取操作数和执行等几个阶段。采用流水线结构后,这几个阶段在程序运行过程中是重叠的,即在执行本条指令的同时还依次完成了后面 3 条指令的取操作数、译码和取指,从而把指令周期降低到最小值。利用这种流水线结构,加上执行重复操作,就能保证数字信号处理中用得最多的乘法累加运算在单个指令周期内完成。

(4)多处理单元。DSP 内部一般都包括多个处理单元,如算术逻辑运算单元(ALU)、辅助寄存器运算单元(ARAU)、累加器(ACC)以及硬件乘法器(MUL)等,它们可以在一个指令周期内同时进行运算。例如执行一次乘法和累加的同时,辅助寄存器单元已经完成了下一个地址的寻址工作,为下一次乘法累加运算做好了准备,因此 DSP 在进行连续的乘加运算时,每一次乘加运算都是单周期的。这种多处理单元结构特别适用于 FIR 和 IIR 滤波器;许多 DSP 还能把一些特殊算法(例如 FFT 的位码倒置寻址和取模运算等)在芯片内部用硬件实现,以提高运行速度。

(5)特殊的 DSP 指令。为了更好地满足数字信号处理应用的需要,DSP 的指令系统中设计了一些特殊指令。例如 TMS320C54x 中的 MAD(乘法、累加和数据移动)指令,具有执行 LT、DMOV、MPY 和 APAC 等 4 条指令的功能;FIRS 和 LMS 指令则专门用于系数对称的 FIR 滤波器和 LMS 算法。

(6)指令周期短。早期 DSP 的指令周期约 400 ns,采用 4 μm NMOS 制造工艺;随着集成电路工艺的发展,DSP 广泛采用亚微米 CMOS 制造工艺,运行速度越来越快:TMS320C54x 的运行速度可达 100 MIPS,TMS320C6203 的时钟为 300 MHz,运行速度达到 2400 MIPS。

(7)运算精度高。早期 DSP 的字长为 8 位,后来逐步提高到 16 位、24 位、32 位;为了防止运算过程中溢出,有的累加器达到 40 位;一批浮点 DSP,例如 TMS320C3x、TMS320C4x、ADSP21020 等,则提供了更大的动态范围。

(8)硬件配置强。新一代 DSP 的接口功能愈来愈强:片内具有串行口、主机接口(HPI)、DMA 控制器、软件控制的等待状态产生器、锁相环时钟产生器,可实现在片仿真并符合 IEEE 1149.1 标准的测试访问口,更易于完成系统设计;许多 DSP 芯片还可以工作在省电方式,使系统功耗降低。

三、小结

DSP 芯片在信号处理、图像处理、仪器、语音、控制、军事、通信、医疗、家用电器等领域有着广泛的应用。本文从制造工艺、存储器容量、运行速度、运算精度和动态范围、开发工具等方面介绍了 DSP 芯片的现状和发展,并对其体系结构特点作了介绍。

相关文章

压敏电阻的参数、特性与应用
基于 STC12C 与 SIM300 的智能家电防盗系统电路设计
基于 nRF24L01 与 DHT11 的无线温湿度测试系统电路设计
电冰箱电子温控器的原理与半自动除霜电路
基于 586-Engine 的无人机飞行控制器电路设计
三极管开关电路的改进接法:加速电容、图腾柱与驱动电路

发布评论