Vitis HLS 学习笔记--接口存储器布局模型

2024-06-09 08:12

本文主要是介绍Vitis HLS 学习笔记--接口存储器布局模型,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目录

1. 简介

2. 详解

2.1 数据对齐

2.2 数据结构填充

3. 总结


1. 简介

软件开发者写的程序会在 CPU 处理器上运行,而硬件开发者设计的“内核”则会在 FPGA 上运行。这两部分需要通过一个精心设计的接口来沟通,就像两个人用对讲机来交流一样。为了确保这种沟通顺畅,数据必须以一种特定的方式来存储和组织,这就是所谓的存储器模型。这个模型就像是一个书架,告诉你如何摆放你的书籍,以便你能快速找到它们。

在这个过程中,有两个重要的概念:数据对齐和数据结构填充

数据对齐就像是确保所有的书都准确地靠在书架的边缘,这样你就能更快地找到它们。

数据结构填充则是在书与书之间留出空间,以防它们挤在一起时难以取出。

Vitis HLS 编译器允许开发者调整这些规则,就像你可以调整书架的层板一样,以适应不同大小和形状的书籍。这样,软件和硬件就能更高效地一起工作,就像一个精心组织的图书馆一样。

2. 详解

2.1 数据对齐

打个比方,CPU 内存就像一个巨大的书架,而每本书代表了一块数据。程序员通常会认为这个书架是由一排排紧挨着的书组成的,每本书都可以单独拿出来看。

但实际上,现代的计算机处理器(就像是拿书的人)并不是每次只拿一本书,而是一次拿一整组书,比如一次拿2本、4本、8本,甚至更多。这样做的原因是,一次拿多本书可以更快地找到需要的信息,就像你可以一眼看到一组书的标题一样。

为了让处理器能够高效地拿书,书架上的书需要按照一定的规则摆放。比如,如果处理器一次拿4本书,那么每组书的第一本书的位置就需要是4的倍数。这就是所谓的“对齐”。如果书没有按照这个规则摆放,处理器在拿书时就会遇到麻烦,可能会拿得很慢,或者甚至拿不到想要的书。

如果程序员在编写软件时没有考虑到这些对齐的规则,就可能会导致软件运行缓慢,或者程序卡住不动,有时候甚至会导致整个操作系统崩溃。最糟糕的情况是,软件可能会在没有任何提示的情况下出错,给出错误的结果。所以,理解并正确处理内存对齐是非常重要的,它可以确保软件运行得既快速又稳定。

下表显示了 C/C++ 中对应 32 位和 64 位 x86-64 GNU/Linux 机器的基本原生数据类型的大小和对齐(以字节数为单位):

类型

32 位 x86 GNU/Linux

64 位 x86 GNU/Linux

大小

对齐

大小

对齐

float

4

4

4

4

double

8

4

8

8

long double

12

4

16

16

void*

4

4

8

8

为了在存储器要求和性能之间取得平衡,程序员可能需要更改数据的默认对齐方式。因为在主机与加速器(FPGA)之间往返发送数据时,发射的每个字节都有成本。

GCC C/C++ 编译器提供了一个语言扩展 __attribute__((aligned(X))),允许程序员为变量、结构体或类指定一个特定的对齐字节数。例如,声明 int x __attribute__ ((aligned (16))) = 0; 会使编译器在16字节边界上分配变量 x。

使用 __attribute__((aligned(X))) 不会改变变量的大小,但会通过在结构体元素之间添加填充来改变内存布局,从而可能增加结构体的总大小。aligned 属性只能用来增加对齐的字节数,不能减少。C++ 中的 offsetof 函数可以用来确定结构体中每个成员的对齐情况。

如果在使用 __attribute__((aligned)) 时没有明确指定一个对齐因子(即 X 的值),编译器会自动选择一个对齐值。这个值是目标机器上所有数据类型中最大的对齐要求。例如,如果目标机器上最大的数据类型对齐要求是8字节,那么编译器会将变量或字段对齐到8字节边界。

这样做的好处是可以提高内存访问的效率。因为大多数现代处理器在访问对齐的数据时更加高效,特别是当数据的对齐边界与处理器的内存访问粒度相匹配时。这意味着,如果处理器一次可以高效地读取8字节,那么在8字节边界上对齐的数据可以一次性被读取,而不需要多次内存访问。这就是为什么默认情况下,编译器会选择最大的对齐要求,以期望在不同的内存访问操作中获得最佳性能。

2.2 数据结构填充

在C++中,内置的数据类型(如 int, float 等)有预定义的对齐要求,这些要求确保了数据在内存中的有效访问。对于用户定义的数据类型,如结构体或类,编译器也会自动确保其中的成员变量是正确对齐的。

为了做到这一点,编译器可能会在结构体或类的成员变量之间插入填充字节(也称为“padding”)。这是因为每个成员变量可能有不同的对齐要求,而编译器需要确保每个成员都按照其类型的对齐要求放置在内存中。

此外,如果有一个用户定义类型的数组,编译器还会在数组的每个元素之间添加填充,以确保数组中的每个元素都能满足对齐要求。这样做的目的是为了提高数组元素访问的效率。在某些情况下,编译器甚至会在结构体或类的最后一个成员之后添加额外的填充,以确保当这个结构体或类被用作数组元素时,数组中的下一个元素也能正确对齐。

比如以下这个示例:

struct One
{short s;int   i;char  c;
}struct Two
{int   i;char  c;short s;
}

在 struct One 的例子中,short 类型的 s 成员要求在2字节边界上对齐,int 类型的 i 成员要求在4字节边界上对齐,而 char 类型的 c 成员对齐要求最小,通常是1字节。因为 int 类型的对齐要求是最严格的,所以整个结构体会在4字节边界上对齐。

为了满足这些对齐要求,编译器会在 s 和 i 之间插入2个填充字节,以确保 i 在4字节边界上对齐。同样地,为了在 c 之后开始新的对齐块,编译器会在 c 之后插入3个填充字节。因此,struct One 的总大小变为12字节。

然而,在 struct Two 中,成员的顺序被重新排列,以减少填充的需要。int 类型的 i 成员首先出现,后面紧跟着 char 类型的 c 和 short 类型的 s。c 只需充填一个字节,s 则不需要额外的填充。因此,struct Two 的总大小只有8字节。

3. 总结

在现代计算机系统中,数据对齐和结构填充是确保数据存储和访问效率的关键因素。数据对齐涉及将数据按照处理器优化的边界排列,以加快访问速度。结构填充则是在数据结构中插入额外空间,以保持成员变量的正确对齐。这些概念在硬件设计中尤为重要,因为 FPGA 和其他硬件加速器对数据布局的要求更为严格。Vitis HLS 等工具允许开发者自定义对齐和填充规则,以优化软件与硬件之间的数据交互,从而提升整体性能。理解并应用这些原则,可以帮助开发者在存储器要求和性能之间找到最佳平衡点。

这篇关于Vitis HLS 学习笔记--接口存储器布局模型的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1044642

相关文章

C++对象布局及多态实现探索之内存布局(整理的很多链接)

本文通过观察对象的内存布局,跟踪函数调用的汇编代码。分析了C++对象内存的布局情况,虚函数的执行方式,以及虚继承,等等 文章链接:http://dev.yesky.com/254/2191254.shtml      论C/C++函数间动态内存的传递 (2005-07-30)   当你涉及到C/C++的核心编程的时候,你会无止境地与内存管理打交道。 文章链接:http://dev.yesky

51单片机学习记录———定时器

文章目录 前言一、定时器介绍二、STC89C52定时器资源三、定时器框图四、定时器模式五、定时器相关寄存器六、定时器练习 前言 一个学习嵌入式的小白~ 有问题评论区或私信指出~ 提示:以下是本篇文章正文内容,下面案例可供参考 一、定时器介绍 定时器介绍:51单片机的定时器属于单片机的内部资源,其电路的连接和运转均在单片机内部完成。 定时器作用: 1.用于计数系统,可

问题:第一次世界大战的起止时间是 #其他#学习方法#微信

问题:第一次世界大战的起止时间是 A.1913 ~1918 年 B.1913 ~1918 年 C.1914 ~1918 年 D.1914 ~1919 年 参考答案如图所示

[word] word设置上标快捷键 #学习方法#其他#媒体

word设置上标快捷键 办公中,少不了使用word,这个是大家必备的软件,今天给大家分享word设置上标快捷键,希望在办公中能帮到您! 1、添加上标 在录入一些公式,或者是化学产品时,需要添加上标内容,按下快捷键Ctrl+shift++就能将需要的内容设置为上标符号。 word设置上标快捷键的方法就是以上内容了,需要的小伙伴都可以试一试呢!

Tolua使用笔记(上)

目录   1.准备工作 2.运行例子 01.HelloWorld:在C#中,创建和销毁Lua虚拟机 和 简单调用。 02.ScriptsFromFile:在C#中,对一个lua文件的执行调用 03.CallLuaFunction:在C#中,对lua函数的操作 04.AccessingLuaVariables:在C#中,对lua变量的操作 05.LuaCoroutine:在Lua中,

AssetBundle学习笔记

AssetBundle是unity自定义的资源格式,通过调用引擎的资源打包接口对资源进行打包成.assetbundle格式的资源包。本文介绍了AssetBundle的生成,使用,加载,卸载以及Unity资源更新的一个基本步骤。 目录 1.定义: 2.AssetBundle的生成: 1)设置AssetBundle包的属性——通过编辑器界面 补充:分组策略 2)调用引擎接口API

Javascript高级程序设计(第四版)--学习记录之变量、内存

原始值与引用值 原始值:简单的数据即基础数据类型,按值访问。 引用值:由多个值构成的对象即复杂数据类型,按引用访问。 动态属性 对于引用值而言,可以随时添加、修改和删除其属性和方法。 let person = new Object();person.name = 'Jason';person.age = 42;console.log(person.name,person.age);//'J

一份LLM资源清单围观技术大佬的日常;手把手教你在美国搭建「百万卡」AI数据中心;为啥大模型做不好简单的数学计算? | ShowMeAI日报

👀日报&周刊合集 | 🎡ShowMeAI官网 | 🧡 点赞关注评论拜托啦! 1. 为啥大模型做不好简单的数学计算?从大模型高考数学成绩不及格说起 司南评测体系 OpenCompass 选取 7 个大模型 (6 个开源模型+ GPT-4o),组织参与了 2024 年高考「新课标I卷」的语文、数学、英语考试,然后由经验丰富的判卷老师评判得分。 结果如上图所

大学湖北中医药大学法医学试题及答案,分享几个实用搜题和学习工具 #微信#学习方法#职场发展

今天分享拥有拍照搜题、文字搜题、语音搜题、多重搜题等搜题模式,可以快速查找问题解析,加深对题目答案的理解。 1.快练题 这是一个网站 找题的网站海量题库,在线搜题,快速刷题~为您提供百万优质题库,直接搜索题库名称,支持多种刷题模式:顺序练习、语音听题、本地搜题、顺序阅读、模拟考试、组卷考试、赶快下载吧! 2.彩虹搜题 这是个老公众号了 支持手写输入,截图搜题,详细步骤,解题必备

vue, 左右布局宽,可拖动改变

1:建立一个draggableMixin.js  混入的方式使用 2:代码如下draggableMixin.js  export default {data() {return {leftWidth: 330,isDragging: false,startX: 0,startWidth: 0,};},methods: {startDragging(e) {this.isDragging = tr