《Frontiers in Artificial Intelligence》:Views: a hardware-aware recursively labeled graph database model for knowledge representation and reasoning
编辑推荐:
引言:知识表征仍是面向推理的人工智能的核心挑战,尤其当语义结构涉及关系上的关系、上下文注释以及递归嵌套描述时。本研究提出Views——一种递归标记的图数据库(GDB)模型,旨在将此类图结构化知识表征于统一的图抽象之中,同时保留面向硬件的组织方式以支持关联搜索与
引言:知识表征仍是面向推理的人工智能的核心挑战,尤其当语义结构涉及关系上的关系、上下文注释以及递归嵌套描述时。本研究提出Views——一种递归标记的图数据库(GDB)模型,旨在将此类图结构化知识表征于统一的图抽象之中,同时保留面向硬件的组织方式以支持关联搜索与遍历。
方法:该模型将有向标记图重构为链接节点构成的链表式链,支持顶点与边的递归标记,并允许从资源描述框架(RDF)风格和标记属性图(LPG)风格的图表示进行映射。研究人员描述了数据结构、其在关联芯片架构(ASOCA)下的面向硬件的内存映射方案,以及用于基于Views的GDB检索的选定关联操作。随后,研究人员利用Linked Data基准委员会发布的社会网络基准的三个规模评估了在所陈述映射与存储边界下的存储占用,并在关联存储器芯片III(ASOCA3)现场可编程门阵列(FPGA)实现上表征了有向K跳遍历。
结果:存储结果表明,分配方案与条目宽度对报告的占用空间有实质性影响,而非确立Views固有的优势;而K跳测量显示,在固定驻留图映像上,随着跳数上限的增加,平均返回顶点数与平均延迟均呈上升趋势。工作的语义推理示例与受Copycat启发的示例进一步说明了检索操作如何在该模型上进行组合,而非提供应用层面的推理或认知验证。
讨论:综合来看,这些结果将Views定位为在所陈述条件下用于关联存储与选择性图遍历的一种模型-架构协同设计方案;更广泛的数据库工作负载与端到端推理应用仍有待评估。
研究背景与问题
图数据库(GDB)广泛应用于工业数据分析、符号人工智能(AI)、语义计算以及检索增强生成(RAG)等领域,尤其在知识图谱的知识表征中扮演核心角色。当前主流的知识图谱通常采用资源描述框架(RDF)或标记属性图(LPG)及其相应的GDB系统实现。然而,当语义结构涉及关系上的关系、上下文注释以及递归嵌套描述时,现有模型面临严峻挑战。尽管RDF通过三元组、具体化与命名图提供了清晰的逻辑基础,LPG则通过直接在顶点与边上附加标签与属性支持应用中心化的模式与分析,但在符号密集型应用中,性能瓶颈往往源于不规则访问模式、指针追逐、缓存行为不佳及内存带宽压力,而非单纯的算术复杂度。此外,数据类型的异构性与跨数据库互操作性进一步增加了高效处理与扩展的难度。虽然内存与模式优化被视为提升存储效率与查询性能的潜在途径,但GDB模型与图处理硬件的联合设计仍相对未被充分探索。因此,本研究并非旨在用一个全新的GDB模型简单地取代传统软件环境中的成熟RDF或LPG系统,而是审视一种与专用硬件协同设计的GDB模型,用于存储、搜索与遍历符号及语义信息。
研究内容与结论
研究人员提出了Views——一种面向硬件感知的GDB模型,用于存储语义信息。Views基于有向递归标记图(DRLG),其中顶点和边均可被标记,且标记本身可以拥有任意有限深度的子标记。该模型旨在将实体、关系、属性、上下文注释以及高阶语义结构统一表征于一个图抽象之内。其核心创新在于将图描述重构为链表式结构,以增强数据结构的均匀性与对称性,并且这种结构天然适合在硬件中实例化,特别是关联芯片架构(ASOCA)项目所针对的硬件环境。ASOCA旨在将Views的思想转化为一系列用于GDB操作的硬件加速器,利用双寻址与内容可寻址存储器结构支持图存储、关联搜索与近内存遍历。因此,Views的价值应被理解为一种模型-架构协同设计,其新颖性不在于声称在常规架构上全面优于成熟的GDB模型,而在于将递归标记的语义图结构与ASOCA风格硬件所针对的内存组织和关联操作对齐。
重要意义
本研究首次系统地提出了一个与硬件架构深度耦合的递归标记GDB模型,并通过存储占用分析与FPGA上的K跳遍历实验初步验证了其可行性。这为未来开发面向大规模语义信息的高效、低功耗关联存储与检索硬件奠定了理论基础与原型基础,也为知识表征与推理领域提供了一种超越传统冯·诺依曼架构局限性的全新协同设计范式。
关键技术方法
研究人员采用了以下关键技术方法:第一,提出了Views数据模型,将图重构为由头节点(headnode)与链接节点(linknode)组成的链表式链结构,每个链接节点包含头ID(head ID)、两个主ID(primID1、primID2)、两个属性指针(prop1、prop2)以及下一个节点指针(next),实现了递归标记能力。第二,设计了两种物理内存映射方案:CNSM分配(使用8个功能独立的数组分别存储内容C、导航N、下属S与杂项M字段)与归一化分配(仅保留4个C与N数组,适用于上下文依赖较少的简单图)。第三,依托ASOCA硬件架构系列(包括ASOCA1的64×64位双寻址存储器阵列、ASOCA2的八阵列超簇以及ASOCA3的Xilinx VU13P FPGA实现),定义了编程(PROG)、地址寻址读取(AAR)、内容寻址读取(CAR/CAR2)以及HEAD、CARNEXT、TAIL等复合遍历操作作为底层关联接口。第四,利用Linked Data基准委员会(LDBC)社交网络基准(SNB)Interactive v1的三个规模(SF0.1、SF0.3、SF1)进行存储占用分析,并使用SNAP roadNet-CA数据集的前131,072条有向关系在ASOCA3 FPGA上执行有向K跳遍历实验。
研究结果
4.1 LDBC存储占用:研究人员将LDBC SNB初始快照转换为规范的流数据,并分别映射为四种Views映像(32位归一化、64位归一化、32位CNSM、64位CNSM),同时与LPG和RDF的逻辑槽位会计存储进行比较。结果显示,字段数量、条目宽度以及字典存储均对总占用有实质性贡献。64位归一化与32位CNSM每行结构字节数相同(32字节),从而隔离了数组数量与条目宽度的影响。64位CNSM比逻辑LPG总量大116%–119%,比逻辑RDF总量大91%–94%;相反,32位归一化比LPG小9%–10%,比RDF小19%–20%。材料化比较进一步显示,在SF1下,32位归一化Views映像约1.93 GiB,而Neo4j数据库约4.08 GiB,Jena TDB2位置约9.38 GiB。这表明分配与宽度专业化决定了存储表现,而非Views本身相对于64位替代方案具有内在优势。
4.2 ASOCA3 FPGA上的K跳遍历:研究人员使用SNAP roadNet-CA数据集的前131,072条有向关系(含45,915个顶点,平均出度2.89),对1,000个固定源顶点执行k∈{2,5,8,10,15,20}的有向K跳遍历。主机负责管理前沿集与已访问集,通过CAR在N1数组中查找源顶点所属的关系,再通过AAR族读取C2获取目标顶点。结果显示,平均返回顶点数从k=2时的8.934增至k=20时的1,377.963,核心延迟均值从15.74 μs增至1,805.65 μs,系统延迟均值从0.08825 ms增至10.17 ms。这一观察刻画了在单个固定图映像上遍历工作量随跳数增加的特征,但并未建立随图规模扩展的规律或每跳恒定成本。吞吐量、能耗及每访问内存效率均未测量,也未进行受控的CPU/GPU对比或声称通用加速。
讨论与结论
研究人员指出,Views的结果应被理解为一种模型-架构协同设计,适用于所陈述条件下的关联存储与选择性图遍历。存储占用分析表明,分配方案与条目宽度对占用空间有实质性影响,而非Views具有固有优势;K跳遍历则展示了在固定驻留图映像上,随着跳数上限增加,平均返回顶点数与平均延迟均呈增长趋势。论文中的语义推理示例与受Copycat启发的示例进一步说明了检索操作如何在模型层面进行组合,而非提供应用级别的推理或认知验证。综合来看,这些结果将Views定位为在所陈述条件下用于关联存储与选择性图遍历的一种模型-架构协同设计方案;更广泛的数据库工作负载和端到端推理应用仍有待评估。