ShardingSphere Narayana XA 事务不回滚问题定位

2024-03-01 05:12

本文主要是介绍ShardingSphere Narayana XA 事务不回滚问题定位,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

ShardingSphere Narayana XA 事务不回滚问题定位

问题背景

用户反馈,在使用 ShardingSphere + Narayana 执行 XA 事务时,发生报错:java.sql.SQLException: javax.transaction.RollbackException: TransactionImple.enlistResource - ARJUNA016064: The transaction is in an invalid state!
这个报错的含义简单来说就是这个事务已经在其他地方被标记成只可回滚了,不能再进行后续其他的操作。报错信息如下:

Caused by: java.sql.SQLException: javax.transaction.RollbackException: TransactionImple.enlistResource - ARJUNA016064: The transaction is in an invalid state!at org.apache.shardingsphere.transaction.xa.XAShardingSphereTransactionManager.getConnection(XAShardingSphereTransactionManager.java:101)at org.apache.shardingsphere.transaction.ConnectionTransaction.getConnection(ConnectionTransaction.java:102)at org.apache.shardingsphere.driver.jdbc.core.connection.DriverDatabaseConnectionManager.createConnection(DriverDatabaseConnectionManager
.java:416)at org.apache.shardingsphere.driver.jdbc.core.connection.DriverDatabaseConnectionManager.createConnections(DriverDatabaseConnectionManage
r.java:383)at org.apache.shardingsphere.driver.jdbc.core.connection.DriverDatabaseConnectionManager.getConnections(DriverDatabaseConnectionManager.j
ava:357)at org.apache.shardingsphere.driver.jdbc.core.connection.DriverDatabaseConnectionManager.getConnections(DriverDatabaseConnectionManager.j
ava:338)at org.apache.shardingsphere.infra.executor.sql.prepare.driver.DriverExecutionPrepareEngine.group(DriverExecutionPrepareEngine.java:89)at org.apache.shardingsphere.infra.executor.sql.prepare.AbstractExecutionPrepareEngine.prepare(AbstractExecutionPrepareEngine.java:73)at org.apache.shardingsphere.infra.executor.sql.prepare.AbstractExecutionPrepareEngine.prepare(AbstractExecutionPrepareEngine.java:61)at org.apache.shardingsphere.driver.jdbc.core.statement.ShardingSpherePreparedStatement.createExecutionGroupContext(ShardingSpherePrepare
dStatement.java:764)at org.apache.shardingsphere.driver.jdbc.core.statement.ShardingSpherePreparedStatement.useDriverToExecute(ShardingSpherePreparedStatement.java:717)at org.apache.shardingsphere.driver.jdbc.core.statement.ShardingSpherePreparedStatement.executeWithExecutionContexts(ShardingSpherePreparedStatement.java:658)at org.apache.shardingsphere.driver.jdbc.core.statement.ShardingSpherePreparedStatement.execute(ShardingSpherePreparedStatement.java:631)at org.apache.ibatis.executor.statement.PreparedStatementHandler.update(PreparedStatementHandler.java:44)at org.apache.ibatis.executor.statement.RoutingStatementHandler.update(RoutingStatementHandler.java:69)at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)

问题分析

观察日志里有调用 setRollbackOnly 方法的日志,通过查看 setRollbackOnly 方法的调用链路,再结合报错是在 getConnection 时报的,那么调用 setRollbackOnly 方法应该发生在getConnection之前,极有可能是 enlistResource 地方报的。
![[img-20240123115238.png]]

通过查看 enlistResource 方法的逻辑,注释里写的是 xa start 语句没执行成功时会调用 markRollbackOnly 标识事务只可回滚。
![[img-20240123115315.png]]

开启 narayana trace 日志。
[[sf-xa-log.log]]
看日志 43 行
发现 enlistResource 操作前后有一个可疑日志。

-- xid unset
[2024-01-23 11:10:08,001] [com.arjuna.ats.internal.jta.resources.arjunacore.XAResourceRecord],[<init>],[XNIO-1 task-1],[INFO],[202401231110026b2ab483e6ae4d43bd055383c3d57d30-0],[],[XAResourceRecord.XAResourceRecord ( ARJUNA016100: Xid unset, org.apache.shardingsphere.transaction.xa.spi.SingleXAResource@5c6c9ab9 ), record id=0:ffff0acf077d:837d:65af2e0d:4]|[TID:323d025cef50474aa2ffdd4dc341a97a.316543.17059794010875173]|-- set rollback only
[2024-01-23 11:10:08,357],[eciqs-core],[com.arjuna.ats.internal.jta.transaction.arjunacore.TransactionImple],[setRollbackOnly],[XNIO-1 task-1],[INFO],[202401231110026b2ab483e6ae4d43bd055383c3d57d30-0],[],[TransactionImple.setRollbackOnly]|[TID:323d025cef50474aa2ffdd4dc341a97a.316543.17059794010875173]|-- 后续自动执行回滚操作日志
[2024-01-23 11:10:09,081],[eciqs-core],[com.arjuna.ats.internal.jta.transaction.arjunacore.BaseTransaction],[rollback],[XNIO-1 task-1],[INFO],[202401231110026b2ab483e6ae4d43bd055383c3d57d30-0],[],[BaseTransaction.rollback]|[TID:323d025cef50474aa2ffdd4dc341a97a.316543.17059794010875173]|[2024-01-23 11:10:09,081],[eciqs-core],[com.arjuna.ats.internal.jta.transaction.arjunacore.TransactionImple],[rollbackAndDisassociate],[XNIO-1 task-1],[INFO],[202401231110026b2ab483e6ae4d43bd055383c3d57d30-0],[],[TransactionImple.rollbackAndDisassociate]|[TID:323d025cef50474aa2ffdd4dc341a97a.316543.17059794010875173]|[2024-01-23 11:10:09,081],[eciqs-core],[com.arjuna.ats.arjuna.coordinator.BasicAction],[Abort],[XNIO-1 task-1],[INFO],[202401231110026b2ab483e6ae4d43bd055383c3d57d30-0],[],[BasicAction::Abort() for action-id 0:ffff0acf077d:837d:65af2e0d:2]|[TID:323d025cef50474aa2ffdd4dc341a97a.316543.17059794010875173]|

日志显示的是 ARJUNA016100: Xid unset,正常日志应该如下:

2024-01-23 11:48:33.341 [main] TRACE com.arjuna.ats.jta - XAResourceRecord.XAResourceRecord ( < formatId=131077, gtrid_length=29, bqual_length=36, tx_uid=0:ffff7f000101:90ab:65af3711:2, node_name=1, branch_uid=0:ffff7f000101:90ab:65af3711:3, subordinatenodename=null, eis_name=0 >, com.zc.transaction.xa.SingleXACtrlResource@1fc793c2 ), record id=0:ffff7f000101:90ab:65af3711:4

ARJUNA016100: Xid unset

后续分析为什么会出现ARJUNA016100: Xid unset 异常。
搜索 ARJUNA016100 错误码,是在 xidImple.toString 里调用的。

原因,比如一个 xa 事务涉及两个 xa resources,在执行第一个 resource enlist 时候,由于 xid 有问题,start xid 在 mysql 上执行失败了,然后 Naryana 自己调用 com.arjuna.ats.internal.jta.transaction.arjunacore.TransactionImple#setRollbackOnly 方法将当前全局事务状态设置为 ActionStatus.ABORT_ONLY 状态。
那么当事务内第二个 xa resource 执行 enlist resource 操作时,由于当前事务已经标记为只回滚,所以执行报错。也就是最开始日志里报的错:java.sql.SQLException: javax.transaction.RollbackException: TransactionImple.enlistResource - ARJUNA016064: The transaction is in an invalid state!
相关代码如下:

public boolean enlistResource(XAResource xaRes, Object[] params)  throws RollbackException, IllegalStateException,  jakarta.transaction.SystemException  
{  // ...int status = getStatus();  switch (status)  {    // jakarta.transaction.Status.STATUS_MARKED_ROLLBACK 对应上面的 ActionStatus.ABORT_ONLY 状态,报错 invalid。case jakarta.transaction.Status.STATUS_MARKED_ROLLBACK:  throw new RollbackException(  "TransactionImple.enlistResource - " + jtaLogger.i18NLogger.get_transaction_arjunacore_invalidstate() );  case jakarta.transaction.Status.STATUS_ACTIVE:  break;  default:  throw new IllegalStateException( jtaLogger.i18NLogger.get_transaction_arjunacore_inactive() );  }

当出现报错后,后续 narayana 会自动执行回滚操作,参考 narayana 日志。

XID 为空原因

为什么 xid 会为空。
这个 xid 为空的报错是在 com.arjuna.ats.jta.xa.XidImple#toString 方法中报的,实际上是 com.arjuna.ats.jta.xa.XidImple#_theXid 为空导致。
在 XidImple 所有构造方法中打断点,看创建 xid 过程,哪里导致 _theXid 属性为空。

public XidImple(Uid id, boolean branch, Integer eisName) {  try {  // 可以看到如果创建 _theXid 失败,则捕获了异常_theXid = XATxConverter.getXid(id, branch, eisName);  } catch (Exception e) {  _theXid = null;  jtaLogger.i18NLogger.warn_cant_create_xid_of_branch(id, branch, eisName, e);  // abort or throw exception?  }  hashCode = getHash(_theXid);  
}

后续 debug 看日常信息,发现 xid 为 null,异常信息里有 ARJUNA016111: The node identifier cannot be null 信息,这个明显是没有读取到 jbossts.xml 配置文件导致的报错。

后续通过修改 Transaction Rule, 尝试刷新配置,发现错误依然存在。Debug 发现没有读取到 jbossts.xml 配置文件导致。

使用 arthas 查看应用里 ShardingSphere-JDBC 的 TransactionRule 属性正常,说明 Rule 正常刷新。
但是 arthas 查看 ObjectStoreEnvironmentBean 里的 jdbc 属性为空,说明没有读取到 jbossts.xml 配置文件。

sc -d *TransactionRule
vmtool --action getInstances -c 368239c8 --className org.apache.shardingsphere.transaction.rule.TransactionRule --limit 10 -x 2sc -d *ObjectStoreEnvironmentBean
vmtool --action getInstances -c 368239c8 --className com.arjuna.ats.arjuna.common.ObjectStoreEnvironmentBean --limit 10 -x 2

然后 Debug Narayana 启动逻辑,发现应用目录下并没有 jbossts.xml 配置文件。咨询用户发现应用系统每次部署启动阶段会清除目录下的所有文件,导致读取失败。

问题解决

用于该应用在启动阶段会清理目录下的配置文件,将 jbossts.xml 放到其他 Narayana 可以读取到的目录下即可。

参考

https://u01f1kqxrl.feishu.cn/wiki/YD11wifTiit5RgkmRINcDTxAnmJ

这篇关于ShardingSphere Narayana XA 事务不回滚问题定位的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/761318

相关文章

Redis连接失败:客户端IP不在白名单中的问题分析与解决方案

《Redis连接失败:客户端IP不在白名单中的问题分析与解决方案》在现代分布式系统中,Redis作为一种高性能的内存数据库,被广泛应用于缓存、消息队列、会话存储等场景,然而,在实际使用过程中,我们可能... 目录一、问题背景二、错误分析1. 错误信息解读2. 根本原因三、解决方案1. 将客户端IP添加到Re

详谈redis跟数据库的数据同步问题

《详谈redis跟数据库的数据同步问题》文章讨论了在Redis和数据库数据一致性问题上的解决方案,主要比较了先更新Redis缓存再更新数据库和先更新数据库再更新Redis缓存两种方案,文章指出,删除R... 目录一、Redis 数据库数据一致性的解决方案1.1、更新Redis缓存、删除Redis缓存的区别二

oracle数据库索引失效的问题及解决

《oracle数据库索引失效的问题及解决》本文总结了在Oracle数据库中索引失效的一些常见场景,包括使用isnull、isnotnull、!=、、、函数处理、like前置%查询以及范围索引和等值索引... 目录oracle数据库索引失效问题场景环境索引失效情况及验证结论一结论二结论三结论四结论五总结ora

Redis事务与数据持久化方式

《Redis事务与数据持久化方式》该文档主要介绍了Redis事务和持久化机制,事务通过将多个命令打包执行,而持久化则通过快照(RDB)和追加式文件(AOF)两种方式将内存数据保存到磁盘,以防止数据丢失... 目录一、Redis 事务1.1 事务本质1.2 数据库事务与redis事务1.2.1 数据库事务1.

element-ui下拉输入框+resetFields无法回显的问题解决

《element-ui下拉输入框+resetFields无法回显的问题解决》本文主要介绍了在使用ElementUI的下拉输入框时,点击重置按钮后输入框无法回显数据的问题,具有一定的参考价值,感兴趣的... 目录描述原因问题重现解决方案方法一方法二总结描述第一次进入页面,不做任何操作,点击重置按钮,再进行下

解决mybatis-plus-boot-starter与mybatis-spring-boot-starter的错误问题

《解决mybatis-plus-boot-starter与mybatis-spring-boot-starter的错误问题》本文主要讲述了在使用MyBatis和MyBatis-Plus时遇到的绑定异常... 目录myBATis-plus-boot-starpythonter与mybatis-spring-b

mysql主从及遇到的问题解决

《mysql主从及遇到的问题解决》本文详细介绍了如何使用Docker配置MySQL主从复制,首先创建了两个文件夹并分别配置了`my.cnf`文件,通过执行脚本启动容器并配置好主从关系,文中还提到了一些... 目录mysql主从及遇到问题解决遇到的问题说明总结mysql主从及遇到问题解决1.基于mysql

如何测试计算机的内存是否存在问题? 判断电脑内存故障的多种方法

《如何测试计算机的内存是否存在问题?判断电脑内存故障的多种方法》内存是电脑中非常重要的组件之一,如果内存出现故障,可能会导致电脑出现各种问题,如蓝屏、死机、程序崩溃等,如何判断内存是否出现故障呢?下... 如果你的电脑是崩溃、冻结还是不稳定,那么它的内存可能有问题。要进行检查,你可以使用Windows 11

如何安装HWE内核? Ubuntu安装hwe内核解决硬件太新的问题

《如何安装HWE内核?Ubuntu安装hwe内核解决硬件太新的问题》今天的主角就是hwe内核(hardwareenablementkernel),一般安装的Ubuntu都是初始内核,不能很好地支... 对于追求系统稳定性,又想充分利用最新硬件特性的 Ubuntu 用户来说,HWEXBQgUbdlna(Har

MAVEN3.9.x中301问题及解决方法

《MAVEN3.9.x中301问题及解决方法》本文主要介绍了使用MAVEN3.9.x中301问题及解决方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面... 目录01、背景02、现象03、分析原因04、解决方案及验证05、结语本文主要是针对“构建加速”需求交