MCE errors

I’m on Cachy, but I’ve started noticing very similar MCE events since the end of March. My CPU is a 4 year old 5900X. It has been reporting a corrected error once every other month or so since I put it in, but has been fine otherwise.

In my case, I only started looking out for them after having a mishap while assembling a bed frame which hit my desk with enough force to crash my PC with a blue screen system fatal error.

Unfortunately for a while rasdaemon had not been capturing anything, so I can’t say for sure if they were happening before or just after.

Mar 31 01:37:38 system kernel: mce: [Hardware Error]: Machine check events logged
Mar 31 01:37:38 system kernel: [Hardware Error]: System Fatal error.
Mar 31 01:37:38 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC13_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffb44a8150
Mar 31 01:37:38 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Mar 31 01:37:38 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Mar 31 01:37:38 system kernel: [Hardware Error]: Bank 13 is reserved.
Mar 31 01:37:38 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

Mar 31 02:04:56 system kernel: mce: [Hardware Error]: Machine check events logged
Mar 31 02:04:56 system kernel: [Hardware Error]: Deferred error, no action required.
Mar 31 02:04:56 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC23_STATUS[-|-|-|-|-|-|Deferred|-|-]: 0x9090909090909090
Mar 31 02:04:56 system kernel: [Hardware Error]: IPID: 0x0000000000000000
Mar 31 02:04:56 system kernel: [Hardware Error]: Bank 23 is reserved.
Mar 31 02:04:56 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

Mar 31 03:32:19 system kernel: mce: [Hardware Error]: Machine check events logged
Mar 31 03:32:19 system kernel: [Hardware Error]: System Fatal error.
Mar 31 03:32:19 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC19_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|-|Poison|Scrub]: 0xffff8f2c87317600
Mar 31 03:32:19 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Mar 31 03:32:19 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Mar 31 03:32:19 system kernel: [Hardware Error]: Bank 19 is reserved.
Mar 31 03:32:19 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

Apr 05 06:42:07 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 05 06:42:07 system kernel: [Hardware Error]: Corrected error, no action required.
Apr 05 06:42:07 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC26_STATUS[-|CE|-|-|-|-|-|-|-]: 0x80000001e5cdd163
Apr 05 06:42:07 system kernel: [Hardware Error]: IPID: 0x0000000000000000
Apr 05 06:42:07 system kernel: [Hardware Error]: Bank 26 is reserved.
Apr 05 06:42:07 system kernel: [Hardware Error]: cache level: L3/GEN, tx: INSN

Apr 08 14:20:58 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 08 14:20:58 system kernel: [Hardware Error]: System Fatal error.
Apr 08 14:20:58 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC19_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffff8b53c4b0
Apr 08 14:20:58 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 08 14:20:58 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 08 14:20:58 system kernel: [Hardware Error]: Bank 19 is reserved.
Apr 08 14:20:58 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

Apr 13 04:51:25 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 13 04:51:25 system kernel: [Hardware Error]: System Fatal error.
Apr 13 04:51:25 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC17_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffffffffff
Apr 13 04:51:25 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 13 04:51:25 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 13 04:51:25 system kernel: [Hardware Error]: Bank 17 is reserved.
Apr 13 04:51:25 system kernel: [Hardware Error]: cache level: L3/GEN, tx: RESV

Apr 15 14:44:22 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 15 14:44:22 system kernel: [Hardware Error]: System Fatal error.
Apr 15 14:44:22 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC20_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffb7aa86c0
Apr 15 14:44:22 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 15 14:44:22 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 15 14:44:22 system kernel: [Hardware Error]: Bank 20 is reserved.
Apr 15 14:44:22 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

Apr 16 18:36:17 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 16 18:36:17 system kernel: [Hardware Error]: System Fatal error.
Apr 16 18:36:17 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC13_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffff00000096
Apr 16 18:36:17 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 16 18:36:17 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 16 18:36:17 system kernel: [Hardware Error]: Bank 13 is reserved.
Apr 16 18:36:17 system kernel: [Hardware Error]: cache level: L2, tx: DATA

Apr 20 02:04:56 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 20 02:04:56 system kernel: [Hardware Error]: System Fatal error.
Apr 20 02:04:56 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC18_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffad24fbd8
Apr 20 02:04:56 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 20 02:04:56 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 20 02:04:56 system kernel: [Hardware Error]: Bank 18 is reserved.
Apr 20 02:04:56 system kernel: [Hardware Error]: cache level: RESV, tx: GEN

Apr 20 18:48:45 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 20 18:48:45 system kernel: [Hardware Error]: System Fatal error.
Apr 20 18:48:45 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC18_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffb50b0860
Apr 20 18:48:45 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 20 18:48:45 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 20 18:48:45 system kernel: [Hardware Error]: Bank 18 is reserved.
Apr 20 18:48:45 system kernel: [Hardware Error]: cache level: RESV, mem/io: MEM, mem-tx: PRF, part-proc: SRC (no timeout)

Apr 24 01:27:22 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 24 01:27:22 system kernel: [Hardware Error]: System Fatal error.
Apr 24 01:27:22 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC11_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffaceb0cc0
Apr 24 01:27:22 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 24 01:27:22 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 24 01:27:22 system kernel: [Hardware Error]: Bank 11 is reserved.
Apr 24 01:27:22 system kernel: [Hardware Error]: cache level: RESV, mem/io: MEM, mem-tx: Wrong R4!, part-proc: OBS (no timeout)

Apr 26 08:50:33 system kernel: mce: [Hardware Error]: Machine check events logged
Apr 26 08:50:33 system kernel: [Hardware Error]: System Fatal error.
Apr 26 08:50:33 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC7_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffffffffff
Apr 26 08:50:33 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Apr 26 08:50:33 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Apr 26 08:50:33 system kernel: [Hardware Error]: Bank 7 is reserved.
Apr 26 08:50:33 system kernel: [Hardware Error]: cache level: L3/GEN, tx: RESV

May 02 08:24:23 system kernel: mce: [Hardware Error]: Machine check events logged
May 02 08:24:23 system kernel: [Hardware Error]: Corrected error, no action required.
May 02 08:24:23 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC21_STATUS[Over|CE|-|AddrV|PCC|-|-|-|-]: 0xc74800
May 02 08:24:23 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
May 02 08:24:23 system kernel: [Hardware Error]: IPID: 0x0000000000000000
May 02 08:24:23 system kernel: [Hardware Error]: Bank 21 is reserved.
May 02 08:24:23 system kernel: [Hardware Error]: cache level: RESV, tx: DATA

May 15 09:15:21 system kernel: mce: [Hardware Error]: Machine check events logged
May 15 09:15:21 system kernel: [Hardware Error]: System Fatal error.
May 15 09:15:21 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC20_STATUS[-|UE|-|-|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xb2a8ffff00000000
May 15 09:15:21 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
May 15 09:15:21 system kernel: [Hardware Error]: Bank 20 is reserved.
May 15 09:15:21 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

May 16 08:54:15 system kernel: mce: [Hardware Error]: Machine check events logged
May 16 08:54:15 system kernel: [Hardware Error]: System Fatal error.
May 16 08:54:15 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC12_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffffffffff
May 16 08:54:15 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
May 16 08:54:15 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
May 16 08:54:15 system kernel: [Hardware Error]: Bank 12 is reserved.
May 16 08:54:15 system kernel: [Hardware Error]: cache level: L3/GEN, tx: RESV
May 16 13:05:29 system kernel: mce: [Hardware Error]: Machine check events logged
May 16 13:05:29 system kernel: [Hardware Error]: System Fatal error.
May 16 13:05:29 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC9_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffb16b7470
May 16 13:05:29 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
May 16 13:05:29 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
May 16 13:05:29 system kernel: [Hardware Error]: Bank 9 is reserved.
May 16 13:05:29 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

Jun 03 09:45:11 system kernel: mce: [Hardware Error]: Machine check events logged
Jun 03 09:45:11 system kernel: [Hardware Error]: System Fatal error.
Jun 03 09:45:11 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC18_STATUS[-|UE|-|-|PCC|SyndV|UECC|-|Poison|-]: xb36ee8df89480d74
Jun 03 09:45:11 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Jun 03 09:45:11 system kernel: [Hardware Error]: Bank 18 is reserved.
Jun 03 09:45:11 system kernel: [Hardware Error]: cache level: RESV, mem/io: RESV, mem-tx: EV, part-proc: OBS (time out)

Jun 04 20:46:57 system kernel: mce: [Hardware Error]: Machine check events logged
Jun 04 20:46:57 system kernel: [Hardware Error]: System Fatal error.
Jun 04 20:46:57 system kernel: [Hardware Error]: CPU:1 (19:21:2) MC13_STATUS[Over|UE|MiscV|AddrV|PCC|SyndV|UECC|Deferred|Poison|Scrub]: 0xffffffffa52b74e0
Jun 04 20:46:57 system kernel: [Hardware Error]: Error Addr: 0x0000000000000000
Jun 04 20:46:57 system kernel: [Hardware Error]: IPID: 0x0000000000000000, Syndrome: 0x0000000000000000
Jun 04 20:46:57 system kernel: [Hardware Error]: Bank 13 is reserved.
Jun 04 20:46:57 system kernel: [Hardware Error]: cache level: RESV, tx: INSN

None of the supposed system fatal errors after the desk event have resulted in any observable crashes or issues otherwise.

Memtest86+ and y-cruncher stress tests pass without any problems. They happen seemingly randomly. Sometimes I’ll get one while gaming, or while completely idle. Then sometimes I’ll get some several days in a row or go a week or more without any.

I’ve already reseated every component and power cable. And unfortunately I don’t have any other CPUs to test against so I can’t do much else to rule out mine being a hardware fault at the moment.

You can try my solution, update the BIOS. I was getting about 1 MCE/week. It’s been 4 days since I updated, no errors yet :crossed_fingers:

Please don’t hijack another users topic about a ‘similar’ error.
While the problem is an MCE (almost 100% hardware error) there are other problems that can cause it. and each needs to be addressed independently.

Yours cannot be the same since you said you have different hardware and must be approached as a unique problem.

I am splitting your post and the replies to a new topic.

Is the cpu overheating?

@fatka Well, my BIOS is already on the latest release for my board. Hope that does it for yours, though.

@computersavvy Sorry. Was just throwing in my two cents, since the 0x0000000000000000 addresses seemed strange to me. Don’t mind if you delete this even, or whatever.

@barryascott Nope. Even full load at 145W only gets around 75c usually.

To identify the actual cause of the errors we need more info, specifically the content of the log for the actual mce event.
Those are spread across multiple banks in the CPU so I would hesitate to state they are directly cpu related, but the fact this seems to have begun (or at least exacerbated) by the impact while the machine was powered on could also indicate a potential defect in the mobo. A non-visible defect could be causing the MCE events.

If you are on workstation then the troubleshooter at the top center of your toolbar should lead you to the details.

I had a failing wifi card in the past that was giving machine checks because it would hang the cpu waiting for a response to a msg to the internet and it showed as MCE with a hung cpu. Various of the cores were involved so difficult to track down.

@fatka This was not split from your topic because of you but because @pancor had highjacked your thread. Please continue your own issue on the other topic since this one is for his system.

From the history, you could have an intermittent connection failure in a circuit trace or solder joint. Impact damage is more likely to affect add-on cards. One troubleshooting technique is to wiggle add-on cards to see if an MCE is triggered. You can use a source of hot air to gently heat add-on cards. You can also remove or disable add-on cards one at a time. You may need a way to run in headless mode using an ssh session. (If you don’t have access to another computer, you can run ssh sessions on portable devices. I use termius on an iPad).