家用矿机不出算力?完整故障排查圣经(2026)
Bitaxe、NerdQaxe、NerdAxe 和 NerdOctaxe 的所有故障汇于一册:读懂日志、破译红色报错行、修复供电、ASIC、WiFi 与矿池问题。
随便挑一天在任何家庭挖矿社区里搜一搜,你都会看到同样的帖子:Bitaxe 能开机却卡在 0 GH/s,NerdQaxe 每两分钟重启一次,Gamma 在固件升级后损失了一半算力,一台机器声称自己在哈希而矿池什么都看不到。这些设备是运行开源固件的开源硬件,跑在回收的工业级硅片上,而这个组合强大、便宜,同时也以家电永远不会有的方式真正脆弱。
这份指南就是我们每次帮别人排查时都希望存在的那本参考书。它覆盖了六个故障域,几乎能解释每一台变砖或不听话的设备;它教你像维修台那样读日志;最后以一张主症状表和一部你真正会遇到的报错行词典收尾。它适用于整个 AxeOS 家族:所有 Bitaxe(Max、Ultra、Supra、Gamma、Gamma 601/602、GT、Hex),NerdAxe 与 NerdQaxe 产品线(含 ++ 和 Hydro 变体),NerdOctaxe,以及由此延伸的任何 ESP-Miner 衍生机型,包括我们在 BM1373 时代参考 中介绍的新一批 BM1373 机器。
有一条原则要放在所有内容之前:先诊断,再动手。本指南的操作顺序是有讲究的,因为每一步都会排除掉一整类原因。当真正的问题是电源塌陷时却直接跳去重刷固件,会浪费你一个晚上,还可能让你从一个问题变成两个。
时间紧?五个解决大多数情况的办法
在读别的任何内容之前,先按顺序试这几条。它们合起来能解决大多数「我的矿机死了」的报告,不需要工具、不需要日志、也不需要拆开机壳。
1. 正确地做冷启动。
拔掉电源接头本身(不是墙上开关)。
数满 60 秒。再插回去。
为什么:稳压器故障会「锁存」,能熬过任何软件重启;
只有真正的断电才能清除它。
2. 确认到底是什么在给它供电。
USB-C 能点亮仪表盘,但无法驱动 ASIC。
只接 USB-C 的矿机会永远显示 0 GH/s 和约 2 W。
请确认真正的电源(DC 头 / XT30)已插好且插紧,
并且电压正确(5 V 与 12 V:接错会直接烧板)。
3. 明确输入 http:// 前缀。
浏览器会悄悄切换到 https:// 然后失败。
http://矿机IP —— 带前缀,每一次都要带。
4. 给它 2.4 GHz。
这些无线模块永远不说 5 GHz。在 mesh 路由器上,
建一个纯 2.4 GHz 的 SSID 或 IoT 网络,用 WPA2-AES,
并关闭 AP 隔离。
5. 问矿池,不要问矿机。
矿池面板上「距上一个被接受份额的时间」是唯一诚实的
在线检测。超过 10 分钟 = 此刻已死,不管矿机界面
怎么说。
解决了?好,关掉标签页。没解决?下面的分流会在 60 秒内
帮你找到对应章节。
快速定位你的问题
二十个章节确实不少。有三种方式直接跳到属于你的那一节:
用搜索:本指南里的每一条报错字符串都是逐字照抄的,与固件打印出来的一模一样。按 Ctrl+F(Mac 上是 Cmd+F),粘贴你的报错信息,就会直接落在它上面:这是刻意的设计,不是运气。
按症状:
| 你的情况 | 请前往 |
|---|---|
| 完全没反应,什么都不亮 | 供电问题 |
| 正常启动,算力恰好卡在零 | 供电问题(USB-C 陷阱、锁存故障) |
| 屏幕显示 FAIL 代码或卡在 SELF TEST | 自检 |
| 仪表盘显示 0 个 ASIC 芯片,或少于预期 | ASIC 问题 |
| 过热横幅、降频、风扇狂转 | 温度问题 |
| 连不上 WiFi,或仪表盘无法访问 | 网络问题 |
| WiFi 正常但矿池从未连上 / 份额被拒 | 矿池问题 |
| 固件升级后损坏 / 无法启动 | 固件问题 |
| 超频之后坏掉 | 超频抢救 |
| 每隔几分钟随机重启 | 供电问题(欠压) |
| 矿机说在哈希,矿池一片寂静 | 矿池问题,最后一个小节 |
| 你手上有一条来自日志的准确报错行 | 红色报错行词典 |
| 你有万用表,并且不怕动手 | PRO 维修台章节 |
| 你只想要所有官方资源的链接 | 资源库 |
按阅读方式:下一节把本指南分成新手路径和专业路径。
选择你的路径
这份指南服务两类非常不同的读者,你不该用同一种方式读它。
第一台矿机,第一个问题?请沿着编号路径走,一步都别跳过:两条安全规则、内置自检、60 秒分流,然后只看分流把你送去的那一节。每个代码块都可以直接复制粘贴,每个你可能不认识的术语都在下方的迷你词汇表里,而且新手路径上的任何内容都不需要拆开机壳或拥有万用表。
熟悉终端和万用表?这是你的快车道:API 章节用于远程抓日志和矿场巡检,红色报错行词典让你从一条报错字符串直接跳到原因,按型号列出的怪癖表,以及最后的专业维修台章节 —— 那里有原理图、测量点方法和板级资源。标记为 PRO 的章节默认你会读原理图,并能安全地在带电电路板上测量。
新手迷你词汇表
十个术语,每个十秒钟,之后本指南的其余部分读起来会快一倍。
ASIC 挖矿芯片本身 —— 唯一真正计算哈希的部件
ESP32 负责其他一切的小控制器:WiFi、仪表盘、
与 ASIC 通信
AxeOS 运行在 ESP32 上的固件 + 网页仪表盘
VCORE ASIC 核心约 1.0-1.3 V 的供电 ——
由板上从你的 5 V 或 12 V 输入生成
VRM / TPS546 产生 VCORE 的稳压电路,通过在故障时
关断来保护芯片
stratum 你的矿机与矿池对话所用的协议
份额 share 你提交的工作量证明;矿池靠数它来确认
你还活着
硬件错误率 芯片算「错」的结果占比 ——
最诚实的健康指标(保持在 2% 以下)
OTA 通过仪表盘的「空中」升级,相对于
USB 刷写而言
NVS 能熬过重刷的设置存储区 ——
这就是恢复出厂设置存在的理由
在一切之前:两条安全规则和一个内置工具
防止电路板报废的两条规则
规则一:绝不猜测电压。标准单芯片 Bitaxe 用 5 V;GT、Hex、NerdQaxe++ 和 NerdOctaxe 用 12 V。两个系列的 DC 插头在物理上可以互插,而把 12 V 电源接到 5 V 板上会在不到一秒内永久毁掉它。每次接线前,请看电源上的标签,而不是插头的形状。这是这个爱好里代价最高的单个错误。
规则二:接头发烫就意味着停止。温热是警告;发烫、变色或有塑料味,意味着立刻断电,并在下次通电前更换线缆。本指南里其他所有事情都可以等到明天。这件不行。
运行内置自检
AxeOS 自带一个上电自检,大多数用户根本不知道它的存在。它按顺序检查五个子系统,并把第一个失败项报告在屏幕上,因此它相当于一次免费的三十秒硬件诊断,直接告诉你出问题的域:
检查内容(按顺序) 失败时屏幕显示
输入电源轨 POWER FAIL
核心电压稳压器 VCORE FAIL
I2C 传感器总线 (测试中卡住)
风扇转速反馈 FAN FAIL
ASIC 检测 ASIC FAIL
短时哈希脉冲 HASHRATE FAIL
如何解读结果
POWER / VCORE FAIL -> 供电问题章节。该测试会拒绝
偏离标称值超过 10% 的输入 ——
去测你的电源。
ASIC FAIL -> ASIC 问题章节。
FAN FAIL -> 风扇未插、被卡住,或转速线已废。
HASHRATE FAIL -> 芯片被识别但不计算:通常是供电
临界或设置有问题;恢复出厂值。
如果自检本身卡住
屏幕停在 SELF TEST 超过 30 秒,或陷入 SELF TEST ->
重启的死循环:在 AxeOS v2.12+ 上,于 SELF TEST 画面
期间按住 BOOT 键 2 秒即可跳过并进入仪表盘,然后从那里
诊断。刷写后出现自检死循环,通常意味着刷错了板型镜像。
自检在首次启动时自动运行,也可以在设置里手动触发。任何硬件事件之后都请跑一遍:一次运输、一次散热器重装、一次电源更换。它能在你打开任何一份日志之前,就把「哪里不对劲」变成一个有名字的子系统。
屏幕在告诉你什么
在带屏机型上,OLED 是状态仪表,不是装饰。它每隔几秒轮换信息画面;BOOT 键可手动翻页,也能唤醒因超时而熄灭的屏幕。需要认识的几种状态:启动画面(固件活着)、配置热点画面(未配置或 WiFi 凭据丢失)、IP 地址画面(你通往仪表盘的大门)、上文的自检与 FAIL 代码、过热警告,以及我们希望你终有一天会遇到的「找到区块」动画。屏幕不亮并不能证明板子死了:先确认是不是单纯触发了屏幕熄灭超时,以及矿池是否仍在收到份额。
60 秒分流
在打开任何一份日志之前,先回答五个问题。它们会把整个问题空间切开。
Q1 有任何东西通电吗?(LED、屏幕、风扇)
否 -> 供电域。前往:供电问题。
是 -> Q2
Q2 设备能进入 AxeOS 仪表盘或显示 IP 吗?
否 -> Q2a:它在广播配置热点吗?
是 -> WiFi 域。前往:网络问题。
否 -> 启动域。前往:固件问题。
是 -> Q3
Q3 仪表盘显示的算力大于零吗?
否 -> Q3a:是否显示供电故障、过热横幅或 0 个
ASIC 芯片?
供电故障 -> 供电问题
过热 -> 温度问题
0 芯片 -> ASIC 问题
是 -> Q4
Q4 矿池在过去 10 分钟内有被接受的份额吗?
否 -> STRATUM 域。前往:矿池问题。
是 -> Q5
Q5 算力、错误率和温度都在应有的范围吗?
否 -> 温度问题,或超频失败。
是 -> 什么都没坏。关掉浏览器标签页。
注意 Q4 问的是矿池,不是设备。家庭挖矿里最常见的白费功夫,就是去调试一台界面看起来完美、而矿池已经一小时没听到它声音的矿机。设备和矿池各自只看到一半画面,本指南会一次又一次回到这个不对称性上。
如何读日志
只要你会读日志,本指南里其他所有事情都会更快,所以这一节排在前面。日志有两个界面,它们回答的是不同的问题。
AxeOS 网页日志
用矿机的 IP 地址打开仪表盘,找到日志视图。它实时显示运行日志:stratum 流量、份额提交、难度变更、温度事件。当设备能正常启动、而问题是「它现在在干什么」时,这就是正确的工具。它的局限:它在网络起来之后才开始,所以无法展示启动失败;它随网页服务器一起死掉,所以无法展示崩溃。
串口控制台:真相
凡是涉及启动、崩溃、ASIC 检测或 WiFi 关联的问题,你都需要串口控制台。这与开发者读的是同一份输出,而且从第一条指令就开始。
1. 用一根 USB-C 数据线(不是纯充电线)把矿机连到电脑。
在部分 Bitaxe 板子上,原生 USB-C 对 USB-C 的连接
会协商失败;请改用 USB-A 转 USB-C 的线或转接头,
它会强制走经典 5V。
2. 打开一个 115200 波特率、8N1 的串口终端:
Windows: PuTTY -> Serial -> COMx -> 115200
Linux: sudo minicom -D /dev/ttyACM0 -b 115200
(或:screen /dev/ttyACM0 115200)
macOS: screen /dev/tty.usbmodem* 115200
3. 按下板上的 RST 键(或重新插拔电源)。
完整的启动日志会从头滚动出来。
ESP-IDF 的日志行带有严重级别字母:I 表示信息,W 表示警告,E 表示错误。多数终端会把 E 行渲染成红色。健康的启动过程里 E 行数量为零。读日志的全部功夫就浓缩成这一句:把启动过程滚一遍,找到第一个 E,然后在本指南末尾的词典里查它。第一个错误最重要,因为后面的错误通常只是第一个的连锁伤害。
健康的启动长什么样
已加注释并做了删减。你的那份在细节上会不同,但必须按同样的顺序命中同样的里程碑。
rst:0x1 (POWERON_RESET), boot:0x8 (SPI_FAST_FLASH_BOOT)
<- 复位原因。POWERON 是正常的。此处反复出现
RTC_WDT 或 BROWNOUT 复位,就是你的第一个
警报信号。
I (xx) main: Found device config: <你的板型>
<- 固件识别出了板子。这里出现错误的型号名,
意味着刷错了固件镜像。
I (xx) TPS546: Found TPS546D24A (带 TPS 的板子)
I (xx) Power: VCORE set to 1150 mV
<- 核心稳压器通过 I2C 作出了应答,ASIC 电源轨
已建立。若这一段缺失或报错,后面的一切都不
可能工作。
I (xx) bm13xx: Found 1 chip(s)
<- 关键的那一行。这个数字必须等于你板子上的
芯片数:单芯片是 1,GT 是 2,NerdQaxe 是 4,
Hex 是 6,NerdOctaxe 是 8。
I (xx) wifi: connected, IP: 192.168.x.x
<- 网络已建立。关联失败会在此处打印原因代码
(词典见下文)。
I (xx) stratum_task: Connected to pool ...
I (xx) stratum_task: mining.subscribe / authorize OK
I (xx) stratum_task: Set difficulty to ...
I (xx) create_jobs_task: New Work: ...
<- 矿池接受了登录并下发了任务。
I (xx) asic_result: Nonce found, diff xxx of yyy
<- ASIC 正在返回结果。一到两分钟内,你应该看到
高于矿池难度的份额被提交并被接受。
请把里程碑顺序背下来:复位原因 → 板型配置 → 稳压器 → 芯片数 → WiFi → stratum → nonce。最先失败的那个里程碑,就是你需要的那一章的名字。
供电问题:一切故障的头号原因
如果家用矿机的故障有排行榜,供电会包揽前三名。这些板子用消费级电源、经消费级接头,把 3 纳米和 5 纳米的硅片跑在高电流下,余量非常紧张。
了解你的供电架构
单芯片 Bitaxe(Max/Ultra/Supra/Gamma)
输入: 5 V,经 DC 头(5.5x2.1mm)或 USB-C
电流: Gamma 出厂状态最高约 5 A,超频后更高
稳压器: TPS546D24A 数字降压(老板子:DS4432U DAC
+ INA260 监测),把 5V 降到约 1.1-1.3V 的
ASIC 核心电压,电流非常大
窗口: 稳压器约 4.8 V 启动,低于约 4.5 V 关断
12 V 系列(GT、Hex、NerdQaxe++、NerdOctaxe)
输入: 12 V,经 XT30 接头或 DC 头
电流: NerdQaxe++ 满载约 8+ A;Octaxe 更高
风险: 接头发热;电源在负载下塌陷
关键事实:当前 Bitaxe 板子上的 USB-C 只服务于 ESP32
和刷写。它无法驱动 ASIC。只靠 USB-C 供电的板子会正常
开机、显示仪表盘,然后以恰好 0 GH/s 的算力运行,功耗
约 2 W。这精确地模仿了一个损坏的稳压器,每周都在整个
社区里浪费掉大量时间。
Power Fault Detected:实际发生了什么
TPS546 稳压器监视四种保护:过流、过压、欠压、过温。任何一个触发时,稳压器都会锁存关断,AxeOS 随即显示供电故障横幅。ASIC 失去它的电源轨;单独供电的 ESP32 让界面继续活着。有两个事实决定了解决方式:
- 锁存能熬过软件重启。故障状态保存在稳压器自身的状态寄存器里,直到输入电压被物理移除为止。从网页界面重启、调用 restart API 或按下 ESP32 的复位键,都清不掉它。这是有文档记载的行为,不是 bug,这也正是 GitHub 上存在一整类 issue 的原因:BM1370 板子卡在 0 GH/s、功耗 5 W,restart 端点毫无作用,而一次拔电重启就解决全部问题。
- 触发是症状;原因在上游。稳压器保护的是一颗比它周围整块板子还贵的芯片。绝大多数反复触发都能追溯到输入供电,而不是稳压器本身。
按顺序执行的解决流程:
1. 冷启动。拔掉电源接头本身(不是墙上开关)。数满
10 秒。有些板子需要 60 秒,让大容量电容放完电、
并清除 ESP32 的欠压保持状态。再插回去。仅这一步
就能解决大多数偶发故障。
2. 拔掉 USB-C。如果 USB-C 口上插了东西,拔掉它,并
确认真正的电源(DC 头 / XT30)已经到位。排除上文
描述的 USB-C 陷阱。
3. 带载测量。万用表打到直流,接在输入接头上,
在矿机正在哈希的时候测:
5 V 板: 应稳定在 4.9-5.3 V。
低于 4.8 V = 问题出在电源。
12 V 板: 应稳定在 11.8-12.2 V。
低于 11.4 V = 问题出在电源。
空载测量什么都证明不了:劣质电源在空载时显示完美
的 5.0 V,一带载就塌到 4.4 V。
4. 排除线路。把电源直接插进墙上插座:不要插排、不要
延长线、不要串接。劣质插排会带来可测量的压降。
晃动 DC 头:如果屏幕闪烁,说明插座或线缆已磨损。
5. 升级电源。诚实的最低规格:
5 V 单芯片板: 优质 5 V / 5 A,独立供电
NerdQaxe++ 级 12 V:12 V / 10 A(120 W)起步
手机充电器和万能适配器是本指南中最常见的根本原因,
没有之一。
XT30 警告
12 V 系列会把 8 安培甚至更多电流推过一个 XT30。接头本身是按这个规格设计的;它后面那些手工焊接的引线往往不是。请检查:针脚变色、接头摸上去温热、虚焊、压接松动。8 安培下的高阻接点会发热、氧化、阻值变得更高、然后发热更多:这是家庭挖矿里唯一一种会以塑料熔化收场的失效模式。如果接头曾经热到变色,请更换线缆,不要继续使用。那些以电源错误加 Guru Meditation 代码崩溃的 NerdQaxe,正是追溯到这条在负载下塌陷的电源轨。
欠压:那个不是崩溃的崩溃
ESP32 有一个硬件欠压检测器。当 3.3 V 电源轨掉下去时,它会打印 Brownout detector was triggered 然后重启。一台每隔几分钟重启的矿机 —— 尤其是当 ASIC 拉到满载的时候 —— 几乎从来不是固件问题:是供电在峰值电流那一刻塌了。解决办法就是上面的第 3 到第 5 步。不要为了一个欠压死循环去追固件。
ASIC 问题:芯片不应答
启动日志里要盯的那一行是芯片数量。固件通过 UART 枚举 ASIC 链,并打印有多少颗芯片作出了应答。只要不是你板子的完整数量,就属于本章节。
检测到零颗芯片
仪表盘显示 ASIC 数量为 0,或日志显示初始化失败。按观察到的频率排序:
- 锁存的稳压器,或被保持的欠压状态。没有核心电压的芯片无法完成枚举。请在做任何其他事情之前先执行完整的 60 秒冷放电:拔掉主电源、USB-C 和所有配件,等满一分钟,再上电。仅这一步就能解决相当可观的一部分案例。
- 错误的固件镜像。哪怕只刷过一次别的板型镜像,也可能在非易失存储里留下错误的设备配置,并且能熬过后续的重刷。如果启动日志里的型号行与实际板子不符,请做一次完整的恢复出厂设置,然后再刷正确的镜像。BM1366 的镜像刷在 BM1370 板子上,永远找不到那颗芯片。
- 机械事件。经典的时间线是:设备被搬动过、摔过、寄送过,或散热器被重新拧紧过,然后就再也不出算力了。ASIC 底下是一片 BGA 焊球阵列;弯折会让它们开裂。散热器压装不均匀也会造成同样的后果。如果时间线对得上,这是维修台上的活(回流焊),不是设置问题。
- 出厂漏检。一台全新、一次都没出过算力的机器,属于生产虚焊的概率高得不成比例。别把一个周末花在软件上:做完冷放电和固件核对,就去走保修。
芯片数量不全:多芯片特征
Hex 报 6 里的 3,NerdQaxe 报 4 里的 2,GT 报 2 里的 1。多芯片板把 ASIC 当作一条链来枚举,所以任何一颗损坏或断连的芯片都会在链上的那个位置切断检测:这个数字大致告诉你断点在哪。一块四芯片板显示 2,说明问题出在第 3 颗芯片。原因与上文相同(供电余量、焊点开裂),另加一个多芯片特有的:链上有一颗弱芯片,只在更高频率下掉队。如果在出厂频率下数量恢复完整、但一超频就有芯片消失,你就找到了自己这场硅片彩票里最弱的那颗晶粒,而它的上限就是整块板子的上限。
I2C 错误:是传感器总线,不是矿机
有一类现象很让人困惑:矿机正常哈希,而 Power、ASIC Temp 和 Input Voltage 却显示为横杠、null 或零,同时日志出现 I2C 收发错误或超时。哈希路径(通往 ASIC 的 UART)和遥测路径(通往稳压器 PMBus、温度传感器、电流监测的 I2C)是两条独立总线。一条可以挂掉而另一条照常运行。已知触发条件:AxeOS v2.13/v2.14 附近的一段固件回归,在部分设备上让传感器读取路径静默失效。任何共用 I2C 接口的配件也会造成同样后果:后加的 OLED 或接触不良的外部传感器,都可能把总线锁住,让板载传感器无法工作。请把设备恢复到出厂状态,做一次冷启动;如果确实是那段固件回归,就往前升级或往回退一个版本。
危险的副作用:没有温度反馈,风扇曲线就无法工作,风扇会卡在某一个转速上。如果遥测已死,请把温度保护也当作已死来对待,在修好之前不要让设备无人看管地运行。
温度问题:热量是预算,不是事件
真正重要的数字
ASIC 核心温度 目标: 持续 55-62 C
需警惕: 持续高于 65 C
关断: 约 75 C -> 进入 Overheat 模式
VREG 温度 满载时比核心高 10-15 C;在 BM1370/BM1373
板子上,它往往才是限制性传感器,而不是核心
Overheat 模式 停止哈希,风扇拉到 100%,界面仍然存活;
当温度回落到约 65 C 时带迟滞退出
按模式诊断
冷机状态下立刻过热 —— 装配问题。散热器没有接触上:导热垫缺失或破损、硅脂干涸或根本没涂、拧紧力矩不均,或散热器在运输中松脱。一颗没有接触的芯片,会在几秒内从室温冲到关断阈值。请重新装配,涂一粒米大小的优质硅脂,对角交叉均匀拧紧螺丝。
10 到 30 分钟后过热 —— 散热能力问题。接触是好的,但系统排走热量的速度赶不上产生热量的速度。原因是叠加的:环境温度高于约 27 C、设备放在柜子、抽屉或封闭机箱里、进风或排风被挡住、鳍片上积了一层灰毡,或者做了一个散热系统从未被设计来承受的超频。请在两侧各留 10 厘米的自由空气、清理鳍片;如果是在改动频率之后开始的,那次改动就是过头了。
数周内缓慢漂移 —— 保养问题。设置没变,温度却一度一度往上爬:积灰,或导热硅脂正在干涸。这些板子上的硅脂属于消耗品;每 6 到 12 个月更换一次是正常的。
固件升级后过热 —— 曲线问题。风扇与温度曲线会在版本之间变化;v2.11 附近有一个有据可查的例子,把默认行为改动到让设备在出厂设置下运行温度高出好几度、速度略微下降。请阅读发行说明,手动把风扇转速调高一档,或者在你的固件提供 PID 控制时调整目标温度。
风扇本身
一个在任何温度下都报告 0 RPM 的风扇,要么没插、要么被线缆卡住、要么已经坏了。一个持续在 100% 尖叫的风扇,要么意味着芯片确实很烫(见上文),要么意味着温度遥测已死、曲线在盲目控制(见 I2C 章节)。40 毫米和 60 毫米的替换风扇都很便宜;高品质静音型号(社区的常见选择是猫头鹰 Noctua)能把噪音压到 40 dB 以下,是这些设备上性价比最高的硬件升级。
网络问题:ESP32 眼中的 WiFi 世界
这些机器里的无线模块只讲 2.4 GHz。不是 5 GHz,不是 6 GHz,没有例外,也没有固件补丁能改。极大比例的部署失败,都归结于这句话与现代路由器行为之间的冲突。
mesh 路由器问题
现代 mesh 系统广播单一的合并 SSID,并在频段之间引导客户端。ESP32 无法加入 5 GHz 那一侧,而频段引导可能让它无法在 2.4 GHz 上稳定下来。可靠的解决办法(多数路由器至少支持其中一种):
方案 A 建立一个纯 2.4 GHz 的 SSID(最佳)
方案 B 使用路由器的「IoT 网络」功能 —— 好几家厂商
正是为这类设备加入了它
方案 C 关闭频段引导 / 「smart connect」,让两个频段
显示为独立的 SSID
然后在 2.4 GHz 的 SSID 上核对:
安全性 WPA2-Personal,仅 AES(不要 TKIP,
纯 WPA3 网络会失败)
信道 在拥挤环境下固定为 1、6 或 11,不要 Auto
信道带宽 20 MHz
AP 隔离 关闭 <- 打开时 WiFi 能连上,但仪表盘
从你的局域网无法访问,这看起来
跟设备死机一模一样
MAC 过滤 关闭,或把矿机的 MAC 加进去
在串口日志里读 WiFi 失败
每次关联失败时,串口控制台都会打印一个断开原因,而这个原因就点明了解决方案:
AUTH_EXPIRE / auth failed 密码(PSK)错误。重新输入;
如果是从手机复制的,注意
排版用的弯引号。
NO_AP_FOUND SSID 在 2.4 GHz 上不可见:
频段引导、隐藏 SSID、
超出范围,或只有 5 GHz。
beacon timeout 信号太弱或信道拥挤;
移动设备位置或固定信道。
ASSOC_TOOMANY 路由器客户端数量已达上限。
Brownout detector triggered 这根本不是 WiFi 问题:无线
模块在关联时的电流尖峰把
弱电源拉塌了。去修供电,
不是修网络。
最后这一条值得强调:WiFi 发射是 ESP32 产生的最大瞬时负载尖峰。一个在空闲时勉强撑住的临界电源,会在关联那一刻死掉,所以一台「连 WiFi 时崩溃」的设备,通常是披着网络外衣的供电问题。
WiFi 没报错却仍然访问不到
有两个路由器安全功能值得特别提及,因为它们是按设计在拦截矿机。ASUS 的 AiProtection 和部分 TP-Link 型号上的等效功能,会把 stratum 流量判定为可疑并静默丢弃:矿机完美地连上了 WiFi,然后连不上任何矿池。如果一台设备能连 WiFi 但所有矿池连接都失败,而同一个矿池通过手机热点却能连上,那就先关掉路由器的这项防护功能或把矿机加入白名单,然后再去动别的任何东西。
还有一个会制造无数误报的浏览器怪癖:AxeOS 在 80 端口上提供的是普通 HTTP。现代浏览器会静默地把裸地址转换成 HTTPS,然后失败,于是矿机看起来像死了。请明确输入前缀:http:// 加在 IP 前面,每一次都要。如果仍然失败,换一个浏览器,并对本地地址关闭广告拦截插件。
如果矿机拿到了 IP 但你打不开仪表盘:AP 隔离(见上文)、路由器客户端列表的怪癖,或者 mDNS。设备会以 .local 主机名对外通告;当多台设备使用相同主机名时,现代固件会自动追加一个基于 MAC 的后缀,但你电脑上过期的 mDNS 缓存仍可能指向错误的设备。拿不准时,就用路由器 DHCP 表里的裸 IP,并给每台设备一个不同的主机名。
Stratum 与矿池问题:最后一公里
设备启动了,它在哈希,而矿池才是真相被裁定的地方。在这一节里,矿机侧的视角和矿池侧的视角必须放在一起读。
连接被拒绝或无法到达
按此顺序检查:
1. URL 精确性: stratum+tcp://主机:端口 —— 不要 https://,
不要结尾斜杠,端口必须存在且正确
2. DNS: 同一局域网里的另一台设备能解析这个主机吗?
某些运营商路由器和 DNS 过滤器(或 Pi-hole
之类的拦截器)会静默吞掉挖矿域名。
3. 端口: 某些网络会封锁不常见的出站端口。用手机
热点测试一下:如果那边能连,就是家里的
网络在过滤。
4. 矿池区域: 试试矿池的另一个区域节点 —— 你看到的可能
只是单一区域的故障。
authorize 失败
矿池拒绝了登录。在单人挖矿池里,用户名就是你的钱包地址加 worker 名称,而地址就是全部身份:这里没有账号可以打错。可能的原因:地址打错了一个字符(一个就够)、用了错误链的地址(见下文)、worker 名称里含空格或特殊字符,或者密码字段矿池要求非空(填 x)。
错误链的地址:沉默的杀手
这是多链 SHA-256 挖矿中危害最大的配置错误,而且它可能以两种不同方式失败:
- 吵闹的失败:矿池按链校验地址格式,拒绝 authorize 或拒绝每一个份额。烦人但安全:你几分钟内就会发现。
- 沉默的失败:一个在多条链上格式都合法的地址,或者一个不做深度校验的矿池,会一整天愉快地接受你的份额,然后收益无法抵达你手里。在非托管的单人挖矿池里,区块奖励是通过 coinbase 直接支付给你所配置的那串地址的。没有任何客服工单能撤回一笔已经支付到你无法动用的地址上的 coinbase。
规则是:地址必须是你所指向那条链的原生地址,由那条链的钱包生成并经过校验。如果你让同一台物理矿机在多条链之间轮换,请维护一张书面的「链 → 地址」对照表,并且每一次修改 stratum URL 时都重新核对用户名字段。这一条比本节其他所有建议加起来都更有价值。
被拒绝的份额:读懂拒绝原因
拒绝不是单一问题;日志里的原因字符串会告诉你,你遇到的是四类问题中的哪一类。
"job not found" / stale 你提交的是矿池已经替换掉的
在新区块之后以小簇形式 任务:在区块切换时属于正常。
出现 占总量 ~1-2% 以下:忽略。
持续更高:网络延迟或 WiFi
丢包 —— 检查 RSSI,试试更近
的矿池区域。
"above target" / 份额没有达到矿池分配的难度。
"low difficulty share" 持续出现的情况:难度变更后的
错位,或硬件错误污染了结果。
请检查硬件错误率。
"duplicate" 同一个 nonce 被提交了两次。
偶发:无害的重传产物。
成串出现:已知的故障状态,
ASIC 卡在一个 nonce 上循环 ——
芯片卡住了。做一次拔电重启;
如果在当前频率下反复出现,
就把超频降下来。
全部被拒 是配置,不是运气差:错误链的
地址、格式错误的 worker 名,
或错误的端口(例如为大型 ASIC
准备的高难度端口)。
硬件错误率:诚实的那个数字
仪表盘上的算力是一句声明;硬件错误率是一份供词。它统计的是 ASIC 返回了、但通不过校验的结果。低于 2% 是健康的。错误率随温度一起上升,说明是温度问题;温度不变、改完设置后错误率上升,说明频率与电压的组合已经超出了这颗芯片的硅片能力。一颗错误率 5% 的芯片可能显示着一个体面的算力数字,而你的有效算力却在悄悄跌到比降频还差的水平。调优时,请以每小时被接受的份额数为优化目标,绝不要以仪表盘上的数字为目标。完整方法见 BM1373 参考 的调优章节,关于份额难度含义的背景知识见 best share 解析。
「矿机说它在哈希,但矿池什么都没显示」
这是所有社区里被发帖次数最多的症状,所以这里给出完整的排查路径:
1. 矿池侧,距上一个被接受份额的时间:
超过 10 分钟 = 连接此刻已死,不管矿机界面怎么说。
仪表盘的平均值会在约一小时内衰减,从而掩盖刚发生的
掉线。「算力大于零」不是在线检测;「最近有份额」才是。
2. 矿机侧,实时日志:
份额有在提交吗?如果 ASIC 找到了 nonce 却没有任何东西
被提交,说明 stratum 套接字卡住了 —— 重启矿机。
提交是否在报错?请对照拒绝原因表。
3. 身份核对:你正盯着的那个矿池面板,是否按矿机所配置的
同一个钱包地址和同一个币种过滤?出人意料地多的案例
是:开着 BTC 面板而矿机指向 BCH,或者看的是昨天某个
测试地址的统计页。
4. 备用矿池:是否配置了备用矿池,而矿机悄悄切过去了?
你的算力可能正在流向另一个矿池。去查那边的统计。
永远配置备用矿池
AxeOS 家族的每一台设备都支持备用矿池。一台没有备用矿池的矿机,凌晨两点丢掉 stratum 套接字之后就什么也不做,直到你自己发现为止;而仪表盘上那条缓慢衰减的平均值,恰好保证了你会发现得很晚。请把备用矿池设置为你所用矿池的第二个区域,这样单一区域的问题永远不会让机器停摆。各条链按区域划分的主机与端口都在连接页面上。
固件问题:刷写、变砖、恢复
双文件 OTA 与「半砖」
AxeOS 的升级由两个产物构成:固件二进制文件和网页界面镜像(www.bin)。一个有据可查的失效模式是 OTA 卡在 www.bin 阶段,导致固件和界面失去同步:设备能启动、能挖矿,但仪表盘一片空白或者是坏的。这不是变砖。请直接访问恢复 URL:
http://<矿机ip>/recovery
然后重新上传网页镜像。如果升级失败后设备完全无法启动,USB 网页刷写工具(Chrome 或 Edge,配 USB-C 数据线)会重写完整的出厂镜像,几乎能救回任何软砖。有三条规则能让刷固件这件事变得无聊而不是吓人:
- 镜像必须与板子精确对应,精确到版本号。版本号就印在 PCB 上,也显示在 AxeOS 的系统区域:Supra 401 要用 401 的镜像,不是 402。请弄清发布页上的两种文件:完整的 esp-miner-factory-REV-vX.X.X.bin(引导加载程序 + 分区表 + 界面 + 固件,用于 USB 刷写和完整恢复),以及较小的 esp-miner.bin(仅固件,用于通过仪表盘做 OTA)。把两者用错位置,是经典的半砖配方。Gamma 的镜像刷 Gamma,Ultra 的刷 Ultra。错误的镜像可能在 NVS 里留下错误的设备配置,并熬过普通的重刷;解药是恢复出厂设置加上正确的镜像。
- 绝不要在信号勉强或供电勉强的情况下通过 WiFi 刷写。卡在 www.bin 阶段的现象,与这两种情况精确相关。
- 知道你的回退目标。回归是会发生的:v2.13/v2.14 附近的一段遥测失效、v2.11 附近的风扇曲线改动让设备跑得更热、v2.4.3 附近的某条升级路径在部分硬件版本上直接冻住直到用户降级为止。升级前请记下你当前的版本;如果新版本表现不佳,旧版本在项目发布页上只有一次网页刷写的距离。
崩溃死循环:读懂 Guru Meditation
Guru Meditation Error 就是 ESP32 的内核恐慌。括号里的那个词是线索:
Guru Meditation Error: Core X panic'ed (原因)
LoadProhibited / 固件 bug 访问了非法内存 —— 记下
StoreProhibited 版本号,查 issue 追踪器,回退一个
版本
IllegalInstruction 闪存损坏或栈被覆写 —— 通过 USB
做完整重刷
Cache error / 通常紧随 PSRAM 问题(见下文)
DoubleException
Interrupt wdt timeout 某个任务卡住了 —— 常与网络相关;
查一下你这个版本的已知 issue
孤立的一次 panic:忽略它。死循环:判断每次是不是同一个原因(固件或硬件故障:按表处理),还是中间夹杂着欠压消息(那就是供电问题:别再读 panic 了,去修电源)。
PSRAM 故障:Nerd 家族的专属问题
NerdQaxe、NerdOctaxe 以及其他基于 ESP32-S3-WROOM-1 模组的板子使用外部 PSRAM。启动横幅出现 PSRAM ID 读取错误或初始化失败,紧接着在固件一碰外部 RAM 时抛出 StoreProhibited panic —— 这有五个已知根源:没有 PSRAM 晶粒的假冒模组、以错误 PSRAM 模式(octal 而非 quad)编译的固件、模组下方的虚焊、初始化窗口期间的欠压,或者是老化的晶粒。实用的分流是:先排除供电(一如既往),刷写你这块板子对应的厂商精确镜像(它编码了正确的 PSRAM 模式),如果在供电干净、固件正确的前提下错误依旧存在,那就是模组本身的问题,属于保修或维修台的范畴。
超频翻车:抢救与预防
故障特征是:调高了频率或电压,现在设备会崩溃、在几分钟到几小时后算力归零、开始降频,或者多芯片板上有一颗芯片消失了。物理规律在一个特定方面毫不留情:频率过高造成的不稳定,往往要过一阵子才显现。一个熬过了 10 分钟测试的设置,可能在第 40 分钟、板子完全热透之后才失败,这正是为什么任何不足 24 小时的稳定性结论都只是暂定的。
抢救(如果设备还能启动):
网页界面 -> 把频率和电压恢复到出厂值 -> 保存 ->
冷启动(清除任何锁存的故障)。
抢救(如果它在你进入界面之前就陷入死循环):
通过 USB 刷写出厂镜像 —— 这会恢复出厂工作点。
之后再做恢复出厂设置以清空 NVS。
预防(整套方法就五行):
- 一次只加 25 MHz 一档,电压不动
- 每档至少 30 分钟,盯住硬件错误率
- 错误率超过 2% = 退回一档;那就是墙
- 只有到这时,如果你愿意接受额外发热,才以 25 mV
为步长提升电压;保持在 1100-1300 mV 区间内
- 在最终设置上跑满 24 小时,再说它稳定
还有一句实话:为了效率而降压,失败方式和为了速度而超频完全一样,只是方向相反 —— 相对于频率而言电压不足,会产生同样的错误和卡死。硅片彩票在两个边界上都有效。
通过 API 诊断:进阶用户的捷径
AxeOS 家族的每一台矿机都在 80 端口上开放了一套 REST API,这改变了故障排查的形态:不需要屏幕、不需要在仪表盘里点来点去,而且它能从一台设备扩展到整个矿场。完整规范位于 ESP-Miner 仓库的 openapi.yaml 文件里;下面这些是对诊断真正重要的调用。
五个诊断调用
# 一次拿全:算力均值、各处温度、电压、功耗、风扇转速、
# 份额、最佳难度、WiFi RSSI、运行时间、固件版本、堆内存
curl http://矿机IP/api/system/info
# ASIC 状态:型号、数量、频率、电压
curl http://矿机IP/api/system/asic
# 仪表盘图表所依据的时间序列
curl "http://矿机IP/api/system/statistics?columns=hashrate,asicTemp,vrTemp,power"
# 被低估的那一个:远程下载设备日志。
# 不用串口线,不用 PuTTY —— 通过网络把日志拉过来,
# 然后按下面词典里的红色报错行去筛。
curl http://矿机IP/api/system/logs
# 哪台是哪台?让设备自己表明身份(屏幕/LED)——
# 在一排一模一样的盒子里,这个功能价值连城
curl -X POST http://矿机IP/api/system/identify
那个日志端点值得单独说一句:只要设备启动到能提供 HTTP 服务的程度,本指南串口控制台章节的大部分内容,你都可以靠这一个调用在沙发上完成。串口线只在启动阶段故障和崩溃死循环时才仍然必需。
像技师一样读 /api/system/info
这个 JSON 里的六个字段,能在大多数问题被提出之前就把它们回答掉:
字段(常见名称) 它在告诉你什么
hashRate / hashrate_10m 那句「声明」—— 拿去和矿池对比
temp / asicTemp 温度章节里的 55-62 C 预算
vrTemp 稳压器那一侧 —— 在 BM1370/BM1373
上往往才是真正的限制项
voltage 输入电源轨在板子眼中的样子:一台
软件万用表。带载时跌破 4.9 V =
电源问题,不用拆机壳就能证明
power 实际功耗瓦数:一台「正在哈希」的
设备只有 2 W = USB-C 陷阱
sharesAccepted / 真相二人组;拒绝数在涨 = 去查
sharesRejected 拒绝原因表
wifiRSSI 强于 -70 dBm 算健康;更弱则能
解释过期份额
freeHeap 在数天内缓慢缩小 = 内存泄漏那一类
固件 bug;记下版本号,查追踪器
用一个循环检查矿场健康
只要超过一台设备,就别再一台台点仪表盘了。这个循环会为每台矿机打印一行健康摘要,并标出已经死掉的:
#!/bin/bash
# fleet-check.sh - 把 IP 改成你自己的矿机群
for IP in 192.168.1.101 192.168.1.102 192.168.1.103; do
J=$(curl -s -m 5 "http://$IP/api/system/info")
if [ -z "$J" ]; then
echo "$IP 无法连接"
continue
fi
echo "$J" | python3 -c "
import sys, json
d = json.load(sys.stdin)
print('$IP %-10s %6.1f GH/s %4.1fC %4.1fW acc:%s rej:%s' % (
d.get('hostname','?'),
d.get('hashRate',0),
d.get('temp',0),
d.get('power',0),
d.get('sharesAccepted','?'),
d.get('sharesRejected','?')))"
done
用 cron 每五分钟跑一次,把输出接到你喜欢的通知渠道,凌晨两点的一次故障就会变成两点零五分的一条告警,而不是早上起来的一个惊喜。字段名在不同固件版本间会略有差异;先把原始 JSON 打印一次,然后照着改。
API 也能修东西
# 不碰硬件就重启
curl -X POST http://矿机IP/api/system/restart
# (记住:这不会清除锁存的 TPS546 供电故障 ——
# 那个仍然需要物理拔电)
# 把一次超频实验拉回到理智的数值
curl -X PATCH http://矿机IP/api/system \
-H "Content-Type: application/json" \
-d '{"frequency": 525, "coreVoltage": 1150}'
# 不用网页界面就修好打错的矿池配置
curl -X PATCH http://矿机IP/api/system \
-H "Content-Type: application/json" \
-d '{"stratumUser": "你的钱包地址.worker1"}'
一句诚实的提醒:这套 API 没有任何身份验证。你局域网里的任何人都能读取并重新配置你的矿机。在家庭网络里这通常可以接受;但在共享网络或访客可进入的网络里,请把矿机放进独立的 VLAN 或 IoT 网段 —— 方便的是,这正好和 WiFi 章节已经推荐过的做法是同一件事。
按型号的怪癖:了解你这块板子的脾气
除了通用的失效模式之外,每个板型家族都有值得在动手排查之前先了解的特征行为。
| 型号 | 已知怪癖与特征 |
|---|---|
| Bitaxe Ultra / 早期板子 | USB-C 对 USB-C 的供电协商在某些主机接口上会失败;有据可查的解决办法是换一根普通的 USB-A 转 USB-C 线,它会强制走经典 5 V,救活那些看起来已经死掉的板子。 |
| Bitaxe Gamma 601/602 | 整个家族中电压容差最紧的型号:在勉强的电源下最容易显示 Power Fault Detected。601 在稳压器握手失败时,启动日志里有一个已知的 I2C device-ID 不匹配特征。600 系列的某些硬件版本会卡在特定的固件升级上,直到用户降级为止。 |
| Bitaxe GT | 双 BM1370:芯片数报 1 而不是 2,是焊点开裂或弱晶粒的经典特征。属于 12 V 系列:XT30 那套规则同样适用。 |
| Bitaxe Hex | 六芯片链:不完整的计数(1 到 5)可以定位链上的断点。这是对散热器沿板子拧紧力矩不均最敏感的型号。 |
| Bitaxe Touch | 带集成显示屏的型号;自检行为略有不同(为 Touch 配置增加了通过后自动重启)。屏幕不亮更多时候是超时而不是故障。 |
| NerdQaxe++ / NerdOctaxe | 带外部 PSRAM 的 ESP32-S3:PSRAM 初始化失败这一类故障是这个家族特有的。8+ A 经过 XT30:接头发热的警告在这里要加倍重视。电源故障会以带 PSU 错误码的 Guru Meditation 形式出现。 |
| Lucky Miner / 克隆机 | 运行的是改名后的 ESP-Miner 分支:本指南同样适用,但菜单名称会变,出厂镜像来自克隆机厂商而不是主仓库。把官方 AxeOS 刷到引脚定义不同的克隆机上可能直接变砖:请用厂商的镜像。 |
| BM1373 世代(Gaia、Nexus S1) | 同样的 AxeOS 血统、同样的故障类别,但硅片彩票更加激烈:早期回收芯片的个体差异更大,所以「按错误率调优」这条规则在这里更加重要。完整内容见 BM1373 参考。 |
主症状表
| 症状 | 最可能的原因 | 第一步动作 |
|---|---|---|
| 完全没反应,无 LED,无风扇 | 电源、线缆、DC 口或输入保护烧毁 | 用另一个负载测电源;在接头上测 5 V/12 V |
| 能启动,仪表盘正常,恰好 0 GH/s,功耗 ~2-5 W | 仅 USB-C 供电,或 TPS546 故障锁存 | 确认真正的电源已接;拔电冷启动 10-60 秒 |
| Power Fault Detected 横幅反复出现 | 电源在负载下塌陷 | 哈希时测输入电压;更换更好的电源 |
| 每隔几分钟重启,带载时更严重 | 欠压:电源或线缆处于临界 | 直插墙插座,换优质电源,日志里找 brownout 行 |
| 刚收到或刚搬动的设备 ASIC 数量为 0 | BGA 焊点开裂或出厂虚焊 | 60 秒放电;核对固件;然后走保修或维修台 |
| 多芯片板检测到的数量不完整 | 该芯片处链路断开;或超频下的弱晶粒 | 退回出厂频率;若数量恢复,那颗晶粒就是你的上限 |
| 哈希正常但温度/功耗/电压全是空值 | I2C 遥测路径挂掉(固件回归或配件) | 拆掉配件,冷启动,离开受影响的固件版本 |
| 冷机状态下几秒内就过热 | 散热器接触:硅脂、导热垫或装配 | 用新硅脂重装,对角交叉均匀拧紧 |
| 10-30 分钟后过热 | 散热能力:风道、环境温度、积灰、超频 | 两侧各留 10 厘米,清理鳍片,回退上一次超频 |
| 设置没变,温度却在数周内攀升 | 积灰或硅脂干涸 | 清理;重新涂硅脂(6-12 个月的消耗品) |
| 固件升级后立刻变得更热或更慢 | 该版本改动了风扇或温度曲线 | 读发行说明;调高风扇百分比,或回退版本 |
| 完全连不上 WiFi | 只可见 5 GHz / 频段引导 | 专用 2.4 GHz SSID;WPA2-AES;固定信道;20 MHz |
| WiFi 连上了,仪表盘却打不开 | AP 隔离或客户端隔离处于开启状态 | 关闭隔离;用 DHCP 表里的裸 IP |
| 恰好在关联 WiFi 那一刻崩溃 | 发射峰值时的电压跌落 | 去修供电;这不是网络问题 |
| stratum 连不上 | URL 或端口打错、DNS 过滤、端口被封 | 核对精确 URL;用手机热点测;换区域 |
| authorize 被拒绝 | 地址打错或链搞错,worker 名不合法 | 用正确的链重新生成地址;worker 名取简单些 |
| 只在区块切换时成簇出现拒绝 | 过期份额,少量属于正常 | 低于 ~2%:忽略。更高:延迟/WiFi 质量,换更近区域 |
| 大量重复份额被拒绝 | ASIC 卡在某个 nonce 上 | 拔电重启;若反复出现 = 降低超频 |
| 每一个份额都被拒绝 | 配置问题:链、地址或端口对不上 | 重新核对地址是否为该链原生,以及端口用途 |
| 矿机界面在哈希,矿池已静默超过 10 分钟 | 套接字已死、切到备用池,或看错了面板 | 按 stratum 章节的四步路径走 |
| 升级后仪表盘空白,但仍在挖矿 | OTA 卡住导致 www.bin 损坏 | 访问 /recovery,重新上传网页镜像 |
| 升级后无法启动 | OTA 失败 | 通过 USB 刷写出厂镜像;恢复出厂设置 |
| Guru Meditation 死循环,每次原因相同 | 固件 bug 或闪存损坏 | 记下原因;回退或重刷;查 issue 追踪器 |
| panic 死循环里夹杂着 brownout 行 | 是供电,不是固件 | 别再调试软件了;去修电源 |
| Nerd 系板子出现 PSRAM 错误后跟 StoreProhibited | PSRAM 初始化时的模组、模式、焊接或供电问题 | 干净供电 + 厂商精确镜像;否则走保修 |
| 稳定运行数小时后算力归零(超频时更糟) | 热透之后频率超出稳定点 | 降 25 MHz;重测 24 小时;这是已知的 issue 类别 |
| 屏幕卡在 SELF TEST 或显示 FAIL 代码 | 自检抓到了子系统故障 | 读 FAIL 代码;v2.12+ 按 BOOT 2 秒跳过;可能刷错镜像 |
| WiFi 正常,但任何矿池都连不上 | 路由器安全功能(AiProtection 一类)丢弃 stratum | 用手机热点测;在路由器里关闭或加白名单 |
| 仪表盘打不开,但矿机明显还活着 | 浏览器自动 HTTPS、广告拦截或 AP 隔离 | 明确输入 http://;换浏览器;检查隔离设置 |
| 空闲堆内存在数天内缩小,然后重启 | 固件里的内存泄漏一类问题 | 记下版本;查追踪器;升级或回退 |
| XT30 接头发烫或变色 | 8+ A 下的高阻接点 | 停。下次通电前更换线缆或接头 |
红色报错行词典
你真正会遇到的报错字符串,集中在一处,逐字照抄以便 Ctrl+F 能找到它们。找到你的那一行,就拿到了方向。
日志中的行 含义 -> 去哪一章
---------------------------------------------------------------
Brownout detector was triggered 供电塌陷 -> 供电
rst:0x.. (BROWNOUT_RESET) 同上,出现在复位横幅里
Power Fault Detected TPS546 锁存 -> 供电
TPS546 status / regulator fault 同一家族 -> 供电
VCORE init failed / 固件无法给稳压器编程:
device ID mismatch 镜像错误或 I2C 问题 ->
ASIC + 固件
i2c_master_transmit_receive err / 传感器总线挂掉 -> ASIC 章节
ESP_ERR_TIMEOUT near boot 的 I2C 小节
Found 0 chip(s) / ASIC init fail 芯片不应答 -> ASIC
Chip count N of M 链在 N+1 处断开 -> ASIC
Device has overheated / 75 C 关断 -> 温度
Overheat Mode
VREG temp over limit 稳压器过热 -> 温度
wifi: NO_AP_FOUND 2.4 GHz 可见性 -> 网络
wifi: AUTH_EXPIRE / auth fail 密码错误 -> 网络
wifi: beacon timeout 信号或信道质量差 -> 网络
wifi_disconnect reason: N 查一下 N;按原因解决
Stratum connection failed / 矿池无法到达 -> Stratum
connect errno
authorize failed 登录被拒 -> Stratum,
检查地址与 worker
job not found(提交时) 过期份额 -> Stratum
above target / low diff share 难度错位或硬件错误
duplicate share nonce 卡住 -> 拔电重启,
然后降频
Guru Meditation Error: (原因) panic -> 固件,读括号里
那个原因词
esp_psram: PSRAM ID read error / PSRAM 初始化 -> 固件,
Failed to init external RAM Nerd 家族小节
E (xx) esp_image: checksum failed 闪存损坏 -> USB 重刷
[www.bin / 升级后界面空白] 恢复 URL -> 固件
预防性维护:每月 15 分钟的例行仪式
上面几乎所有内容,预防的成本都比排查便宜。
每月
[ ] 灰尘:鳍片和风扇叶片(压缩空气,按住风扇别让它转)
[ ] 从矿池侧检查:接受与拒绝的趋势,硬件错误率是否
仍低于 2
[ ] 扫一眼温度:与上个月相比有没有漂移?
[ ] 用手摸一下电源接头:温热是警告,发烫是停止
每 6-12 个月
[ ] 更换导热硅脂(它是消耗品)
[ ] 检查 XT30 或 DC 头的针脚是否变色
[ ] 用万用表带载复测电源
每次固件升级时
[ ] 刷写之前先读发行说明
[ ] 记下当前版本(你的回退目标)
[ ] 在供电稳定时刷写,尽量靠近路由器
[ ] 事后复查矿池配置:升级可能重置某些字段
始终
[ ] 已配置备用矿池(第二个区域)
[ ] 整个矿场使用互不相同的 worker 名
[ ] 一张书面对照表:链 -> 钱包地址
[ ] 调优之前先记下出厂设置
当它真的是硬件问题:哪些可以修
你做了冷启动、恢复出厂设置、在验证过的供电下重刷了正确的镜像,故障依然存在。这就是硬件问题的定义。现实的维修地图如下:
- 维修台上可修(热风、显微镜、稳定的手,或者一位专业人士):损坏的 TPS546 或降压级元件、开裂的陶瓷电容、ASIC 或 ESP32 模组下方的虚焊(回流)、磨损的电源接头、坏掉的风扇。对任何一家 ASIC 维修台来说,这些都是常规活。
- 有时可以救回:5 V 电源轨对地短路的板子(断电状态下测得接近零欧姆)—— 不要再上电了;必须先找到并清除这个短路。
- 通常已判死刑:在没有散热器接触的情况下运行超过几秒的 ASIC、热失控之后的残局,或者在临时修 VRM 时被灌入错误核心电压的芯片。在单芯片板上,芯片占了绝大部分价值:过了某个临界点,换新比修划算。
社区支援在 OSMU 的 Discord 和 ESP-Miner 的 GitHub issue 追踪器上:在提交之前请先搜一下追踪器,因为「我的机器坏了」这类报告中有相当惊人的比例,其实是已知 issue,而且修复已经合入下一个版本。真要提交时,一份完整的报告能在几小时内得到回应,而一份含糊的报告会在沉默中死去。请复制这个模板:
板型: (精确型号 + 版本号,例如 Gamma 602)
固件: (AxeOS 版本,来自仪表盘或 /api/system/info)
电源: (电压、安培、品牌 —— 以及:是否带载测过?)
矿池: (URL + 端口 + 币种)
症状: (一句话:发生了什么,从什么时候开始)
触发条件: (紧接着发生之前改了什么:升级?运输?超频?
重装散热器?什么都没改?)
已尝试: (60 秒冷启动?恢复出厂?重刷?出厂频率?
自检结果如何?)
日志: (粘贴串口 115200 的启动日志,或
curl http://IP/api/system/logs 的输出 ——
至少要有第一条 E 行以及它前后各十行)
这个模板不是官僚主义:它恰好就是一家维修台最先收集的信息,而且顺序也一样。
PRO:维修台章节 —— 原理图、测量点与万用表
本章节默认你会读原理图,并能在带电电路板上测量而不会短接相邻引脚。如果这句话让你犹豫了,就在这里停下:这条线以上的所有内容都不需要拆开机壳就能解决,而一根打滑的表笔落在带电的 3 纳米板子上,会把一个问题变成两个。对其他人来说,这里正是开源硬件真正回报你的地方。
为什么这些板子与其他任何矿机都不同
Bitaxe 硬件采用 CERN-OHL-S 授权,用 KiCad 设计,而且每一份原理图、每一份 PCB 布线、每一份物料清单都是公开的。这意味着你永远不必猜某个元件是什么、某条电源轨走到哪里:你可以打开你这块板子确切版本的确切原理图,找到那条网络,然后去测它。没有哪个 Antminer 用户享受过这种特权。每个硬件仓库还带着一个几乎没人打开过的部分:按版本列出已知缺陷、返工方案和勘误的 HW issues 页面。在诊断任何板级故障之前,先查一下你的版本有没有已记录的勘误:相当惊人比例的「神秘」硬件故障,早就连同修复它们的改动一起写在那里了。
万用表方法:三条电源轨讲完整个故事
供电路径的故障可以用三次直流测量定位,按顺序进行。先接好地线参考,遵守次序,并在标注处带载测量。
电源轨 1 —— 输入(按系列为 5 V 或 12 V)
在哪测: 输入接头 / 输入焊盘(见原理图)
期望值: 5 V 系列: 哈希过程中 4.9 - 5.3 V
12 V 系列: 哈希过程中 11.8 - 12.2 V
仅带载时偏低 -> 电源或线缆(多数情况)
电源正常却读到 0 -> 输入保护烧毁,或下游短路:
断电状态下测对地电阻 ——
接近零欧姆 = 短路,停止上电,
去把它找出来
电源轨 2 —— 3.3 V(ESP32 的供电)
在哪测: 按原理图找 3.3 V 网络(ESP32 模组)
期望值: 稳定 3.2 - 3.4 V
输入正常却缺失 -> 那颗小的 3.3 V 稳压器或它的
外围无源元件:这能解释在电源确认良好的情况下
出现「完全没反应、USB 也不枚举」
电源轨 3 —— VCORE(ASIC 的供电)
在哪测: TPS546 降压级输出 / ASIC 核心网络
期望值: 大约 1.0 - 1.3 V,与 AxeOS 里设定的值一致
输入和 3.3 V 都正常却缺失 -> 降压级:可能是锁存的
故障(永远先做冷启动),也可能是 TPS546 / 电感 /
周边无源元件损坏
存在但数值不对 -> 稳压器编程或 PMBus 通信问题:
和 AxeOS 认为自己设定的值做交叉核对
确认性测量
输入接头 -> 稳压器输入的通断:可以找出断裂的走线
和开裂的 DC 口焊点
仪表盘上的 TPS546 晶粒温度对比手靠近的感觉:一个
空载时你都不敢靠近的稳压器,正在走向损坏
这三条电源轨能把任何供电故障切开:输入不良 = 问题在板子之前;输入良好而 3.3 V 不良 = 那颗小稳压器;两者都好而 VCORE 不良 = 降压级;三条都好 = 故障根本不在供电,回到 ASIC 章节。用一只二十美元的万用表花十分钟,就能取代几小时的猜测。
维修台能做什么,不能做什么
常规活(热风 + 显微镜 + 稳定的手)
- 更换 TPS546 或降压级元件
- 开裂的陶瓷电容(目视:一道细裂纹横穿本体;
电气:短路或开路)
- ASIC 或 ESP32 模组下方的 BGA 回流(跌落后和
重装后的那一类故障)
- 更换接头(磨损的 DC 口、烧糊的 XT30)
有耐心的话可行
- 追查 5 V 电源轨上的短路(热成像仪,或在可疑区域
用异丙醇蒸发的土办法)
- 更换 ESP32-S3 模组(之后需要重刷)
不划算 / 已判死刑
- 在单芯片板上更换 ASIC:芯片占了整块板子的绝大
部分价值,而供体芯片本来也是回收来的 —— 买块新板
在成本和确定性上都更划算
- 热失控之后,或整条电源轨被反极性输入过之后的
任何情况
像维修技师那样读原理图
有三个习惯能让公开原理图真正派上用场。第一,找到供电树那一页,在测任何东西之前先在纸上把从输入到 VCORE 的路径描一遍:从那一刻起,你就知道了每一个有能力干掉这条电源轨的元件。第二,把降压级的元件位号(R12、C34、U3)记下来:论坛帖子和勘误表都是按位号来指代元件的,而在打开布线文件的情况下,把它们对应到你的板子上只需要几秒钟。第三,当某个故障与版本相关时,去对比版本差异:比如说 Gamma 600 和 601 之间的变更日志,会精确告诉你设计者修了什么,而那往往恰好就是老版本上会坏的东西。
开源资源库
所有一手来源汇总成一张表。请把这一节加进收藏夹:开源硬件一半的价值就在于知道原件放在哪里,而下面每一个链接都是官方来源,不是镜像。
| 资源 | 它是什么 | 在哪里 |
|---|---|---|
| ESP-Miner / AxeOS 源码 | 固件本体,含 issue 追踪器:提交任何东西之前先在里面搜一遍 | github.com/bitaxeorg/ESP-Miner |
| 固件发布页 | 每个版本及其发行说明:你的回退目标和两种 .bin 文件 | ESP-Miner Releases |
| 官方网页刷写工具 | 浏览器里的 USB 刷写:任何软砖的救命工具 | bitaxeorg.github.io/bitaxe-web-flasher |
| API 规范 | 本指南里每一条 curl 命令背后的 openapi.yaml | ESP-Miner 中的 openapi.yaml |
| OSMU Wiki | 社区文档,含更易读的 API 参考 | osmu.wiki |
| Bitaxe 硬件总站 | 通往所有原理图、布线和物料清单的入口页 | bitaxe.org |
| 全部硬件仓库 | 按型号分的 KiCad 源文件:原理图、布线、BOM,以及 HW issues 与勘误页 | github.com/bitaxeorg |
| Gamma 原理图 | BM1370 单芯片板的文件与勘误 | bitaxeorg/bitaxeGamma |
| GT 原理图 | 双 BM1370 的 800 系列文件 | bitaxeorg/BitaxeGT |
| NerdQaxe 硬件与固件 | qaxe 项目:NerdQaxe 与 ++ 的源文件 | github.com/shufps/qaxe |
| NerdMiner v2 | 教学型矿机的固件家族 | github.com/BitMaker-hub/NerdMiner_v2 |
| TPS546D24A 数据手册 | 稳压器本身的手册:故障寄存器、PMBus、各项阈值 | ti.com/product/TPS546D24A |
| ESP-IDF 致命错误指南 | 乐鑫官方的解码表,涵盖每一个 Guru Meditation 原因 | ESP-IDF fatal errors |
| OSMU Discord | 开发在这里发生,人也在这里 | 经由 bitaxe.org |
要点总结
- 六个域覆盖了几乎所有故障:供电、ASIC、温度、网络、stratum、固件。60 秒分流会在你动手之前告诉你身处哪一个。
- 供电是头号原因,也是头号冒名顶替者:它会伪装成 WiFi 崩溃、固件 panic、卡住的芯片和报废的板子。在相信任何其他理论之前,先带载测输入电压。
- 锁存的稳压器故障能熬过任何软件重启。物理拔电 10 到 60 秒是一个真正的诊断步骤,不是迷信。
- USB-C 供的是 ESP32 的电,绝不是 ASIC 的。只接 USB-C 的板子能完美模仿一台 0 GH/s 的死矿机。
- 学会用 115200 波特率的串口控制台。启动日志里的第一条 E 行,比任何论坛帖子都更快地说出你的问题。
- 内置自检在 30 秒内说出出故障的子系统,REST API 则能通过网络送来日志、遥测甚至修复手段:在去找串口线之前,先用这两样。
- 永远不要把 12 V 电源接到 5 V 板子上。插头可以互换;板子不行。
- ESP32 只讲 2.4 GHz;频段引导和 AP 隔离是搞坏最多部署的两个路由器功能。
- 矿池侧的真相胜过矿机侧的乐观:距上一个被接受份额的时间是唯一诚实的在线检测,10 分钟就是那道门槛。
- 钱包地址必须是所挖那条链的原生地址。在非托管矿池里,这是唯一一个没有回头路的错误。
- 硬件错误率是诚实的性能数字;仪表盘算力只是一句声明。请以被接受的份额为调优目标,并且在称任何设置为稳定之前,先要求它跑满 24 小时。
- 发烫的电源接头,是唯一一个意味着「现在就停」而不是「以后再查」的症状。
本文整理自 ESP-Miner 的 issue 追踪器与发行说明、ESP-IDF 的致命错误文档、社区维修台的资料,以及在 Bitaxe、NerdAxe 和 NerdQaxe 社区中被反复报告的故障模式,截至 2026 年 7 月 20 日。此处描述的固件行为(故障锁存、过热阈值、恢复 URL、已知的回归版本区间)反映的是发布时的 AxeOS 与 ESP-Miner 版本;请对照你自己那个版本的发行说明。本指南作为持续更新的活文档维护:如果你遇到了这里没有覆盖的失效模式,请通过联系页面告诉我们,我们会把它补进去。
常见问题
设备明明通电了,为什么我的 Bitaxe 算力显示为 0?
按可能性排序,最常见的三个原因是:ASIC 失去了核心电压,因为 TPS546 稳压器锁存了一个故障;电源在负载下跌到 4.8 伏以下;或者矿机仅靠 USB-C 供电,这能让 ESP32 运行但无法驱动 ASIC。先做一次冷启动,物理拔掉电源线至少 10 秒,因为软件重启无法清除稳压器锁存的故障。
如何读取 Bitaxe 或 NerdQaxe 的日志?
有两种方式。AxeOS 网页界面的仪表盘里有实时日志视图。遇到启动问题时,用 USB-C 数据线连接电脑,打开 115200 波特率、8N1 的串口终端,然后按下 reset。完整的启动序列会滚动显示,包括芯片检测、WiFi 关联和矿池的首批消息。错误行带 E 前缀,在多数终端里显示为红色。
Bitaxe 上的 Power Fault Detected 是什么意思?
TPS546 核心稳压器触发了四种保护之一:过流、过压、欠压或过温,然后锁存关断。ASIC 失去供电,算力归零,而 ESP32 仍在运行。这个故障会一直锁存,直到输入电压被物理移除,所以要拔电整整 10 秒。如果反复出现,原因几乎总是电源在负载下塌陷,而不是电路板本身。
为什么我的矿机连不上 WiFi?
这些设备里的 ESP32 只支持 2.4 GHz WiFi,从不支持 5 GHz。在使用单一合并 SSID 的 mesh 系统中,频段引导可能把矿机推向 5 GHz,导致关联失败。请建立专用的 2.4 GHz SSID 或 IoT 网络,使用 WPA2-AES 而非 WPA3 或 TKIP,把信道带宽保持在 20 MHz,并确认已关闭 AP 隔离或客户端隔离,否则即使 WiFi 连上了,仪表盘依然无法访问。
矿池为什么拒绝我的份额?
拒绝可以归为几类。新区块出现后紧接着的一小簇拒绝属于过期任务,少量出现是无害的。持续拒绝并伴随硬件错误率上升,说明芯片超频超过了稳定频率,正在产生无效的 nonce。如果每一个份额都被拒绝,那通常是配置问题,绝大多数情况下是钱包地址与所挖的链不匹配。
矿机说它在哈希,但矿池面板什么都没有。谁在说谎?
通常两边都没说谎,答案藏在时间戳里。设备报告的是 ASIC 算出的东西;矿池报告的是真正抵达并通过验证的东西。请查看矿池侧「距上一个被接受份额的时间」:如果超过 10 分钟,连接实际上已经死了,哪怕矿机界面看起来还活着,因为仪表盘的算力平均值会在一小时内缓慢衰减,从而掩盖掉线。同时确认地址与币种匹配,且 worker 名称不含非法字符。
一台会随机重启的矿机,继续用安全吗?
先排查再决定。随机重启几乎总是 ESP32 的欠压检测器在供电塌陷时触发,这对 ASIC 无害,但意味着供电路径需要修复。但如果重启伴随着发烫的 XT30 接头、变色的针脚或焦糊味,请立即停止:8 安培下的高阻接点是真实的火灾风险,不是软件问题。
什么时候是硬件问题而非配置问题,哪些又是可以修的?
当故障熬过了冷启动、恢复出厂设置和干净的固件重刷,或者它出现在跌落、运输或重装散热器之后,就要怀疑硬件。稳压器损坏、ASIC 下方的虚焊、开裂的陶瓷电容,这些在维修台上用热风都能修。而一颗在没有散热器接触的情况下运行超过几秒的芯片,通常已经无法挽救。