家用矿机不出算力?完整故障排查圣经(2026)

Bitaxe、NerdQaxe、NerdAxe 和 NerdOctaxe 的所有故障汇于一册:读懂日志、破译红色报错行、修复供电、ASIC、WiFi 与矿池问题。

随便挑一天在任何家庭挖矿社区里搜一搜,你都会看到同样的帖子:Bitaxe 能开机却卡在 0 GH/s,NerdQaxe 每两分钟重启一次,Gamma 在固件升级后损失了一半算力,一台机器声称自己在哈希而矿池什么都看不到。这些设备是运行开源固件的开源硬件,跑在回收的工业级硅片上,而这个组合强大、便宜,同时也以家电永远不会有的方式真正脆弱。

这份指南就是我们每次帮别人排查时都希望存在的那本参考书。它覆盖了六个故障域,几乎能解释每一台变砖或不听话的设备;它教你像维修台那样读日志;最后以一张主症状表和一部你真正会遇到的报错行词典收尾。它适用于整个 AxeOS 家族:所有 Bitaxe(Max、Ultra、Supra、Gamma、Gamma 601/602、GT、Hex),NerdAxe 与 NerdQaxe 产品线(含 ++ 和 Hydro 变体),NerdOctaxe,以及由此延伸的任何 ESP-Miner 衍生机型,包括我们在 BM1373 时代参考 中介绍的新一批 BM1373 机器。

有一条原则要放在所有内容之前:先诊断,再动手。本指南的操作顺序是有讲究的,因为每一步都会排除掉一整类原因。当真正的问题是电源塌陷时却直接跳去重刷固件,会浪费你一个晚上,还可能让你从一个问题变成两个。

时间紧?五个解决大多数情况的办法

在读别的任何内容之前,先按顺序试这几条。它们合起来能解决大多数「我的矿机死了」的报告,不需要工具、不需要日志、也不需要拆开机壳。

1. 正确地做冷启动。
   拔掉电源接头本身(不是墙上开关)。
   数满 60 秒。再插回去。
   为什么:稳压器故障会「锁存」,能熬过任何软件重启;
   只有真正的断电才能清除它。

2. 确认到底是什么在给它供电。
   USB-C 能点亮仪表盘,但无法驱动 ASIC。
   只接 USB-C 的矿机会永远显示 0 GH/s 和约 2 W。
   请确认真正的电源(DC 头 / XT30)已插好且插紧,
   并且电压正确(5 V 与 12 V:接错会直接烧板)。

3. 明确输入 http:// 前缀。
   浏览器会悄悄切换到 https:// 然后失败。
   http://矿机IP —— 带前缀,每一次都要带。

4. 给它 2.4 GHz。
   这些无线模块永远不说 5 GHz。在 mesh 路由器上,
   建一个纯 2.4 GHz 的 SSID 或 IoT 网络,用 WPA2-AES,
   并关闭 AP 隔离。

5. 问矿池,不要问矿机。
   矿池面板上「距上一个被接受份额的时间」是唯一诚实的
   在线检测。超过 10 分钟 = 此刻已死,不管矿机界面
   怎么说。

解决了?好,关掉标签页。没解决?下面的分流会在 60 秒内
帮你找到对应章节。

快速定位你的问题

二十个章节确实不少。有三种方式直接跳到属于你的那一节:

用搜索:本指南里的每一条报错字符串都是逐字照抄的,与固件打印出来的一模一样。按 Ctrl+F(Mac 上是 Cmd+F),粘贴你的报错信息,就会直接落在它上面:这是刻意的设计,不是运气。

按症状:

你的情况请前往
完全没反应,什么都不亮供电问题
正常启动,算力恰好卡在零供电问题(USB-C 陷阱、锁存故障)
屏幕显示 FAIL 代码或卡在 SELF TEST自检
仪表盘显示 0 个 ASIC 芯片,或少于预期ASIC 问题
过热横幅、降频、风扇狂转温度问题
连不上 WiFi,或仪表盘无法访问网络问题
WiFi 正常但矿池从未连上 / 份额被拒矿池问题
固件升级后损坏 / 无法启动固件问题
超频之后坏掉超频抢救
每隔几分钟随机重启供电问题(欠压)
矿机说在哈希,矿池一片寂静矿池问题,最后一个小节
你手上有一条来自日志的准确报错行红色报错行词典
你有万用表,并且不怕动手PRO 维修台章节
你只想要所有官方资源的链接资源库

按阅读方式:下一节把本指南分成新手路径和专业路径。

选择你的路径

这份指南服务两类非常不同的读者,你不该用同一种方式读它。

第一台矿机,第一个问题?请沿着编号路径走,一步都别跳过:两条安全规则、内置自检、60 秒分流,然后只看分流把你送去的那一节。每个代码块都可以直接复制粘贴,每个你可能不认识的术语都在下方的迷你词汇表里,而且新手路径上的任何内容都不需要拆开机壳或拥有万用表。

熟悉终端和万用表?这是你的快车道:API 章节用于远程抓日志和矿场巡检,红色报错行词典让你从一条报错字符串直接跳到原因,按型号列出的怪癖表,以及最后的专业维修台章节 —— 那里有原理图、测量点方法和板级资源。标记为 PRO 的章节默认你会读原理图,并能安全地在带电电路板上测量。

新手迷你词汇表

十个术语,每个十秒钟,之后本指南的其余部分读起来会快一倍。

ASIC        挖矿芯片本身 —— 唯一真正计算哈希的部件
ESP32       负责其他一切的小控制器:WiFi、仪表盘、
            与 ASIC 通信
AxeOS       运行在 ESP32 上的固件 + 网页仪表盘
VCORE       ASIC 核心约 1.0-1.3 V 的供电 ——
            由板上从你的 5 V 或 12 V 输入生成
VRM / TPS546  产生 VCORE 的稳压电路,通过在故障时
            关断来保护芯片
stratum     你的矿机与矿池对话所用的协议
份额 share  你提交的工作量证明;矿池靠数它来确认
            你还活着
硬件错误率  芯片算「错」的结果占比 ——
            最诚实的健康指标(保持在 2% 以下)
OTA         通过仪表盘的「空中」升级,相对于
            USB 刷写而言
NVS         能熬过重刷的设置存储区 ——
            这就是恢复出厂设置存在的理由

在一切之前:两条安全规则和一个内置工具

防止电路板报废的两条规则

规则一:绝不猜测电压。标准单芯片 Bitaxe 用 5 V;GT、Hex、NerdQaxe++ 和 NerdOctaxe 用 12 V。两个系列的 DC 插头在物理上可以互插,而把 12 V 电源接到 5 V 板上会在不到一秒内永久毁掉它。每次接线前,请看电源上的标签,而不是插头的形状。这是这个爱好里代价最高的单个错误。

规则二:接头发烫就意味着停止。温热是警告;发烫、变色或有塑料味,意味着立刻断电,并在下次通电前更换线缆。本指南里其他所有事情都可以等到明天。这件不行。

运行内置自检

AxeOS 自带一个上电自检,大多数用户根本不知道它的存在。它按顺序检查五个子系统,并把第一个失败项报告在屏幕上,因此它相当于一次免费的三十秒硬件诊断,直接告诉你出问题的域:

检查内容(按顺序)            失败时屏幕显示
  输入电源轨                   POWER FAIL
  核心电压稳压器               VCORE FAIL
  I2C 传感器总线               (测试中卡住)
  风扇转速反馈                 FAN FAIL
  ASIC 检测                    ASIC FAIL
  短时哈希脉冲                 HASHRATE FAIL

如何解读结果
  POWER / VCORE FAIL   -> 供电问题章节。该测试会拒绝
                          偏离标称值超过 10% 的输入 ——
                          去测你的电源。
  ASIC FAIL            -> ASIC 问题章节。
  FAN FAIL             -> 风扇未插、被卡住,或转速线已废。
  HASHRATE FAIL        -> 芯片被识别但不计算:通常是供电
                          临界或设置有问题;恢复出厂值。

如果自检本身卡住
  屏幕停在 SELF TEST 超过 30 秒,或陷入 SELF TEST ->
  重启的死循环:在 AxeOS v2.12+ 上,于 SELF TEST 画面
  期间按住 BOOT 键 2 秒即可跳过并进入仪表盘,然后从那里
  诊断。刷写后出现自检死循环,通常意味着刷错了板型镜像。

自检在首次启动时自动运行,也可以在设置里手动触发。任何硬件事件之后都请跑一遍:一次运输、一次散热器重装、一次电源更换。它能在你打开任何一份日志之前,就把「哪里不对劲」变成一个有名字的子系统。

屏幕在告诉你什么

在带屏机型上,OLED 是状态仪表,不是装饰。它每隔几秒轮换信息画面;BOOT 键可手动翻页,也能唤醒因超时而熄灭的屏幕。需要认识的几种状态:启动画面(固件活着)、配置热点画面(未配置或 WiFi 凭据丢失)、IP 地址画面(你通往仪表盘的大门)、上文的自检与 FAIL 代码、过热警告,以及我们希望你终有一天会遇到的「找到区块」动画。屏幕不亮并不能证明板子死了:先确认是不是单纯触发了屏幕熄灭超时,以及矿池是否仍在收到份额。

60 秒分流

在打开任何一份日志之前,先回答五个问题。它们会把整个问题空间切开。

Q1  有任何东西通电吗?(LED、屏幕、风扇)
      否 -> 供电域。前往:供电问题。
      是 -> Q2

Q2  设备能进入 AxeOS 仪表盘或显示 IP 吗?
      否 -> Q2a:它在广播配置热点吗?
            是 -> WiFi 域。前往:网络问题。
            否 -> 启动域。前往:固件问题。
      是 -> Q3

Q3  仪表盘显示的算力大于零吗?
      否 -> Q3a:是否显示供电故障、过热横幅或 0 个
            ASIC 芯片?
            供电故障 -> 供电问题
            过热     -> 温度问题
            0 芯片   -> ASIC 问题
      是 -> Q4

Q4  矿池在过去 10 分钟内有被接受的份额吗?
      否 -> STRATUM 域。前往:矿池问题。
      是 -> Q5

Q5  算力、错误率和温度都在应有的范围吗?
      否 -> 温度问题,或超频失败。
      是 -> 什么都没坏。关掉浏览器标签页。

注意 Q4 问的是矿池,不是设备。家庭挖矿里最常见的白费功夫,就是去调试一台界面看起来完美、而矿池已经一小时没听到它声音的矿机。设备和矿池各自只看到一半画面,本指南会一次又一次回到这个不对称性上。

如何读日志

只要你会读日志,本指南里其他所有事情都会更快,所以这一节排在前面。日志有两个界面,它们回答的是不同的问题。

AxeOS 网页日志

用矿机的 IP 地址打开仪表盘,找到日志视图。它实时显示运行日志:stratum 流量、份额提交、难度变更、温度事件。当设备能正常启动、而问题是「它现在在干什么」时,这就是正确的工具。它的局限:它在网络起来之后才开始,所以无法展示启动失败;它随网页服务器一起死掉,所以无法展示崩溃。

串口控制台:真相

凡是涉及启动、崩溃、ASIC 检测或 WiFi 关联的问题,你都需要串口控制台。这与开发者读的是同一份输出,而且从第一条指令就开始。

1. 用一根 USB-C 数据线(不是纯充电线)把矿机连到电脑。
   在部分 Bitaxe 板子上,原生 USB-C 对 USB-C 的连接
   会协商失败;请改用 USB-A 转 USB-C 的线或转接头,
   它会强制走经典 5V。

2. 打开一个 115200 波特率、8N1 的串口终端:

   Windows:  PuTTY -> Serial -> COMx -> 115200
   Linux:    sudo minicom -D /dev/ttyACM0 -b 115200
             (或:screen /dev/ttyACM0 115200)
   macOS:    screen /dev/tty.usbmodem* 115200

3. 按下板上的 RST 键(或重新插拔电源)。
   完整的启动日志会从头滚动出来。

ESP-IDF 的日志行带有严重级别字母:I 表示信息,W 表示警告,E 表示错误。多数终端会把 E 行渲染成红色。健康的启动过程里 E 行数量为零。读日志的全部功夫就浓缩成这一句:把启动过程滚一遍,找到第一个 E,然后在本指南末尾的词典里查它。第一个错误最重要,因为后面的错误通常只是第一个的连锁伤害。

健康的启动长什么样

已加注释并做了删减。你的那份在细节上会不同,但必须按同样的顺序命中同样的里程碑。

rst:0x1 (POWERON_RESET), boot:0x8 (SPI_FAST_FLASH_BOOT)
        <- 复位原因。POWERON 是正常的。此处反复出现
           RTC_WDT 或 BROWNOUT 复位,就是你的第一个
           警报信号。

I (xx) main: Found device config: <你的板型>
        <- 固件识别出了板子。这里出现错误的型号名,
           意味着刷错了固件镜像。

I (xx) TPS546: Found TPS546D24A          (带 TPS 的板子)
I (xx) Power: VCORE set to 1150 mV
        <- 核心稳压器通过 I2C 作出了应答,ASIC 电源轨
           已建立。若这一段缺失或报错,后面的一切都不
           可能工作。

I (xx) bm13xx: Found 1 chip(s)
        <- 关键的那一行。这个数字必须等于你板子上的
           芯片数:单芯片是 1,GT 是 2,NerdQaxe 是 4,
           Hex 是 6,NerdOctaxe 是 8。

I (xx) wifi: connected, IP: 192.168.x.x
        <- 网络已建立。关联失败会在此处打印原因代码
           (词典见下文)。

I (xx) stratum_task: Connected to pool ...
I (xx) stratum_task: mining.subscribe / authorize OK
I (xx) stratum_task: Set difficulty to ...
I (xx) create_jobs_task: New Work: ...
        <- 矿池接受了登录并下发了任务。

I (xx) asic_result: Nonce found, diff xxx of yyy
        <- ASIC 正在返回结果。一到两分钟内,你应该看到
           高于矿池难度的份额被提交并被接受。

请把里程碑顺序背下来:复位原因 → 板型配置 → 稳压器 → 芯片数 → WiFi → stratum → nonce。最先失败的那个里程碑,就是你需要的那一章的名字。

供电问题:一切故障的头号原因

如果家用矿机的故障有排行榜,供电会包揽前三名。这些板子用消费级电源、经消费级接头,把 3 纳米和 5 纳米的硅片跑在高电流下,余量非常紧张。

了解你的供电架构

单芯片 Bitaxe(Max/Ultra/Supra/Gamma)
  输入:   5 V,经 DC 头(5.5x2.1mm)或 USB-C
  电流:   Gamma 出厂状态最高约 5 A,超频后更高
  稳压器: TPS546D24A 数字降压(老板子:DS4432U DAC
           + INA260 监测),把 5V 降到约 1.1-1.3V 的
           ASIC 核心电压,电流非常大
  窗口:   稳压器约 4.8 V 启动,低于约 4.5 V 关断

12 V 系列(GT、Hex、NerdQaxe++、NerdOctaxe)
  输入:   12 V,经 XT30 接头或 DC 头
  电流:   NerdQaxe++ 满载约 8+ A;Octaxe 更高
  风险:   接头发热;电源在负载下塌陷

关键事实:当前 Bitaxe 板子上的 USB-C 只服务于 ESP32
和刷写。它无法驱动 ASIC。只靠 USB-C 供电的板子会正常
开机、显示仪表盘,然后以恰好 0 GH/s 的算力运行,功耗
约 2 W。这精确地模仿了一个损坏的稳压器,每周都在整个
社区里浪费掉大量时间。

Power Fault Detected:实际发生了什么

TPS546 稳压器监视四种保护:过流、过压、欠压、过温。任何一个触发时,稳压器都会锁存关断,AxeOS 随即显示供电故障横幅。ASIC 失去它的电源轨;单独供电的 ESP32 让界面继续活着。有两个事实决定了解决方式:

  • 锁存能熬过软件重启。故障状态保存在稳压器自身的状态寄存器里,直到输入电压被物理移除为止。从网页界面重启、调用 restart API 或按下 ESP32 的复位键,都清不掉它。这是有文档记载的行为,不是 bug,这也正是 GitHub 上存在一整类 issue 的原因:BM1370 板子卡在 0 GH/s、功耗 5 W,restart 端点毫无作用,而一次拔电重启就解决全部问题。
  • 触发是症状;原因在上游。稳压器保护的是一颗比它周围整块板子还贵的芯片。绝大多数反复触发都能追溯到输入供电,而不是稳压器本身。

按顺序执行的解决流程:

1. 冷启动。拔掉电源接头本身(不是墙上开关)。数满
   10 秒。有些板子需要 60 秒,让大容量电容放完电、
   并清除 ESP32 的欠压保持状态。再插回去。仅这一步
   就能解决大多数偶发故障。

2. 拔掉 USB-C。如果 USB-C 口上插了东西,拔掉它,并
   确认真正的电源(DC 头 / XT30)已经到位。排除上文
   描述的 USB-C 陷阱。

3. 带载测量。万用表打到直流,接在输入接头上,
   在矿机正在哈希的时候测:
     5 V 板:  应稳定在 4.9-5.3 V。
               低于 4.8 V = 问题出在电源。
     12 V 板: 应稳定在 11.8-12.2 V。
               低于 11.4 V = 问题出在电源。
   空载测量什么都证明不了:劣质电源在空载时显示完美
   的 5.0 V,一带载就塌到 4.4 V。

4. 排除线路。把电源直接插进墙上插座:不要插排、不要
   延长线、不要串接。劣质插排会带来可测量的压降。
   晃动 DC 头:如果屏幕闪烁,说明插座或线缆已磨损。

5. 升级电源。诚实的最低规格:
     5 V 单芯片板:      优质 5 V / 5 A,独立供电
     NerdQaxe++ 级 12 V:12 V / 10 A(120 W)起步
   手机充电器和万能适配器是本指南中最常见的根本原因,
   没有之一。

XT30 警告

12 V 系列会把 8 安培甚至更多电流推过一个 XT30。接头本身是按这个规格设计的;它后面那些手工焊接的引线往往不是。请检查:针脚变色、接头摸上去温热、虚焊、压接松动。8 安培下的高阻接点会发热、氧化、阻值变得更高、然后发热更多:这是家庭挖矿里唯一一种会以塑料熔化收场的失效模式。如果接头曾经热到变色,请更换线缆,不要继续使用。那些以电源错误加 Guru Meditation 代码崩溃的 NerdQaxe,正是追溯到这条在负载下塌陷的电源轨。

欠压:那个不是崩溃的崩溃

ESP32 有一个硬件欠压检测器。当 3.3 V 电源轨掉下去时,它会打印 Brownout detector was triggered 然后重启。一台每隔几分钟重启的矿机 —— 尤其是当 ASIC 拉到满载的时候 —— 几乎从来不是固件问题:是供电在峰值电流那一刻塌了。解决办法就是上面的第 3 到第 5 步。不要为了一个欠压死循环去追固件。

ASIC 问题:芯片不应答

启动日志里要盯的那一行是芯片数量。固件通过 UART 枚举 ASIC 链,并打印有多少颗芯片作出了应答。只要不是你板子的完整数量,就属于本章节。

检测到零颗芯片

仪表盘显示 ASIC 数量为 0,或日志显示初始化失败。按观察到的频率排序:

  1. 锁存的稳压器,或被保持的欠压状态。没有核心电压的芯片无法完成枚举。请在做任何其他事情之前先执行完整的 60 秒冷放电:拔掉主电源、USB-C 和所有配件,等满一分钟,再上电。仅这一步就能解决相当可观的一部分案例。
  2. 错误的固件镜像。哪怕只刷过一次别的板型镜像,也可能在非易失存储里留下错误的设备配置,并且能熬过后续的重刷。如果启动日志里的型号行与实际板子不符,请做一次完整的恢复出厂设置,然后再刷正确的镜像。BM1366 的镜像刷在 BM1370 板子上,永远找不到那颗芯片。
  3. 机械事件。经典的时间线是:设备被搬动过、摔过、寄送过,或散热器被重新拧紧过,然后就再也不出算力了。ASIC 底下是一片 BGA 焊球阵列;弯折会让它们开裂。散热器压装不均匀也会造成同样的后果。如果时间线对得上,这是维修台上的活(回流焊),不是设置问题。
  4. 出厂漏检。一台全新、一次都没出过算力的机器,属于生产虚焊的概率高得不成比例。别把一个周末花在软件上:做完冷放电和固件核对,就去走保修。

芯片数量不全:多芯片特征

Hex 报 6 里的 3,NerdQaxe 报 4 里的 2,GT 报 2 里的 1。多芯片板把 ASIC 当作一条链来枚举,所以任何一颗损坏或断连的芯片都会在链上的那个位置切断检测:这个数字大致告诉你断点在哪。一块四芯片板显示 2,说明问题出在第 3 颗芯片。原因与上文相同(供电余量、焊点开裂),另加一个多芯片特有的:链上有一颗弱芯片,只在更高频率下掉队。如果在出厂频率下数量恢复完整、但一超频就有芯片消失,你就找到了自己这场硅片彩票里最弱的那颗晶粒,而它的上限就是整块板子的上限。

I2C 错误:是传感器总线,不是矿机

有一类现象很让人困惑:矿机正常哈希,而 Power、ASIC Temp 和 Input Voltage 却显示为横杠、null 或零,同时日志出现 I2C 收发错误或超时。哈希路径(通往 ASIC 的 UART)和遥测路径(通往稳压器 PMBus、温度传感器、电流监测的 I2C)是两条独立总线。一条可以挂掉而另一条照常运行。已知触发条件:AxeOS v2.13/v2.14 附近的一段固件回归,在部分设备上让传感器读取路径静默失效。任何共用 I2C 接口的配件也会造成同样后果:后加的 OLED 或接触不良的外部传感器,都可能把总线锁住,让板载传感器无法工作。请把设备恢复到出厂状态,做一次冷启动;如果确实是那段固件回归,就往前升级或往回退一个版本。

危险的副作用:没有温度反馈,风扇曲线就无法工作,风扇会卡在某一个转速上。如果遥测已死,请把温度保护也当作已死来对待,在修好之前不要让设备无人看管地运行。

温度问题:热量是预算,不是事件

真正重要的数字

ASIC 核心温度   目标:    持续 55-62 C
                需警惕:  持续高于 65 C
                关断:    约 75 C -> 进入 Overheat 模式

VREG 温度       满载时比核心高 10-15 C;在 BM1370/BM1373
                板子上,它往往才是限制性传感器,而不是核心

Overheat 模式   停止哈希,风扇拉到 100%,界面仍然存活;
                当温度回落到约 65 C 时带迟滞退出

按模式诊断

冷机状态下立刻过热 —— 装配问题。散热器没有接触上:导热垫缺失或破损、硅脂干涸或根本没涂、拧紧力矩不均,或散热器在运输中松脱。一颗没有接触的芯片,会在几秒内从室温冲到关断阈值。请重新装配,涂一粒米大小的优质硅脂,对角交叉均匀拧紧螺丝。

10 到 30 分钟后过热 —— 散热能力问题。接触是好的,但系统排走热量的速度赶不上产生热量的速度。原因是叠加的:环境温度高于约 27 C、设备放在柜子、抽屉或封闭机箱里、进风或排风被挡住、鳍片上积了一层灰毡,或者做了一个散热系统从未被设计来承受的超频。请在两侧各留 10 厘米的自由空气、清理鳍片;如果是在改动频率之后开始的,那次改动就是过头了。

数周内缓慢漂移 —— 保养问题。设置没变,温度却一度一度往上爬:积灰,或导热硅脂正在干涸。这些板子上的硅脂属于消耗品;每 6 到 12 个月更换一次是正常的。

固件升级后过热 —— 曲线问题。风扇与温度曲线会在版本之间变化;v2.11 附近有一个有据可查的例子,把默认行为改动到让设备在出厂设置下运行温度高出好几度、速度略微下降。请阅读发行说明,手动把风扇转速调高一档,或者在你的固件提供 PID 控制时调整目标温度。

风扇本身

一个在任何温度下都报告 0 RPM 的风扇,要么没插、要么被线缆卡住、要么已经坏了。一个持续在 100% 尖叫的风扇,要么意味着芯片确实很烫(见上文),要么意味着温度遥测已死、曲线在盲目控制(见 I2C 章节)。40 毫米和 60 毫米的替换风扇都很便宜;高品质静音型号(社区的常见选择是猫头鹰 Noctua)能把噪音压到 40 dB 以下,是这些设备上性价比最高的硬件升级。

网络问题:ESP32 眼中的 WiFi 世界

这些机器里的无线模块只讲 2.4 GHz。不是 5 GHz,不是 6 GHz,没有例外,也没有固件补丁能改。极大比例的部署失败,都归结于这句话与现代路由器行为之间的冲突。

mesh 路由器问题

现代 mesh 系统广播单一的合并 SSID,并在频段之间引导客户端。ESP32 无法加入 5 GHz 那一侧,而频段引导可能让它无法在 2.4 GHz 上稳定下来。可靠的解决办法(多数路由器至少支持其中一种):

方案 A  建立一个纯 2.4 GHz 的 SSID(最佳)
方案 B  使用路由器的「IoT 网络」功能 —— 好几家厂商
        正是为这类设备加入了它
方案 C  关闭频段引导 / 「smart connect」,让两个频段
        显示为独立的 SSID

然后在 2.4 GHz 的 SSID 上核对:
  安全性     WPA2-Personal,仅 AES(不要 TKIP,
             纯 WPA3 网络会失败)
  信道       在拥挤环境下固定为 1、6 或 11,不要 Auto
  信道带宽   20 MHz
  AP 隔离    关闭 <- 打开时 WiFi 能连上,但仪表盘
             从你的局域网无法访问,这看起来
             跟设备死机一模一样
  MAC 过滤   关闭,或把矿机的 MAC 加进去

在串口日志里读 WiFi 失败

每次关联失败时,串口控制台都会打印一个断开原因,而这个原因就点明了解决方案:

AUTH_EXPIRE / auth failed      密码(PSK)错误。重新输入;
                               如果是从手机复制的,注意
                               排版用的弯引号。
NO_AP_FOUND                    SSID 在 2.4 GHz 上不可见:
                               频段引导、隐藏 SSID、
                               超出范围,或只有 5 GHz。
beacon timeout                 信号太弱或信道拥挤;
                               移动设备位置或固定信道。
ASSOC_TOOMANY                  路由器客户端数量已达上限。
Brownout detector triggered    这根本不是 WiFi 问题:无线
                               模块在关联时的电流尖峰把
                               弱电源拉塌了。去修供电,
                               不是修网络。

最后这一条值得强调:WiFi 发射是 ESP32 产生的最大瞬时负载尖峰。一个在空闲时勉强撑住的临界电源,会在关联那一刻死掉,所以一台「连 WiFi 时崩溃」的设备,通常是披着网络外衣的供电问题。

WiFi 没报错却仍然访问不到

有两个路由器安全功能值得特别提及,因为它们是按设计在拦截矿机。ASUS 的 AiProtection 和部分 TP-Link 型号上的等效功能,会把 stratum 流量判定为可疑并静默丢弃:矿机完美地连上了 WiFi,然后连不上任何矿池。如果一台设备能连 WiFi 但所有矿池连接都失败,而同一个矿池通过手机热点却能连上,那就先关掉路由器的这项防护功能或把矿机加入白名单,然后再去动别的任何东西。

还有一个会制造无数误报的浏览器怪癖:AxeOS 在 80 端口上提供的是普通 HTTP。现代浏览器会静默地把裸地址转换成 HTTPS,然后失败,于是矿机看起来像死了。请明确输入前缀:http:// 加在 IP 前面,每一次都要。如果仍然失败,换一个浏览器,并对本地地址关闭广告拦截插件。

如果矿机拿到了 IP 但你打不开仪表盘:AP 隔离(见上文)、路由器客户端列表的怪癖,或者 mDNS。设备会以 .local 主机名对外通告;当多台设备使用相同主机名时,现代固件会自动追加一个基于 MAC 的后缀,但你电脑上过期的 mDNS 缓存仍可能指向错误的设备。拿不准时,就用路由器 DHCP 表里的裸 IP,并给每台设备一个不同的主机名。

Stratum 与矿池问题:最后一公里

设备启动了,它在哈希,而矿池才是真相被裁定的地方。在这一节里,矿机侧的视角和矿池侧的视角必须放在一起读。

连接被拒绝或无法到达

按此顺序检查:
1. URL 精确性: stratum+tcp://主机:端口 —— 不要 https://,
                不要结尾斜杠,端口必须存在且正确
2. DNS:        同一局域网里的另一台设备能解析这个主机吗?
                某些运营商路由器和 DNS 过滤器(或 Pi-hole
                之类的拦截器)会静默吞掉挖矿域名。
3. 端口:       某些网络会封锁不常见的出站端口。用手机
                热点测试一下:如果那边能连,就是家里的
                网络在过滤。
4. 矿池区域:   试试矿池的另一个区域节点 —— 你看到的可能
                只是单一区域的故障。

authorize 失败

矿池拒绝了登录。在单人挖矿池里,用户名就是你的钱包地址加 worker 名称,而地址就是全部身份:这里没有账号可以打错。可能的原因:地址打错了一个字符(一个就够)、用了错误链的地址(见下文)、worker 名称里含空格或特殊字符,或者密码字段矿池要求非空(填 x)。

错误链的地址:沉默的杀手

这是多链 SHA-256 挖矿中危害最大的配置错误,而且它可能以两种不同方式失败:

  • 吵闹的失败:矿池按链校验地址格式,拒绝 authorize 或拒绝每一个份额。烦人但安全:你几分钟内就会发现。
  • 沉默的失败:一个在多条链上格式都合法的地址,或者一个不做深度校验的矿池,会一整天愉快地接受你的份额,然后收益无法抵达你手里。在非托管的单人挖矿池里,区块奖励是通过 coinbase 直接支付给你所配置的那串地址的。没有任何客服工单能撤回一笔已经支付到你无法动用的地址上的 coinbase。

规则是:地址必须是你所指向那条链的原生地址,由那条链的钱包生成并经过校验。如果你让同一台物理矿机在多条链之间轮换,请维护一张书面的「链 → 地址」对照表,并且每一次修改 stratum URL 时都重新核对用户名字段。这一条比本节其他所有建议加起来都更有价值。

被拒绝的份额:读懂拒绝原因

拒绝不是单一问题;日志里的原因字符串会告诉你,你遇到的是四类问题中的哪一类。

"job not found" / stale       你提交的是矿池已经替换掉的
  在新区块之后以小簇形式      任务:在区块切换时属于正常。
  出现                        占总量 ~1-2% 以下:忽略。
                              持续更高:网络延迟或 WiFi
                              丢包 —— 检查 RSSI,试试更近
                              的矿池区域。

"above target" /              份额没有达到矿池分配的难度。
"low difficulty share"        持续出现的情况:难度变更后的
                              错位,或硬件错误污染了结果。
                              请检查硬件错误率。

"duplicate"                   同一个 nonce 被提交了两次。
                              偶发:无害的重传产物。
                              成串出现:已知的故障状态,
                              ASIC 卡在一个 nonce 上循环 ——
                              芯片卡住了。做一次拔电重启;
                              如果在当前频率下反复出现,
                              就把超频降下来。

全部被拒                      是配置,不是运气差:错误链的
                              地址、格式错误的 worker 名,
                              或错误的端口(例如为大型 ASIC
                              准备的高难度端口)。

硬件错误率:诚实的那个数字

仪表盘上的算力是一句声明;硬件错误率是一份供词。它统计的是 ASIC 返回了、但通不过校验的结果。低于 2% 是健康的。错误率随温度一起上升,说明是温度问题;温度不变、改完设置后错误率上升,说明频率与电压的组合已经超出了这颗芯片的硅片能力。一颗错误率 5% 的芯片可能显示着一个体面的算力数字,而你的有效算力却在悄悄跌到比降频还差的水平。调优时,请以每小时被接受的份额数为优化目标,绝不要以仪表盘上的数字为目标。完整方法见 BM1373 参考 的调优章节,关于份额难度含义的背景知识见 best share 解析

「矿机说它在哈希,但矿池什么都没显示」

这是所有社区里被发帖次数最多的症状,所以这里给出完整的排查路径:

1. 矿池侧,距上一个被接受份额的时间:
   超过 10 分钟 = 连接此刻已死,不管矿机界面怎么说。
   仪表盘的平均值会在约一小时内衰减,从而掩盖刚发生的
   掉线。「算力大于零」不是在线检测;「最近有份额」才是。

2. 矿机侧,实时日志:
   份额有在提交吗?如果 ASIC 找到了 nonce 却没有任何东西
   被提交,说明 stratum 套接字卡住了 —— 重启矿机。
   提交是否在报错?请对照拒绝原因表。

3. 身份核对:你正盯着的那个矿池面板,是否按矿机所配置的
   同一个钱包地址和同一个币种过滤?出人意料地多的案例
   是:开着 BTC 面板而矿机指向 BCH,或者看的是昨天某个
   测试地址的统计页。

4. 备用矿池:是否配置了备用矿池,而矿机悄悄切过去了?
   你的算力可能正在流向另一个矿池。去查那边的统计。

永远配置备用矿池

AxeOS 家族的每一台设备都支持备用矿池。一台没有备用矿池的矿机,凌晨两点丢掉 stratum 套接字之后就什么也不做,直到你自己发现为止;而仪表盘上那条缓慢衰减的平均值,恰好保证了你会发现得很晚。请把备用矿池设置为你所用矿池的第二个区域,这样单一区域的问题永远不会让机器停摆。各条链按区域划分的主机与端口都在连接页面上。

固件问题:刷写、变砖、恢复

双文件 OTA 与「半砖」

AxeOS 的升级由两个产物构成:固件二进制文件和网页界面镜像(www.bin)。一个有据可查的失效模式是 OTA 卡在 www.bin 阶段,导致固件和界面失去同步:设备能启动、能挖矿,但仪表盘一片空白或者是坏的。这不是变砖。请直接访问恢复 URL:

http://<矿机ip>/recovery

然后重新上传网页镜像。如果升级失败后设备完全无法启动,USB 网页刷写工具(Chrome 或 Edge,配 USB-C 数据线)会重写完整的出厂镜像,几乎能救回任何软砖。有三条规则能让刷固件这件事变得无聊而不是吓人:

  • 镜像必须与板子精确对应,精确到版本号。版本号就印在 PCB 上,也显示在 AxeOS 的系统区域:Supra 401 要用 401 的镜像,不是 402。请弄清发布页上的两种文件:完整的 esp-miner-factory-REV-vX.X.X.bin(引导加载程序 + 分区表 + 界面 + 固件,用于 USB 刷写和完整恢复),以及较小的 esp-miner.bin(仅固件,用于通过仪表盘做 OTA)。把两者用错位置,是经典的半砖配方。Gamma 的镜像刷 Gamma,Ultra 的刷 Ultra。错误的镜像可能在 NVS 里留下错误的设备配置,并熬过普通的重刷;解药是恢复出厂设置加上正确的镜像。
  • 绝不要在信号勉强或供电勉强的情况下通过 WiFi 刷写。卡在 www.bin 阶段的现象,与这两种情况精确相关。
  • 知道你的回退目标。回归是会发生的:v2.13/v2.14 附近的一段遥测失效、v2.11 附近的风扇曲线改动让设备跑得更热、v2.4.3 附近的某条升级路径在部分硬件版本上直接冻住直到用户降级为止。升级前请记下你当前的版本;如果新版本表现不佳,旧版本在项目发布页上只有一次网页刷写的距离。

崩溃死循环:读懂 Guru Meditation

Guru Meditation Error 就是 ESP32 的内核恐慌。括号里的那个词是线索:

Guru Meditation Error: Core X panic'ed (原因)

LoadProhibited /       固件 bug 访问了非法内存 —— 记下
StoreProhibited        版本号,查 issue 追踪器,回退一个
                       版本
IllegalInstruction     闪存损坏或栈被覆写 —— 通过 USB
                       做完整重刷
Cache error /          通常紧随 PSRAM 问题(见下文)
DoubleException
Interrupt wdt timeout  某个任务卡住了 —— 常与网络相关;
                       查一下你这个版本的已知 issue

孤立的一次 panic:忽略它。死循环:判断每次是不是同一个原因(固件或硬件故障:按表处理),还是中间夹杂着欠压消息(那就是供电问题:别再读 panic 了,去修电源)。

PSRAM 故障:Nerd 家族的专属问题

NerdQaxe、NerdOctaxe 以及其他基于 ESP32-S3-WROOM-1 模组的板子使用外部 PSRAM。启动横幅出现 PSRAM ID 读取错误或初始化失败,紧接着在固件一碰外部 RAM 时抛出 StoreProhibited panic —— 这有五个已知根源:没有 PSRAM 晶粒的假冒模组、以错误 PSRAM 模式(octal 而非 quad)编译的固件、模组下方的虚焊、初始化窗口期间的欠压,或者是老化的晶粒。实用的分流是:先排除供电(一如既往),刷写你这块板子对应的厂商精确镜像(它编码了正确的 PSRAM 模式),如果在供电干净、固件正确的前提下错误依旧存在,那就是模组本身的问题,属于保修或维修台的范畴。

超频翻车:抢救与预防

故障特征是:调高了频率或电压,现在设备会崩溃、在几分钟到几小时后算力归零、开始降频,或者多芯片板上有一颗芯片消失了。物理规律在一个特定方面毫不留情:频率过高造成的不稳定,往往要过一阵子才显现。一个熬过了 10 分钟测试的设置,可能在第 40 分钟、板子完全热透之后才失败,这正是为什么任何不足 24 小时的稳定性结论都只是暂定的。

抢救(如果设备还能启动):
  网页界面 -> 把频率和电压恢复到出厂值 -> 保存 ->
  冷启动(清除任何锁存的故障)。

抢救(如果它在你进入界面之前就陷入死循环):
  通过 USB 刷写出厂镜像 —— 这会恢复出厂工作点。
  之后再做恢复出厂设置以清空 NVS。

预防(整套方法就五行):
  - 一次只加 25 MHz 一档,电压不动
  - 每档至少 30 分钟,盯住硬件错误率
  - 错误率超过 2% = 退回一档;那就是墙
  - 只有到这时,如果你愿意接受额外发热,才以 25 mV
    为步长提升电压;保持在 1100-1300 mV 区间内
  - 在最终设置上跑满 24 小时,再说它稳定

还有一句实话:为了效率而降压,失败方式和为了速度而超频完全一样,只是方向相反 —— 相对于频率而言电压不足,会产生同样的错误和卡死。硅片彩票在两个边界上都有效。

通过 API 诊断:进阶用户的捷径

AxeOS 家族的每一台矿机都在 80 端口上开放了一套 REST API,这改变了故障排查的形态:不需要屏幕、不需要在仪表盘里点来点去,而且它能从一台设备扩展到整个矿场。完整规范位于 ESP-Miner 仓库的 openapi.yaml 文件里;下面这些是对诊断真正重要的调用。

五个诊断调用

# 一次拿全:算力均值、各处温度、电压、功耗、风扇转速、
# 份额、最佳难度、WiFi RSSI、运行时间、固件版本、堆内存
curl http://矿机IP/api/system/info

# ASIC 状态:型号、数量、频率、电压
curl http://矿机IP/api/system/asic

# 仪表盘图表所依据的时间序列
curl "http://矿机IP/api/system/statistics?columns=hashrate,asicTemp,vrTemp,power"

# 被低估的那一个:远程下载设备日志。
# 不用串口线,不用 PuTTY —— 通过网络把日志拉过来,
# 然后按下面词典里的红色报错行去筛。
curl http://矿机IP/api/system/logs

# 哪台是哪台?让设备自己表明身份(屏幕/LED)——
# 在一排一模一样的盒子里,这个功能价值连城
curl -X POST http://矿机IP/api/system/identify

那个日志端点值得单独说一句:只要设备启动到能提供 HTTP 服务的程度,本指南串口控制台章节的大部分内容,你都可以靠这一个调用在沙发上完成。串口线只在启动阶段故障和崩溃死循环时才仍然必需。

像技师一样读 /api/system/info

这个 JSON 里的六个字段,能在大多数问题被提出之前就把它们回答掉:

字段(常见名称)          它在告诉你什么
hashRate / hashrate_10m   那句「声明」—— 拿去和矿池对比
temp / asicTemp           温度章节里的 55-62 C 预算
vrTemp                    稳压器那一侧 —— 在 BM1370/BM1373
                          上往往才是真正的限制项
voltage                   输入电源轨在板子眼中的样子:一台
                          软件万用表。带载时跌破 4.9 V =
                          电源问题,不用拆机壳就能证明
power                     实际功耗瓦数:一台「正在哈希」的
                          设备只有 2 W = USB-C 陷阱
sharesAccepted /          真相二人组;拒绝数在涨 = 去查
sharesRejected            拒绝原因表
wifiRSSI                  强于 -70 dBm 算健康;更弱则能
                          解释过期份额
freeHeap                  在数天内缓慢缩小 = 内存泄漏那一类
                          固件 bug;记下版本号,查追踪器

用一个循环检查矿场健康

只要超过一台设备,就别再一台台点仪表盘了。这个循环会为每台矿机打印一行健康摘要,并标出已经死掉的:

#!/bin/bash
# fleet-check.sh - 把 IP 改成你自己的矿机群
for IP in 192.168.1.101 192.168.1.102 192.168.1.103; do
  J=$(curl -s -m 5 "http://$IP/api/system/info")
  if [ -z "$J" ]; then
    echo "$IP  无法连接"
    continue
  fi
  echo "$J" | python3 -c "
import sys, json
d = json.load(sys.stdin)
print('$IP  %-10s %6.1f GH/s  %4.1fC  %4.1fW  acc:%s rej:%s' % (
  d.get('hostname','?'),
  d.get('hashRate',0),
  d.get('temp',0),
  d.get('power',0),
  d.get('sharesAccepted','?'),
  d.get('sharesRejected','?')))"
done

用 cron 每五分钟跑一次,把输出接到你喜欢的通知渠道,凌晨两点的一次故障就会变成两点零五分的一条告警,而不是早上起来的一个惊喜。字段名在不同固件版本间会略有差异;先把原始 JSON 打印一次,然后照着改。

API 也能修东西

# 不碰硬件就重启
curl -X POST http://矿机IP/api/system/restart
#   (记住:这不会清除锁存的 TPS546 供电故障 ——
#    那个仍然需要物理拔电)

# 把一次超频实验拉回到理智的数值
curl -X PATCH http://矿机IP/api/system \
  -H "Content-Type: application/json" \
  -d '{"frequency": 525, "coreVoltage": 1150}'

# 不用网页界面就修好打错的矿池配置
curl -X PATCH http://矿机IP/api/system \
  -H "Content-Type: application/json" \
  -d '{"stratumUser": "你的钱包地址.worker1"}'

一句诚实的提醒:这套 API 没有任何身份验证。你局域网里的任何人都能读取并重新配置你的矿机。在家庭网络里这通常可以接受;但在共享网络或访客可进入的网络里,请把矿机放进独立的 VLAN 或 IoT 网段 —— 方便的是,这正好和 WiFi 章节已经推荐过的做法是同一件事。

按型号的怪癖:了解你这块板子的脾气

除了通用的失效模式之外,每个板型家族都有值得在动手排查之前先了解的特征行为。

型号已知怪癖与特征
Bitaxe Ultra / 早期板子USB-C 对 USB-C 的供电协商在某些主机接口上会失败;有据可查的解决办法是换一根普通的 USB-A 转 USB-C 线,它会强制走经典 5 V,救活那些看起来已经死掉的板子。
Bitaxe Gamma 601/602整个家族中电压容差最紧的型号:在勉强的电源下最容易显示 Power Fault Detected。601 在稳压器握手失败时,启动日志里有一个已知的 I2C device-ID 不匹配特征。600 系列的某些硬件版本会卡在特定的固件升级上,直到用户降级为止。
Bitaxe GT双 BM1370:芯片数报 1 而不是 2,是焊点开裂或弱晶粒的经典特征。属于 12 V 系列:XT30 那套规则同样适用。
Bitaxe Hex六芯片链:不完整的计数(1 到 5)可以定位链上的断点。这是对散热器沿板子拧紧力矩不均最敏感的型号。
Bitaxe Touch带集成显示屏的型号;自检行为略有不同(为 Touch 配置增加了通过后自动重启)。屏幕不亮更多时候是超时而不是故障。
NerdQaxe++ / NerdOctaxe带外部 PSRAM 的 ESP32-S3:PSRAM 初始化失败这一类故障是这个家族特有的。8+ A 经过 XT30:接头发热的警告在这里要加倍重视。电源故障会以带 PSU 错误码的 Guru Meditation 形式出现。
Lucky Miner / 克隆机运行的是改名后的 ESP-Miner 分支:本指南同样适用,但菜单名称会变,出厂镜像来自克隆机厂商而不是主仓库。把官方 AxeOS 刷到引脚定义不同的克隆机上可能直接变砖:请用厂商的镜像。
BM1373 世代(Gaia、Nexus S1)同样的 AxeOS 血统、同样的故障类别,但硅片彩票更加激烈:早期回收芯片的个体差异更大,所以「按错误率调优」这条规则在这里更加重要。完整内容见 BM1373 参考。

主症状表

症状最可能的原因第一步动作
完全没反应,无 LED,无风扇电源、线缆、DC 口或输入保护烧毁用另一个负载测电源;在接头上测 5 V/12 V
能启动,仪表盘正常,恰好 0 GH/s,功耗 ~2-5 W仅 USB-C 供电,或 TPS546 故障锁存确认真正的电源已接;拔电冷启动 10-60 秒
Power Fault Detected 横幅反复出现电源在负载下塌陷哈希时测输入电压;更换更好的电源
每隔几分钟重启,带载时更严重欠压:电源或线缆处于临界直插墙插座,换优质电源,日志里找 brownout 行
刚收到或刚搬动的设备 ASIC 数量为 0BGA 焊点开裂或出厂虚焊60 秒放电;核对固件;然后走保修或维修台
多芯片板检测到的数量不完整该芯片处链路断开;或超频下的弱晶粒退回出厂频率;若数量恢复,那颗晶粒就是你的上限
哈希正常但温度/功耗/电压全是空值I2C 遥测路径挂掉(固件回归或配件)拆掉配件,冷启动,离开受影响的固件版本
冷机状态下几秒内就过热散热器接触:硅脂、导热垫或装配用新硅脂重装,对角交叉均匀拧紧
10-30 分钟后过热散热能力:风道、环境温度、积灰、超频两侧各留 10 厘米,清理鳍片,回退上一次超频
设置没变,温度却在数周内攀升积灰或硅脂干涸清理;重新涂硅脂(6-12 个月的消耗品)
固件升级后立刻变得更热或更慢该版本改动了风扇或温度曲线读发行说明;调高风扇百分比,或回退版本
完全连不上 WiFi只可见 5 GHz / 频段引导专用 2.4 GHz SSID;WPA2-AES;固定信道;20 MHz
WiFi 连上了,仪表盘却打不开AP 隔离或客户端隔离处于开启状态关闭隔离;用 DHCP 表里的裸 IP
恰好在关联 WiFi 那一刻崩溃发射峰值时的电压跌落去修供电;这不是网络问题
stratum 连不上URL 或端口打错、DNS 过滤、端口被封核对精确 URL;用手机热点测;换区域
authorize 被拒绝地址打错或链搞错,worker 名不合法用正确的链重新生成地址;worker 名取简单些
只在区块切换时成簇出现拒绝过期份额,少量属于正常低于 ~2%:忽略。更高:延迟/WiFi 质量,换更近区域
大量重复份额被拒绝ASIC 卡在某个 nonce 上拔电重启;若反复出现 = 降低超频
每一个份额都被拒绝配置问题:链、地址或端口对不上重新核对地址是否为该链原生,以及端口用途
矿机界面在哈希,矿池已静默超过 10 分钟套接字已死、切到备用池,或看错了面板按 stratum 章节的四步路径走
升级后仪表盘空白,但仍在挖矿OTA 卡住导致 www.bin 损坏访问 /recovery,重新上传网页镜像
升级后无法启动OTA 失败通过 USB 刷写出厂镜像;恢复出厂设置
Guru Meditation 死循环,每次原因相同固件 bug 或闪存损坏记下原因;回退或重刷;查 issue 追踪器
panic 死循环里夹杂着 brownout 行是供电,不是固件别再调试软件了;去修电源
Nerd 系板子出现 PSRAM 错误后跟 StoreProhibitedPSRAM 初始化时的模组、模式、焊接或供电问题干净供电 + 厂商精确镜像;否则走保修
稳定运行数小时后算力归零(超频时更糟)热透之后频率超出稳定点降 25 MHz;重测 24 小时;这是已知的 issue 类别
屏幕卡在 SELF TEST 或显示 FAIL 代码自检抓到了子系统故障读 FAIL 代码;v2.12+ 按 BOOT 2 秒跳过;可能刷错镜像
WiFi 正常,但任何矿池都连不上路由器安全功能(AiProtection 一类)丢弃 stratum用手机热点测;在路由器里关闭或加白名单
仪表盘打不开,但矿机明显还活着浏览器自动 HTTPS、广告拦截或 AP 隔离明确输入 http://;换浏览器;检查隔离设置
空闲堆内存在数天内缩小,然后重启固件里的内存泄漏一类问题记下版本;查追踪器;升级或回退
XT30 接头发烫或变色8+ A 下的高阻接点停。下次通电前更换线缆或接头

红色报错行词典

你真正会遇到的报错字符串,集中在一处,逐字照抄以便 Ctrl+F 能找到它们。找到你的那一行,就拿到了方向。

日志中的行                         含义 -> 去哪一章
---------------------------------------------------------------
Brownout detector was triggered    供电塌陷 -> 供电
rst:0x.. (BROWNOUT_RESET)          同上,出现在复位横幅里
Power Fault Detected               TPS546 锁存 -> 供电
TPS546 status / regulator fault    同一家族 -> 供电
VCORE init failed /                固件无法给稳压器编程:
  device ID mismatch               镜像错误或 I2C 问题 ->
                                   ASIC + 固件
i2c_master_transmit_receive err /  传感器总线挂掉 -> ASIC 章节
  ESP_ERR_TIMEOUT near boot          的 I2C 小节
Found 0 chip(s) / ASIC init fail   芯片不应答 -> ASIC
Chip count N of M                  链在 N+1 处断开 -> ASIC
Device has overheated /            75 C 关断 -> 温度
  Overheat Mode
VREG temp over limit               稳压器过热 -> 温度
wifi: NO_AP_FOUND                  2.4 GHz 可见性 -> 网络
wifi: AUTH_EXPIRE / auth fail      密码错误 -> 网络
wifi: beacon timeout               信号或信道质量差 -> 网络
wifi_disconnect reason: N          查一下 N;按原因解决
Stratum connection failed /        矿池无法到达 -> Stratum
  connect errno
authorize failed                   登录被拒 -> Stratum,
                                   检查地址与 worker
job not found(提交时)            过期份额 -> Stratum
above target / low diff share      难度错位或硬件错误
duplicate share                    nonce 卡住 -> 拔电重启,
                                   然后降频
Guru Meditation Error: (原因)      panic -> 固件,读括号里
                                   那个原因词
esp_psram: PSRAM ID read error /   PSRAM 初始化 -> 固件,
  Failed to init external RAM        Nerd 家族小节
E (xx) esp_image: checksum failed  闪存损坏 -> USB 重刷
[www.bin / 升级后界面空白]         恢复 URL -> 固件

预防性维护:每月 15 分钟的例行仪式

上面几乎所有内容,预防的成本都比排查便宜。

每月
  [ ] 灰尘:鳍片和风扇叶片(压缩空气,按住风扇别让它转)
  [ ] 从矿池侧检查:接受与拒绝的趋势,硬件错误率是否
      仍低于 2
  [ ] 扫一眼温度:与上个月相比有没有漂移?
  [ ] 用手摸一下电源接头:温热是警告,发烫是停止

每 6-12 个月
  [ ] 更换导热硅脂(它是消耗品)
  [ ] 检查 XT30 或 DC 头的针脚是否变色
  [ ] 用万用表带载复测电源

每次固件升级时
  [ ] 刷写之前先读发行说明
  [ ] 记下当前版本(你的回退目标)
  [ ] 在供电稳定时刷写,尽量靠近路由器
  [ ] 事后复查矿池配置:升级可能重置某些字段

始终
  [ ] 已配置备用矿池(第二个区域)
  [ ] 整个矿场使用互不相同的 worker 名
  [ ] 一张书面对照表:链 -> 钱包地址
  [ ] 调优之前先记下出厂设置

当它真的是硬件问题:哪些可以修

你做了冷启动、恢复出厂设置、在验证过的供电下重刷了正确的镜像,故障依然存在。这就是硬件问题的定义。现实的维修地图如下:

  • 维修台上可修(热风、显微镜、稳定的手,或者一位专业人士):损坏的 TPS546 或降压级元件、开裂的陶瓷电容、ASIC 或 ESP32 模组下方的虚焊(回流)、磨损的电源接头、坏掉的风扇。对任何一家 ASIC 维修台来说,这些都是常规活。
  • 有时可以救回:5 V 电源轨对地短路的板子(断电状态下测得接近零欧姆)—— 不要再上电了;必须先找到并清除这个短路。
  • 通常已判死刑:在没有散热器接触的情况下运行超过几秒的 ASIC、热失控之后的残局,或者在临时修 VRM 时被灌入错误核心电压的芯片。在单芯片板上,芯片占了绝大部分价值:过了某个临界点,换新比修划算。

社区支援在 OSMU 的 Discord 和 ESP-Miner 的 GitHub issue 追踪器上:在提交之前请先搜一下追踪器,因为「我的机器坏了」这类报告中有相当惊人的比例,其实是已知 issue,而且修复已经合入下一个版本。真要提交时,一份完整的报告能在几小时内得到回应,而一份含糊的报告会在沉默中死去。请复制这个模板:

板型:     (精确型号 + 版本号,例如 Gamma 602)
固件:     (AxeOS 版本,来自仪表盘或 /api/system/info)
电源:     (电压、安培、品牌 —— 以及:是否带载测过?)
矿池:     (URL + 端口 + 币种)
症状:     (一句话:发生了什么,从什么时候开始)
触发条件: (紧接着发生之前改了什么:升级?运输?超频?
            重装散热器?什么都没改?)
已尝试:   (60 秒冷启动?恢复出厂?重刷?出厂频率?
            自检结果如何?)
日志:     (粘贴串口 115200 的启动日志,或
            curl http://IP/api/system/logs 的输出 ——
            至少要有第一条 E 行以及它前后各十行)

这个模板不是官僚主义:它恰好就是一家维修台最先收集的信息,而且顺序也一样。

PRO:维修台章节 —— 原理图、测量点与万用表

本章节默认你会读原理图,并能在带电电路板上测量而不会短接相邻引脚。如果这句话让你犹豫了,就在这里停下:这条线以上的所有内容都不需要拆开机壳就能解决,而一根打滑的表笔落在带电的 3 纳米板子上,会把一个问题变成两个。对其他人来说,这里正是开源硬件真正回报你的地方。

为什么这些板子与其他任何矿机都不同

Bitaxe 硬件采用 CERN-OHL-S 授权,用 KiCad 设计,而且每一份原理图、每一份 PCB 布线、每一份物料清单都是公开的。这意味着你永远不必猜某个元件是什么、某条电源轨走到哪里:你可以打开你这块板子确切版本的确切原理图,找到那条网络,然后去测它。没有哪个 Antminer 用户享受过这种特权。每个硬件仓库还带着一个几乎没人打开过的部分:按版本列出已知缺陷、返工方案和勘误的 HW issues 页面。在诊断任何板级故障之前,先查一下你的版本有没有已记录的勘误:相当惊人比例的「神秘」硬件故障,早就连同修复它们的改动一起写在那里了。

万用表方法:三条电源轨讲完整个故事

供电路径的故障可以用三次直流测量定位,按顺序进行。先接好地线参考,遵守次序,并在标注处带载测量。

电源轨 1 —— 输入(按系列为 5 V 或 12 V)
  在哪测:  输入接头 / 输入焊盘(见原理图)
  期望值:  5 V 系列:  哈希过程中 4.9 - 5.3 V
            12 V 系列: 哈希过程中 11.8 - 12.2 V
  仅带载时偏低 -> 电源或线缆(多数情况)
  电源正常却读到 0 -> 输入保护烧毁,或下游短路:
                      断电状态下测对地电阻 ——
                      接近零欧姆 = 短路,停止上电,
                      去把它找出来

电源轨 2 —— 3.3 V(ESP32 的供电)
  在哪测:  按原理图找 3.3 V 网络(ESP32 模组)
  期望值:  稳定 3.2 - 3.4 V
  输入正常却缺失 -> 那颗小的 3.3 V 稳压器或它的
  外围无源元件:这能解释在电源确认良好的情况下
  出现「完全没反应、USB 也不枚举」

电源轨 3 —— VCORE(ASIC 的供电)
  在哪测:  TPS546 降压级输出 / ASIC 核心网络
  期望值:  大约 1.0 - 1.3 V,与 AxeOS 里设定的值一致
  输入和 3.3 V 都正常却缺失 -> 降压级:可能是锁存的
  故障(永远先做冷启动),也可能是 TPS546 / 电感 /
  周边无源元件损坏
  存在但数值不对 -> 稳压器编程或 PMBus 通信问题:
  和 AxeOS 认为自己设定的值做交叉核对

确认性测量
  输入接头 -> 稳压器输入的通断:可以找出断裂的走线
  和开裂的 DC 口焊点
  仪表盘上的 TPS546 晶粒温度对比手靠近的感觉:一个
  空载时你都不敢靠近的稳压器,正在走向损坏

这三条电源轨能把任何供电故障切开:输入不良 = 问题在板子之前;输入良好而 3.3 V 不良 = 那颗小稳压器;两者都好而 VCORE 不良 = 降压级;三条都好 = 故障根本不在供电,回到 ASIC 章节。用一只二十美元的万用表花十分钟,就能取代几小时的猜测。

维修台能做什么,不能做什么

常规活(热风 + 显微镜 + 稳定的手)
  - 更换 TPS546 或降压级元件
  - 开裂的陶瓷电容(目视:一道细裂纹横穿本体;
    电气:短路或开路)
  - ASIC 或 ESP32 模组下方的 BGA 回流(跌落后和
    重装后的那一类故障)
  - 更换接头(磨损的 DC 口、烧糊的 XT30)

有耐心的话可行
  - 追查 5 V 电源轨上的短路(热成像仪,或在可疑区域
    用异丙醇蒸发的土办法)
  - 更换 ESP32-S3 模组(之后需要重刷)

不划算 / 已判死刑
  - 在单芯片板上更换 ASIC:芯片占了整块板子的绝大
    部分价值,而供体芯片本来也是回收来的 —— 买块新板
    在成本和确定性上都更划算
  - 热失控之后,或整条电源轨被反极性输入过之后的
    任何情况

像维修技师那样读原理图

有三个习惯能让公开原理图真正派上用场。第一,找到供电树那一页,在测任何东西之前先在纸上把从输入到 VCORE 的路径描一遍:从那一刻起,你就知道了每一个有能力干掉这条电源轨的元件。第二,把降压级的元件位号(R12、C34、U3)记下来:论坛帖子和勘误表都是按位号来指代元件的,而在打开布线文件的情况下,把它们对应到你的板子上只需要几秒钟。第三,当某个故障与版本相关时,去对比版本差异:比如说 Gamma 600 和 601 之间的变更日志,会精确告诉你设计者修了什么,而那往往恰好就是老版本上会坏的东西。

开源资源库

所有一手来源汇总成一张表。请把这一节加进收藏夹:开源硬件一半的价值就在于知道原件放在哪里,而下面每一个链接都是官方来源,不是镜像。

资源它是什么在哪里
ESP-Miner / AxeOS 源码固件本体,含 issue 追踪器:提交任何东西之前先在里面搜一遍github.com/bitaxeorg/ESP-Miner
固件发布页每个版本及其发行说明:你的回退目标和两种 .bin 文件ESP-Miner Releases
官方网页刷写工具浏览器里的 USB 刷写:任何软砖的救命工具bitaxeorg.github.io/bitaxe-web-flasher
API 规范本指南里每一条 curl 命令背后的 openapi.yamlESP-Miner 中的 openapi.yaml
OSMU Wiki社区文档,含更易读的 API 参考osmu.wiki
Bitaxe 硬件总站通往所有原理图、布线和物料清单的入口页bitaxe.org
全部硬件仓库按型号分的 KiCad 源文件:原理图、布线、BOM,以及 HW issues 与勘误页github.com/bitaxeorg
Gamma 原理图BM1370 单芯片板的文件与勘误bitaxeorg/bitaxeGamma
GT 原理图双 BM1370 的 800 系列文件bitaxeorg/BitaxeGT
NerdQaxe 硬件与固件qaxe 项目:NerdQaxe 与 ++ 的源文件github.com/shufps/qaxe
NerdMiner v2教学型矿机的固件家族github.com/BitMaker-hub/NerdMiner_v2
TPS546D24A 数据手册稳压器本身的手册:故障寄存器、PMBus、各项阈值ti.com/product/TPS546D24A
ESP-IDF 致命错误指南乐鑫官方的解码表,涵盖每一个 Guru Meditation 原因ESP-IDF fatal errors
OSMU Discord开发在这里发生,人也在这里经由 bitaxe.org

要点总结

  • 六个域覆盖了几乎所有故障:供电、ASIC、温度、网络、stratum、固件。60 秒分流会在你动手之前告诉你身处哪一个。
  • 供电是头号原因,也是头号冒名顶替者:它会伪装成 WiFi 崩溃、固件 panic、卡住的芯片和报废的板子。在相信任何其他理论之前,先带载测输入电压。
  • 锁存的稳压器故障能熬过任何软件重启。物理拔电 10 到 60 秒是一个真正的诊断步骤,不是迷信。
  • USB-C 供的是 ESP32 的电,绝不是 ASIC 的。只接 USB-C 的板子能完美模仿一台 0 GH/s 的死矿机。
  • 学会用 115200 波特率的串口控制台。启动日志里的第一条 E 行,比任何论坛帖子都更快地说出你的问题。
  • 内置自检在 30 秒内说出出故障的子系统,REST API 则能通过网络送来日志、遥测甚至修复手段:在去找串口线之前,先用这两样。
  • 永远不要把 12 V 电源接到 5 V 板子上。插头可以互换;板子不行。
  • ESP32 只讲 2.4 GHz;频段引导和 AP 隔离是搞坏最多部署的两个路由器功能。
  • 矿池侧的真相胜过矿机侧的乐观:距上一个被接受份额的时间是唯一诚实的在线检测,10 分钟就是那道门槛。
  • 钱包地址必须是所挖那条链的原生地址。在非托管矿池里,这是唯一一个没有回头路的错误。
  • 硬件错误率是诚实的性能数字;仪表盘算力只是一句声明。请以被接受的份额为调优目标,并且在称任何设置为稳定之前,先要求它跑满 24 小时。
  • 发烫的电源接头,是唯一一个意味着「现在就停」而不是「以后再查」的症状。

本文整理自 ESP-Miner 的 issue 追踪器与发行说明、ESP-IDF 的致命错误文档、社区维修台的资料,以及在 Bitaxe、NerdAxe 和 NerdQaxe 社区中被反复报告的故障模式,截至 2026 年 7 月 20 日。此处描述的固件行为(故障锁存、过热阈值、恢复 URL、已知的回归版本区间)反映的是发布时的 AxeOS 与 ESP-Miner 版本;请对照你自己那个版本的发行说明。本指南作为持续更新的活文档维护:如果你遇到了这里没有覆盖的失效模式,请通过联系页面告诉我们,我们会把它补进去。

常见问题

设备明明通电了,为什么我的 Bitaxe 算力显示为 0?

按可能性排序,最常见的三个原因是:ASIC 失去了核心电压,因为 TPS546 稳压器锁存了一个故障;电源在负载下跌到 4.8 伏以下;或者矿机仅靠 USB-C 供电,这能让 ESP32 运行但无法驱动 ASIC。先做一次冷启动,物理拔掉电源线至少 10 秒,因为软件重启无法清除稳压器锁存的故障。

如何读取 Bitaxe 或 NerdQaxe 的日志?

有两种方式。AxeOS 网页界面的仪表盘里有实时日志视图。遇到启动问题时,用 USB-C 数据线连接电脑,打开 115200 波特率、8N1 的串口终端,然后按下 reset。完整的启动序列会滚动显示,包括芯片检测、WiFi 关联和矿池的首批消息。错误行带 E 前缀,在多数终端里显示为红色。

Bitaxe 上的 Power Fault Detected 是什么意思?

TPS546 核心稳压器触发了四种保护之一:过流、过压、欠压或过温,然后锁存关断。ASIC 失去供电,算力归零,而 ESP32 仍在运行。这个故障会一直锁存,直到输入电压被物理移除,所以要拔电整整 10 秒。如果反复出现,原因几乎总是电源在负载下塌陷,而不是电路板本身。

为什么我的矿机连不上 WiFi?

这些设备里的 ESP32 只支持 2.4 GHz WiFi,从不支持 5 GHz。在使用单一合并 SSID 的 mesh 系统中,频段引导可能把矿机推向 5 GHz,导致关联失败。请建立专用的 2.4 GHz SSID 或 IoT 网络,使用 WPA2-AES 而非 WPA3 或 TKIP,把信道带宽保持在 20 MHz,并确认已关闭 AP 隔离或客户端隔离,否则即使 WiFi 连上了,仪表盘依然无法访问。

矿池为什么拒绝我的份额?

拒绝可以归为几类。新区块出现后紧接着的一小簇拒绝属于过期任务,少量出现是无害的。持续拒绝并伴随硬件错误率上升,说明芯片超频超过了稳定频率,正在产生无效的 nonce。如果每一个份额都被拒绝,那通常是配置问题,绝大多数情况下是钱包地址与所挖的链不匹配。

矿机说它在哈希,但矿池面板什么都没有。谁在说谎?

通常两边都没说谎,答案藏在时间戳里。设备报告的是 ASIC 算出的东西;矿池报告的是真正抵达并通过验证的东西。请查看矿池侧「距上一个被接受份额的时间」:如果超过 10 分钟,连接实际上已经死了,哪怕矿机界面看起来还活着,因为仪表盘的算力平均值会在一小时内缓慢衰减,从而掩盖掉线。同时确认地址与币种匹配,且 worker 名称不含非法字符。

一台会随机重启的矿机,继续用安全吗?

先排查再决定。随机重启几乎总是 ESP32 的欠压检测器在供电塌陷时触发,这对 ASIC 无害,但意味着供电路径需要修复。但如果重启伴随着发烫的 XT30 接头、变色的针脚或焦糊味,请立即停止:8 安培下的高阻接点是真实的火灾风险,不是软件问题。

什么时候是硬件问题而非配置问题,哪些又是可以修的?

当故障熬过了冷启动、恢复出厂设置和干净的固件重刷,或者它出现在跌落、运输或重装散热器之后,就要怀疑硬件。稳压器损坏、ASIC 下方的虚焊、开裂的陶瓷电容,这些在维修台上用热风都能修。而一颗在没有散热器接触的情况下运行超过几秒的芯片,通常已经无法挽救。