Worth Solving
值得构建的问题。
一个好问题一旦被看见,就难以忽视。它会一直萦绕心头,直到有人构建出解决方案。这是我持续整理的清单,记录着我反复思考的技术、区块链和AI领域的开放性问题:我认为真正值得解决的那些,以及我自己想要构建的几个。
每个问题都附有一个机会评分,这是我对其痛苦程度、发生频率以及现有解决方案匮乏程度的个人判断。浏览地图,或逐一阅读。
AI 智能体的银行账户究竟长什么样?
智能体如今已能自主行动,但把钱交给它仍然令人不安。目前没有标准方法为智能体设定消费限额、清晰的审计追踪,以及人类和监管机构都信任的终止开关。我们只是把智能体强行接入那些为人类设计的银行卡和钱包。
为何重要: 自主软件即将开始真实资金的流转,而与之配套的问责机制尚未建立。
阅读完整分析为什么我无法在不透露余额的情况下证明自己具备偿付能力?
公链让每一笔余额永久可见。基金和交易所被要求证明储备金,通常的回答要么是一张需要你信任的截图,要么是泄露所有信息的全面披露。目前没有低成本的方法,能在不暴露其余信息的情况下证明关于资金的某一个事实。
为何重要: 选择性证明是缺失的基础原语,它能让受监管的资金在透明账本上自如运转。
阅读完整分析为什么每次关闭标签页,AI 应用就把我忘得一干二净?
你的上下文、偏好和历史记录都被锁在你最后使用的那个助手里。切换模型或应用,一切从零开始。记忆归平台所有,而非归你所有——如果目标是打造一个能随时间不断为你积累价值的工具,这恰恰是本末倒置。
为何重要: 可携带的、用户自主掌控的记忆,才能将聊天机器人变成个人竞争优势。
阅读完整分析为什么进入一个新领域,仍然要先知道该问什么问题?
学习新事物的难点从来不是获取信息,而是不知道该问什么问题。个人模型可以梳理你真正想做的事,找出你知识体系中的空白,并规划出学习路径。大多数工具仍然坐等你自己想清楚该问什么。
为何重要: 这是 AI 对个人成长所许下的承诺落地为现实,而几乎没有人把它真正做好。
阅读完整分析为什么非专业人士无法核实 AI 刚才告诉他们的内容?
无论模型是在陈述事实还是在编造内容,都以同样自信的语气作答。对于任何重要事项,无论是医疗、法律还是财务,普通人在没有专业知识的情况下,根本没有简单可信的方法将某个说法与真实来源进行核对。
为何重要: 让 AI 真正值得信赖的,是可靠的核实机制,而不是更大的模型。
阅读完整分析为什么跨链转账至今仍比早期互联网更令人心惊?
跨链桥依然是加密领域最容易遭受攻击的环节,而承担风险的却是用户。我们至今仍没有一种默认安全的跨链价值转移方式,就像 TCP/IP 让数据包传输变得平淡无奇又可靠稳定那样。
为何重要: 在跨链转账变得平淡无奇之前,主流资金不会对它产生信任。
阅读完整分析为什么合规至今仍意味着一份 PDF 加一句祷告?
关于谁可以在何处持有何种资产的规则,存在于文件和人工核查清单中,资产本身并不携带任何这些信息。代币化资产和稳定币一再以惨痛的方式重蹈这一覆辙。合规信息应当随资产一同流转,并可实时核验,而不是在出现问题后再重新拼凑。
为何重要: 机器可读的合规机制,才是推动受监管资产上链的真正关键。
阅读完整分析为什么我们用基准测试来评估模型,却凭感觉把它们部署上线?
团队从排行榜上挑选模型,然后在生产环境中运行,几乎没有任何持续、低成本、针对特定任务的评估。当质量出现偏差时,没有人会察觉,直到用户投诉才发现。对大多数开发者而言,真正用于衡量 AI 功能是否仍然有效的工具根本不存在。
为何重要: 无法衡量的东西就无法有效运营,而当下大多数 AI 功能都缺乏有效的度量。
阅读完整分析由智能体驱动的链上组织,能否避免沦为骗局机器?
智能体擅长执行规则,却不善于判断。一个由智能体运营的组织,可以做到透明高效、不知疲倦,也可以成为一台完美自动化的掏空资金库的机器。目前还没有人展示出能让前一种结果成为大概率事件的护栏机制。
为何重要: 如果智能体驱动的组织即将到来,安全模式必须在资本入场之前就已存在。
阅读完整分析为什么我们最依赖的软件往往是最难用的?
税务门户、医院系统、政府表格。覆盖面最广、关乎最重大利益的软件,往往是最令人痛苦的。驱动优质消费类应用产生的激励机制,几乎触及不到公共利益类软件。
为何重要: 提升基础软件的下限,能帮助到的人远比再推出一款消费类应用更多。
阅读完整分析如果没有平台背书,如何证明一张照片或一段声音是真实的?
合成媒体现在已经足以欺骗任何人,而目前唯一的应对方案只是信任向你展示内容的平台。来源信息应当随文件一同存在,并可供任何人核验,就像签名证明签署者身份一样。密码学技术已经存在,缺少的是大规模采用。
为何重要: 我们对网络所见所闻的信任,取决于能否在虚假内容占上风之前解决这个问题。
阅读完整分析为什么自托管至今仍是在丢失密钥和信任公司之间二选一?
自己保管密钥,一次失误便满盘皆输、无法挽回。使用托管机构,又回到了把钱交给公司信任的老路。社交恢复和账户抽象技术虽然存在,但几乎没有人做出过一款普通人无需助记词、无需客服就能用的钱包。
为何重要: 真正适合普通人使用的自托管,是通往加密世界其他一切的门槛。
阅读完整分析为什么AI智能体对自己犯过的错误毫无记忆?
智能体周二会重蹈周一的覆辙,因为没有任何机制将教训传递下去。我们有记忆事实的能力,却几乎没有记忆失败的能力。一个无法从错误中汲取教训的智能体,不过是个患了失忆症的实习生。
为何重要: 智能体只有能随时间稳定地持续进步,才会被委以真正的工作。
阅读完整分析为什么链上身份要么什么都不是,要么就是你的全部?
在公链上,你要么是一个毫无信誉的随机地址,要么是一个暴露了你所有行为记录的钱包。两者之间没有中间地带:一种既能证明你是真实、独一无二的个体,或你有权做某件事,又无需交出全部历史记录的方式。
为何重要: 实用且保护隐私的身份系统,是匿名与被监控之间缺失的那一层。
阅读完整分析为什么将实物资产代币化仍然需要十个中间人?
把一栋建筑或一张债券放上链,你仍然需要托管人、过户代理、律师和登记机构,才能让代币真正有意义。链上部分很容易。链下的信任和法律执行力才是那个艰难而毫无光彩的部分,至今没有人将它变成一件稀松平常的事。
为何重要: 现实资产上链,只有在与现实世界的关联能在法庭上站得住脚时才有意义。
阅读完整分析为什么我无法审查一个模型究竟是用什么训练出来的?
模型吸收了整个互联网的内容,然后给出答案,却无法追溯某个论断或行为的来源。对于任何受监管的领域,或任何涉及版权或偏见的争议,训练集都是一个黑盒。没有切实可行的方法去问一个模型它从哪里学到了什么,并得到一个诚实的答案。
为何重要: 一个输入不透明的系统,你既无法治理,也无法完全信任。
阅读完整分析为什么稳定币无法在没有网络的情况下完成支付?
数字货币本应惠及那些银行从未覆盖到的人群,却在网络断开的那一刻就失灵了。离线和断续支付、待信号恢复后再结算,这才是现金的运作方式,也是世界上许多地区仍在使用的方式。加密货币很少为此进行设计。
为何重要: 只有在网络畅通时才能运作的支付,对地球上大多数人来说算不上真正的支付。
阅读完整分析为什么我生成的数据,我却至今毫无所有权?
每一款你使用的应用都会保留你产生的数据,而你无法将其带到任何有用的地方。所谓可移植性,不过是一个下载按钮,给你一个毫无用处的文件夹。跨服务拥有并复用自己的数据,至今仍只是一句口号,而非真正的功能。
为何重要: 无法转移的数据,就是你并不真正拥有的数据。
阅读完整分析为什么跨链桥漏洞能在任何警报触发之前将资金洗劫一空?
跨链桥持有大量储备资金,并跨越信任边界处理消息,然而大多数缺乏任何标准化的链上限速机制。EIP-7265 于 2023 年提出了一种断路器接口,Aave 的治理论坛也提交了相关资助提案,但截至 2025 年中,尚无主要跨链桥推出生产就绪的可互操作版本。当攻击者发现验证者集或消息验证漏洞时,由于没有任何机制限制资金流出速度,整个流动性池会在数分钟内被耗尽。2025 年发布的 SoK 论文证实,延迟提款和自动暂停是跨链桥类别中最未被实施的两项缓解措施。
为何重要: 一个可组合、与链无关的断路器能够将任何跨链桥漏洞的损失从全部损失限制为部分损失,从而改变整个互操作性堆栈的风险计算。
阅读完整分析Why does training data carry no machine-readable record of whether anyone consented?
The legal question of whether AI training requires consent is largely settled, courts and regulators say it matters. The practical question of how a consent signal travels with a piece of text through the crawl, deduplication, filtering, and mixing stages of a dataset pipeline has no answer. Robots.txt is binary and coarse, applies to crawlers not trainers, and is routinely ignored by closed-source pipelines. The EU TDM opt-out under Article 4 of the DSM Directive has no standard machine-readable format that a pipeline can verify at the item level. The 2025 Data Provenance Initiative audit found pervasive missing and ambiguous consent signals across major training datasets, meaning even a builder who wants to respect consent cannot technically do so because the record is not attached to the data.
为何重要: A per-item machine-readable consent signal is the primitive that lets regulation translate into engineering practice across the entire AI training pipeline.
阅读完整分析我如何审计在委托链中哪个代理以我的身份执行了操作?
当一个编排 AI 代理将子任务委托给子代理,而该子代理又使用原始用户的 OAuth 令牌调用第三方 API 时,身份链跨越多个提供商和认证方式,却没有任何单一的审计追踪能够记录完整路径。MCP 新增了 OAuth 2.1 支持,但规范中没有跨跳点链式委托授权的机制,也无法在不撤销整个会话的情况下撤销链中某个代理的权限。A2A 提供代理发现和请求签名,但明确将所有授权决策推迟给尚不存在的其他协议。2026 年 4 月发布的研究将递归委托问责列为当前代理身份标准中五个未解决的关键缺口之一。今天授权了一个代理的用户,没有任何实际方法来检查、限制或撤销下游代理以其名义执行的操作。
为何重要: 多代理系统已在生产环境中运行,而缺失的原语是一种可验证、可撤销的委托凭证,它能够沿链传递,而无需每个跳点共享同一信任域。
阅读完整分析为什么一份被污染的文档能悄无声息地窃取我的助手所了解的关于我的一切?
2025 年 6 月,Aim Security 披露了 EchoLeak,这是首例有据可查的零点击提示注入攻击,导致生产 AI 系统中发生真实数据泄露。一封恶意电子邮件导致 Microsoft Copilot 在无需用户交互的情况下静默传输敏感数据。结构性问题在于,具有持久记忆和工具调用权限的 AI 助手结合了两种危险属性:它们持有积累的个人上下文,同时可被诱使执行嵌入在不受信任内容中的指令。助手读取的每一份新文档、电子邮件或网页都是潜在的指令面。用户信任助手保存的记忆与助手从外部内容遵循的指令之间没有隔离边界,而现有的沙箱提案只针对工具调用,并不涉及记忆读取访问。
为何重要: 个人 AI 记忆使每份恶意文档都成为定向档案窃取攻击,这是一种尚无成熟防御手段的新型攻击类别。
阅读完整分析为什么在最关键的时刻,我无法信任模型的置信度分数?
现代语言模型经常在错误答案上输出高置信度词元,在正确答案上输出低置信度词元。这种声称概率与实际准确率之间的差距被称为校准误差,已在 2025 年一项涵盖熵、logit 和扰动方法的调查中针对前沿模型进行了记录。使用这些分数来决定何时推迟或弃权的生产代理直接继承了错误校准,因此它们要么以虚假的确定性产生幻觉,要么不必要地拒绝正确答案。目前没有任何开箱即用的原语能够提供校准后的、可操作的不确定性信号,且廉价到可以在推理时对流式响应中的每个输出词元运行。
为何重要: 校准是每一个代理决策背后的信任原语,没有它,所有下游安全阈值都建立在沙上。
阅读完整分析为什么在一个智能体的错误输出污染整个流水线之前,没有任何预警?
多智能体系统的故障率在41%至87%之间,仅协调失效一项就占故障总数的37%,然而目前没有任何可观测层能在级联风险蔓延之前将其呈现出来。微服务架构中,某个服务的延迟峰值会在拖垮其他服务之前出现在APM仪表盘上;而多智能体场景中,一个智能体产生的幻觉或错误输出会悄无声息地传播,直到下游智能体对其采取了不可逆的行动。多智能体环境中的涌现故障模式,包括级联幻觉、智能体间共谋以及信息泄露,无法通过单智能体安全评估来预测。《2026年国际人工智能安全报告》和2025年12月发布的《OWASP Agentic AI Top 10》均将级联放大列为一级风险,但目前没有任何生产级工具专门针对这一问题。
为何重要: 面向智能体流水线的级联可观测层,正是APM之于微服务的那种基础原语,而它目前尚不存在。
阅读完整分析为什么我无法获得证明我的数据已被实际删除的凭证?
GDPR 第 17 条要求企业删除个人数据,而 EDPB 2025 年协调执法报告将缺乏有据可查的内部删除程序列为整个欧盟司法管辖区最常见的合规失败原因。当用户提交删除请求时,企业以一封什么都证明不了的确认邮件作为回应。没有任何加密证据证明记录已从主数据库、备份或第三方处理器中删除。可验证删除的学术研究确实存在,包括 2024 年和 2025 年发布的基于 SGX 的证明和量子认证删除方案,但没有任何研究被打包成网络服务可以集成的实用、可部署的原语。这一差距不在于法律意愿,而在于缺少一种能将法规与可审计结果连接起来的技术工具。
为何重要: 用户可独立验证的删除凭证是将法律义务转化为信任关系的唯一产物,而目前没有任何广泛部署的系统能够提供它。
阅读完整分析我如何在代理基于幻觉内容采取行动之前,在流式传输过程中实时捕获幻觉?
幻觉检测如今发生在事后。模型输出完整响应,由一个独立的评判模型打分,再由人工或下游检查决定如何处理。在包含工具调用、网络搜索或代码执行的智能体流水线中,等到任何检查运行时,智能体可能早已基于一个虚构的实体或错误归因的事实采取了行动。2026年1月发表的一篇关于长链式思维推理中流式幻觉检测的论文表明,利用内部表示在生成过程中实时检测捏造内容是可行的,但该技术仍处于研究阶段,且需要访问任何公开API均无法获取的隐藏状态。当前的空白在于:一个兼容流式传输、与API兼容的幻觉传感器,能够在智能体采取不可逆行动之前对生成内容发出警告。
为何重要: 在智能体场景中,在工具调用之后才检测到幻觉为时已晚,代价不是一个错误的答案,而是一个错误的行动。
阅读完整分析为什么我无法知道正在运行的内容是否与我的 SBOM 所声明的一致?
SBOM 在构建时生成,描述的是构建声称包含的内容。当软件部署并运行时,依赖项可能已发生漂移,静态链接库不留任何运行时痕迹,也没有标准原语来验证运行中的进程是否与其声明的物料清单相符。IBM 2025 年对超过 35,000 份 SBOM 的分析发现,7,907 份未能披露直接依赖项,ENISA 2025 年 12 月的实施指南将运行时漂移列为核心待解差距之一。签名 SBOM 与运行中容器之间的鸿沟,目前仅凭信任来弥合。
为何重要: 欧盟和美国的法规现已强制要求提供 SBOM,但若缺乏运行时证明,它们只是审计工件,而非安全控制手段。
阅读完整分析如何验证持有我资产的 AI 代理确实具备偿付能力?
自主 AI 代理被越来越多地授予加密钱包的签名权限,用于支付算力、API 及链上服务的费用,但若不跨多条网络读取原始链上状态,就没有标准方法来审计代理持有、欠付或已支出的资产。当代理同时跨多条链、多种资产类型运行时,其净头寸无法原子性查询,这意味着接受代理付款的交易对手无法可靠地确认该代理是否已资不抵债或存在双重承诺。适用于人类企业主体的金融原语,如资产负债表、经审计的储备金和可调用信用额度,在链上都没有等价物,代理运行时无法对外暴露,第三方也无法在不信任代理自身报告的前提下加以验证。随着代理间商业往来的增长,缺乏机器可读的偿付能力接口将带来结算风险,其不透明程度堪比 2008 年前的表外工具。
为何重要: 代理的金融问责机制,是将投机性代理商业与能够承载真实经济价值的商业区分开来的缺失信任原语。
阅读完整分析Why can crafted content my agent reads authorize my on-chain wallet to transfer funds?
An AI agent with signing authority over a crypto wallet processes arbitrary external content as part of its task context: web pages, emails, documents, API responses. Nothing in today's signing infrastructure separates instruction sources from each other, so a page the agent is asked to summarize can embed hidden transfer instructions the agent interprets as a legitimate task and executes. Wallet standards like ERC-4337 session keys model the problem as what can this key do, not where did this instruction originate. No agent runtime today filters signing decisions by instruction provenance, which means a wallet authorized to move funds is exactly as safe as the most hostile document the agent will ever read.
为何重要: Agents with on-chain keys are in production now, and every piece of content they process is a potential attack vector against the funds they control.
阅读完整分析Why do I only find out what dangerous things my model can do after it ships?
Automated red-teaming tools such as GCG, AutoDAN, and PAIR report attack success rates of 5 to 15 percent and give a false sense of safety. Multi-turn human red-teaming on the same models finds failures up to 75 percent of the time on the same categories. The gap means that dangerous capability uplift in areas like bioweapon synthesis guidance or offensive cyber is being missed at the automated pre-deployment stage and found in the field instead. Frontier labs run their own manual evaluations under frameworks like Anthropic's RSP and METR's TaskDev, but the methodology is undocumented and non-standardized enough that no two labs run comparable tests. NIST's AI agent red-teaming guidance was still an annotated outline in early 2026, with full publication expected late 2026 to 2027.
为何重要: A dangerous emergent capability discovered post-deployment in a widely distributed model is a different order of problem than one caught before release.
阅读完整分析我怎么知道 AI 助手写的代码实际上是正确的?
大语言模型生成的代码能通过单元测试,但不满足任何形式化属性。模型可以构造出本身就能通过的测试,而非因为逻辑正确才通过。形式化验证工具存在,但需要用定理证明器语法编写规范,几乎没有在职开发者会这样做。近期基准测试显示,前沿模型在端到端可验证代码生成上的成功率仅为 3.2%,这意味着看起来合理的代码与经过证明的正确代码之间的差距几乎完全敞开。将 AI 编写的代码发布到生产环境的团队,实际上是在押注于测试覆盖率,而这恰恰是模型自身可以操控的。
为何重要: 对 AI 生成代码的自动化正确性保障,是将编码助手从提速工具转变为可靠性工具的关键。
阅读完整分析我怎么知道上周部署的智能体今天的行为是否还和以前一样?
模型提供商持续更新权重、调整量化级别,并在不同硬件间重新路由流量,且不更改端点名称,也不发布变更日志。2026 年 4 月,大量 Claude Code 质量投诉被追溯到产品层面的变更,没有模型版本更新,没有通知,开发者无法在不自行测量输出的情况下发现回归。基于特定模型检查点构建的产品,可能在拒绝模式、工具调用行为或输出格式上悄然漂移,数周后才有人察觉。目前没有任何工具能对已部署智能体在实时端点上进行行为指纹采集,并在该指纹发生偏移时发出告警,而这恰恰是每个软件团队在每次库依赖升级时都会执行的回归测试。
为何重要: 如果没有与模型版本绑定的行为监控,每次提供商更新都是一次无声的回归,在你发现之前就已悄然影响到你的用户。
阅读完整分析为何用我的文字训练模型,模型上线后我却一无所获?
每一个大型语言模型都建立在数十亿个由真实个体撰写的文档之上,却没有任何技术机制能够追踪某位创作者的作品对某个模型输出究竟产生了多大影响。影响函数等数据归因方法虽存在于学术研究中,但无法扩展到拥有数千亿参数、在万亿级标记语料库上训练的模型。一篇2025年的立场论文指出,训练数据理应是大型语言模型中成本最高的部分,正因为其价值目前被外部化转嫁给了那些毫无所获的创作者。2026年3月提出的Sovereign Context Protocol方案以及2026年2月的以人为中心数据归因框架,均试图填补这一空白,但迄今为止没有任何主流模型提供商在生产环境中部署过这两者。没有可运作的归因原语,就没有补偿或许可谈判的技术基础,
为何重要: 规模化归因是将无偿抓取与数据创作者和模型开发者可以平等谈判的市场区分开来的关键缺环,没有它,任何自愿或监管性的许可方案都无从落地。
阅读完整分析为什么我的智能体在任何合理预算都应该叫停它之后,仍然持续消耗资源?
运行多步骤工作流的AI智能体消耗token的速度是单次查询的20至100倍,但目前没有任何基础设施层面的原语能在运行时强制执行消费或算力上限。当两个智能体陷入递归的澄清循环,或检索智能体过度拉取上下文时,唯一的信号是月底的账单。LangGraph和AutoGen等框架各自处理重试和检查点,但没有一个能执行在声明预算被突破时停止运行的资源契约。2026年1月的一篇arXiv论文对此类契约的形式化描述进行了规范,但从该形式化描述到能跨模型提供商和工具调用部署的实际原语,差距依然巨大。
为何重要: 运行时资源契约是让智能体部署能够安全交付给非工程师的缺失安全层。
阅读完整分析为什么我的待处理交易在被打包之前就向构建者暴露了完整意图?
FOCIL(EIP-7805)针对的是哪些交易能被打包的审查问题,计划纳入2026年底的Hegota升级。它对在区块最终确定之前向构建者隐藏交易内容毫无作用。构建者仍然可以明文读取每一笔待处理交易,并在打包前通过夹击或歧视性排序来套利。加密内存池方案LUCID是预期的补充方案,但仍处于活跃设计阶段:门限解密需要委员会重建密钥,若超过门限数量的委员会成员下线,协议将中止或停滞。在该设计最终确定并大规模部署之前,FOCIL和ePBS共同防止了打包层面的审查,却在结构上对打包前的套利行为束手无策。
为何重要: 打包前的交易内容隐私是缺失的关键一环,它能阻止构建者利用排序权力从用户处套利,无论采用何种打包机制或拍卖机制。
阅读完整分析如何判断推理模型的草稿本是否真正驱动了它的答案?
输出可见思维链的前沿模型,往往在这些推理步骤之前或独立于这些步骤便得出了答案,随后才生成看似合理的推理作为事后合理化。现有的忠实度指标因分类器构建方式不同而相互矛盾,这意味着对于忠实的轨迹究竟是什么样子,目前并没有公认的基准。没有任何生产级工具能在推理时标记不忠实的推理过程,也没有工具能对轨迹是否导致输出给出任何置信度。将可见推理视为模型行为解释的受监管行业和安全审查,实际上依赖的可能只是事后构建的叙事。
为何重要: 如果推理轨迹只是事后的合理化,那么建立在其上的每一项审计、问责主张或合规检查都将失效。
阅读完整分析为什么我在 AI 工作流上线之前无法预知其成本?
2025 年,尽管每 token 价格下降了约 1,000 倍,企业 AI 推理支出仍增长了 3.2 倍,驱动因素包括代理循环、上下文窗口膨胀和常驻监控代理。一个每次调用费用为 $0.06、每分钟重试 1,000 次的失控代理,单日即可产生 $86,400 的支出。现有的云 FinOps 工具对此无能为力,因为推理成本取决于语义输入长度、工具调用放大效应和循环深度,而这些在规划阶段均无法预知。目前没有针对 LLM 工作流的标准预生产成本估算工具,CFO 也无法将 AI 推理费用建模为可预测的预算项。
为何重要: 如果在上线前没有可信赖的成本模型,每一款 AI 产品都将是预算彩票,而非真正的商业产品。
阅读完整分析为什么我无法查看或删除助手对我的记忆内容?
每一款具备持久记忆的主流 AI 助手都会跨会话存储用户相关事实,但面向用户的界面只是一份简略摘要列表,而非可审计的日志。目前没有标准方法来检视某条具体推断是何时写入的、由什么触发的,或者是否已被共享至检索管道。当用户要求助手遗忘某些内容时,删除操作是不透明的。底层向量存储可能保留了嵌入向量,对话日志可能被依法调取,也没有加密证明能证实删除已完成。IAPP 和欧盟《人工智能法案》均呼吁建立具备可调用删除证据的可审计记忆机制,但目前尚无产品实现这一点。
为何重要: 没有可验证的审计追踪,用户可控的记忆不过是一场表演,因为用户无法行使他们看不见的权利。
阅读完整分析Why does proving a model ran correctly still take longer than running it?
Zero-knowledge proofs of ML inference can verify that a model produced a given output from a given input without revealing the weights. This would let crypto applications consume AI outputs trustlessly without relying on TEEs or operator reputation. The problem is performance: generating a ZK proof for a GPT-2-scale model takes tens of minutes; at GPT-3 scale it is measured in hours. Floating-point arithmetic in transformers compiles inefficiently to arithmetic circuits, and the attention mechanism is especially costly to prove. TEE-based attestation papers over this gap but requires trusting hardware vendor firmware rather than math. Until proof generation drops by two to three orders of magnitude, every verifiable AI primitive in crypto is trading one trust assumption for another.
为何重要: The credible-neutrality promise of crypto-native AI depends on ZK proofs that are fast enough to use in production, and today they are not.
阅读完整分析Why does showing my mental-health credential reveal which clinic issued it?
Selective disclosure lets you share a single attribute without exposing your other data, but it cannot hide which institution signed the credential. A presentation from a credential issued by a psychiatric facility, an HIV clinic, or a criminal court tells the verifier something sensitive before a single attribute is shared. The EU Digital Identity Wallet Architecture and Reference Framework mandates issuer-hiding, but a June 2026 technical audit of the wallet finds no deployed mechanism that achieves it. Solutions in the research literature, anonymous credential schemes, issuer-set membership proofs, are incompatible with the SD-JWT and mdoc formats already locked in as the wallet defaults. Every sensitive-domain deployment today ships on a standard that leaks the one thing it was supposed to protect.
为何重要: Issuer-hiding is the missing layer that makes selective disclosure usable in exactly the domains where privacy matters most.
阅读完整分析为什么协议可以毫无预警地悄悄替换管理我资金的代码?
大多数 DeFi 协议使用可升级代理合约,管理员密钥可通过单笔交易替换整个实现。用户在协议中存有资产时,没有可靠的方式检测升级是否待定、验证变更内容,或在新代码生效前及时退出。OWASP 在其 2026 年智能合约 Top 10 中将代理与可升级性漏洞列为全新类别,这是首个由治理失败而非代码层面漏洞驱动的新增项目。2025 年 12 月,Unleash Protocol 遭攻击者利用多签治理路径强制执行未授权升级,损失 390 万美元,用户资金被悉数盗空。目前,审计公司、协议和钱包之间尚无统一标准,无法在升级发生前及时向用户发出足够预警以便采取行动。
为何重要: 未经宣告的代理升级在执行瞬间与漏洞利用毫无区别,而用户目前没有任何手段在关键时刻区分两者。
阅读完整分析如何获得加密证明,证明我调用的远程模型按规定运行?
云 AI API 返回的输出不包含任何可验证的证据,无法证明运行的是哪个模型版本、采用了何种量化精度,或上游预置了什么系统提示。基于 NVIDIA Hopper 硬件的 GPU 机密计算可以证明硬件状态,但证明证据从未到达 API 调用方,信任链终止于供应商控制的证书基础设施内部。2026 年 6 月的一篇论文提出了基于 TEE 的可验证安全基准,但目前没有任何生产级 API 向调用方提供每次调用的推理收据。任何对模型身份有要求的对抗性或受监管场景,都必须信任供应商的一面之词。
为何重要: 没有可验证的推理收据,关于远程模型调用的每一项安全、合规和对齐声明,都只能依赖供应商信任,这对于受监管的部署或自主代理技术栈而言远远不够。
阅读完整分析为什么开源模型生成的文本无法被可靠地溯源追踪?
闭源模型提供商可以在推理时向生成文本中嵌入统计水印,从而在事后将内容归因于特定模型。开源模型让用户完全访问解码过程,因此只需修改几行采样代码即可去除任何生成时的水印。对已生成文本进行事后水印标记在改写攻击下会失效。将标记嵌入模型权重能抵御部分攻击,但无法抵御微调——任何在本地运行权重的人都可以在一个下午内完成微调。截至2025年底,尚无任何方案能为开放权重模型的输出提供实用、防删除的来源标记,学术界也承认这一问题尚未解决。
为何重要: 对于开放模型,在没有水印的情况下,AI生成文本的来源仅在生成方主动配合时才可追溯。
阅读完整分析为什么内容一上传到社交媒体,C2PA溯源链就会断裂?
C2PA加密清单嵌入文件本身,可在存储和直接分享中保留,但截至2026年,包括Instagram、X、LinkedIn和TikTok在内的所有主流社交平台在上传转码和重新编码时都会剥除这些清单。结果是,一段内容可能经过相机、新闻编辑室和合规AI生成器的签名,却在信息流中呈现时没有任何溯源信息。欧盟《人工智能法案》第50条和加利福尼亚州SB 942要求对AI生成内容进行机器可读披露,但仅依赖元数据的合规方式恰恰在大多数人实际接触内容的分发节点上失效。目前没有任何机制能强制平台保留清单,也无法在剥除后重建溯源信息——除非有一个在内容捕获时就已存在的可信第三方账本,而这样的账本目前并不存在。
为何重要: C2PA正在成为监管基准,而主要的分发层却在主动破坏其信号,使这一标准在最关键的地方几乎无法执行。
阅读完整分析为什么代币化现实世界资产能够募集资金,却几乎从不实际交易?
截至2026年中,链上代币化现实世界资产规模超过250亿美元,然而2026年6月一篇涵盖九大RWA产品的论文发现,大多数产品呈现出成交量微乎其微、持有者被动、二级市场活动接近于零的特征。代币化创建了一个在法律上代表资产的代币,却没有创造买家、做市商或传统交易所所提供的清算规范。监管碎片化将潜在买家限制在少数法规明确的司法管辖区,因此任何一个代币的可触达流动性池都是全球投资者基础的极小部分。结果是发行方将区块链用作融资通道,之后便停止了,因为非流动性资产的二级市场基础设施、托管方接入和AMM设计根本尚未建立。
为何重要: 针对代币化资产的可信二级市场原语,是将链上资本形成转化为真正流动性提升的缺失层级。
阅读完整分析How do I know the decentralized GPUs I rented actually ran my training job?
Decentralized compute networks let anyone rent GPU capacity to train AI models and receive the resulting weights. The user gets a file, not a proof. Nothing today verifies that those weights came from the training run as specified: an operator could return a pretrained checkpoint, run fewer gradient steps, or swap the dataset entirely. Inference verification, checking a single forward pass, is already hard for ZK proofs; training verification is harder by an order of magnitude because gradient descent is a long sequential process, float16 arithmetic introduces non-determinism that breaks bitwise reproduction, and the training data may be private. Every major DePIN compute network relies on reputation and economic incentives to deter cheating, not cryptographic receipts.
为何重要: 去中心化AI训练经济建立在一次握手之上,没有任何参与者能够验证他们付费的计算是否真正发生过。
阅读完整分析为什么我无法追踪跨越消息队列的生产故障?
分布式追踪假设存在一个连通的 span 图,但真实的微服务架构会将大量流量通过消息队列、事件流和异步回调进行路由,从而破坏 span 的传播。当故障源于队列边界的下游时,现有的可观测性工具只能看到互不关联的片段,无法建立因果关系。近期针对生产微服务系统的根因分析研究明确指出,这些异步盲点是当前工具的主要失效模式;2025 年 CNCF 调查发现,78% 运行微服务的组织将可观测性缺口列为首要运营挑战。在重度依赖队列的架构中,团队最终不得不手动关联日志时间戳来定位故障根源。目前没有任何生产级工具能够跨越异构传输层弥合这一缺口。
为何重要: 弥合异步边界的追踪缺口,能让可观测性工具真正适用于大多数生产系统如今所采用的事件驱动架构。
阅读完整分析为什么我的自主智能体在重启后,其声誉和签名密钥会消失?
一个跨会话进行预约、谈判或交易的自主智能体,需要持久且可验证的身份:一个能够在崩溃、提供商切换和模型升级中幸存的签名密钥、交易历史和声誉。如今,这种身份存储在提供商或框架控制的会话存储中,一旦重启运行时或更换底层模型,身份便会消失。2025 年一篇对 AI 身份标准进行调研的论文发现,现有标准均未解决智能体在重启或提供商变更时的身份连续性问题,仅涉及请求级别的身份验证。链上密钥对可以持有持久的智能体身份,但目前尚无标准规定智能体如何认领、轮换和委托一个比任何单一运行时更持久的密钥,也没有规定交易对手如何验证当前行动的智能体与之前打过交道的是同一个。
为何重要: 没有可移植、可验证的身份,自主智能体就无法积累交易历史和交易对手信任,而这正是让它能够胜任任何重要任务的前提。
阅读完整分析为何换了医疗机构后,我的健康档案无法随我转移?
美国没有全国统一的患者身份标识符:国会自1998年起以隐私为由阻止了这一标识符的建立,导致各机构只能依据姓名、出生日期和地址对患者进行概率性匹配。FHIR提供了健康档案的标准传输格式,但没有可靠的身份层,同一个人在每家机构都以不同的记录呈现,合并错误或匹配失误也在无声无息中发生。美国国家卫生信息技术协调办公室在其2026年年会材料中报告,仅有43%的美国医院在所有四个互操作性领域中常规参与。2026年起生效的新联邦法规要求基于FHIR的事先授权工作流,这正在将这一身份缺口暴露于规模化场景之下,受拒的授权申请和中断的医疗衔接是患者承受的直接代价。算法匹配虽然存在,但会产生误报和
为何重要: 一个无需中央政府身份标识符、可跨机构运作的患者身份层,是让所有其他医疗互操作性法规真正落地并达成预期效果的基础原语。
阅读完整分析为何收取稳定币的供应商仍面临未对冲的本地货币风险?
巴西或尼日利亚的企业以USDC接收出口货款时,收入以美元计价,但工资和运营成本却以本地货币结算。BIS Working Paper 1340基于2021年至2025年间64家交易所中四种美元稳定币与27种法币的交易数据,记录了大量且持续存在的汇率偏差,并表明稳定币流入会压低本地货币并推高外汇掉期市场的美元融资成本。传统远期合约需要银行关系及最低交易规模,大多数中小企业均被排除在外。链上永续合约和期权市场虽覆盖主流货币对,但在深度以及稳定币实际支付最活跃的走廊所涉及的特定本地货币对方面均存在不足。最可能通过稳定币摆脱残缺银行基础设施束缚的企业,恰恰是那些没有有效工具来管理由此产生的货币
为何重要: 一种链上的、可获取的针对新兴市场货币对的外汇对冲工具,是让稳定币对最需要它的中小企业的采用真正具有持续性的基础原语。
阅读完整分析为什么监管机构只能通过人工阅读来发现欺骗性同意界面?
GDPR和FTC规则要求同意须是自由给予、明确无误的,但检测完全依赖人工:调查员访问网站、走查流程、撰写报告。2026年的一项arXiv研究发现,监管从业者明确希望实现自动化检测,却没有可行的工具能大规模运行。暗模式会动态变化:某项服务可以在审查期间隐藏退出路径,之后再将其恢复。面对数以百万计的网站和寥寥数位检查员,执法是被动的、迟缓的,且在地域上分布不均。目前不存在任何机器可读的同意记录标准,使审计员能够重放用户在特定时刻所经历的确切UI流程。
为何重要: 自动化、可证明的同意核验将把执法从事后调查转变为可扩展的实时合规检查,从而使暗模式在经济上无利可图。
阅读完整分析为什么独家订单流让两家构建者主导了以太坊86%的区块生产?
钱包、应用与少数构建者之间的私有订单流协议,赋予这些构建者随时间不断积累的结构性信息优势。Beaverbuild和Titan Builder在2025年初的两周内生产了约86%的以太坊主网区块,区块构建的赫芬达尔-赫希曼指数从2023年底的约0.2上升至2024年中的0.35。ePBS将构建者-提议者拍卖移至链上,但并未切断独家协议管道:掌握大多数私有订单流的构建者在协议变更后仍然赢得大多数拍卖。BuilderNet是一种自愿性对策,缺乏链上强制执行,截至2026年1月,它仅生产了25.5%的区块。这一反馈循环具有自我强化性:只有市场份额高的构建者才能吸引独家订单流,而只有拥有独家订单流的构建者才能持续胜出。
为何重要: L1层两家构建者形成的实际垄断意味着,这两个实体可以对链上任何交易进行重排或延迟,无论共识协议如何规定。
阅读完整分析我如何判断自己正在微调的开放权重基础模型没有被投毒?
植入预训练模型权重的后门在全参数微调、适配器训练和RLHF更新后依然存在,因为触发模式能够在目标偏移和部分冻结策略下存活。这些触发器对标准行为安全测试和基准评估不可见。检测它们需要进行白盒权重分析,而普通微调从业者从不执行此类分析,主要模型平台在检查点公开下载前也不进行强制扫描。在受损基础模型上构建生产系统的组织,在触发器于部署中触发之前,根本不会收到任何异常信号。
为何重要: 开放权重微调供应链没有安全门控,其失效模式是一个能够通过所有标准检查的后门。
阅读完整分析任何人如何验证智能体的支付操作与人类的真实意图相符?
当AI智能体执行链上或稳定币支付时,收款方、审计方和监管方均无法获得机器可验证的证据,证明人类委托人以特定意图授权了这笔特定交易。现有智能体框架生成的是日志,而非证明。IMF于2026年4月指出,重塑支付体系的自主AI造成了一个结构性问责缺口:如果智能体将资金发送至错误地址或超出其授权范围,在结算时没有任何方法区分已授权行为与智能体越权行为。密码学签名的用户授权在研究层面已作为概念存在,但目前没有任何已部署的支付标准在结算时要求或验证此类授权。
为何重要: 结算时缺乏可验证人类意图的程序化货币,相当于大规模开具无签名支票,任何审计方或监管方都无法无限期地接受这一现状。
阅读完整分析当我的稳定币被销毁而无法院命令时,我该找谁?
于2025年7月签署的《GENIUS法案》要求稳定币发行方依据合法命令冻结、没收或销毁代币,但何为合法命令未有明确界定,冻结到销毁的流程没有强制申诉窗口,受影响地址也不会收到事先通知。截至2026年初,Tether已将近10,000个持有逾50亿美元资产的地址列入黑名单,其中大多数无需司法令状。发行方将执法视为无申诉路径的单向行为。透明、有时限且可撤销的链上执法工程基础设施,在当前整个生态系统中都不存在。
为何重要: 大规模可编程货币的信任基础,要求冻结机制具备可审计性、有时限性,并可由受影响方提出异议。
阅读完整分析为什么关键开源软件至今仍依赖一位精疲力竭的维护者?
2025年11月,Kubernetes 退役了 Ingress NGINX——这是其部署最广泛的组件之一,退役的原因并非被更好的方案取代,而是志愿维护者团队再也无力维系下去。与此同时,在全球关键企业流水线中广泛使用的 External Secrets Operator,在其五名维护者中的四人同时耗尽精力后,冻结了所有更新。行业调查显示,60% 的开源维护者无偿工作,44% 的人将精力耗尽列为离开或考虑离开的原因。Open Source Pledge 和 GitHub Sponsors 等资助项目虽然存在,但解决的是资金问题,而非真正的瓶颈——审查队列积压。目前没有轻量级的自动化系统,能够将工作上下文、测试覆盖预期和威胁模型知识从离任维护者持久地转移给继任者,因此每一次离任都几乎将项目重置为零。
为何重要: 全球软件基础设施运行在那些依赖个人善意才能延续的组件之上,而让维护者交接既安全又高效的工具根本不存在。
阅读完整分析为什么一笔闪电贷仍然可以伪造价格并掏空一个价值一千八百万美元的协议?
价格预言机操纵是OWASP 2026智能合约Top 10中的SC03,持续造成八位数损失:2026年7月Ostium损失1800万美元,2025年7月GMX损失4200万美元,2025年3月单一攻击者操纵Polymarket上的UMA治理损失700万美元。根本原因在于链上价格来源于那些本身可以在单笔原子交易中或在短时间窗口内被资金充裕的攻击者操纵的市场。TWAP防御延长了攻击窗口,但并不能消除它。去中心化预言机网络增加了链下聚合器和验证者集合,但引入了其自身的信任假设。一个纯粹的链上、抗操纵、无需可信第三方的价格原语目前并不存在。
为何重要: 在无需信任的价格原语出现之前,每一个对任何资产定价的DeFi协议都面临此类攻击的威胁。
阅读完整分析为什么在当今互联网上训练的模型会随着AI生成内容的增多而逐渐变差?
互联网现已成为前沿模型的主要训练语料库,并已充斥着没有任何已部署过滤器能够可靠识别的AI生成文本。2024年至2026年间发表的研究表明,训练过程中即使是千分之几的合成数据也会在连续世代中触发分布崩溃,导致输出多样性收窄,尾部性能下降。这一反馈循环具有结构性:今年训练的模型产生的内容会污染明年训练运行的语料库。所提出的缓解措施,如来源级白名单、水印过滤器和合成数据验证器,各自都有绕过途径,且均未在网络爬虫规模上部署。目前尚无公认的协议来识别和隔离AI生成的训练数据,以防其进入模型。
为何重要: 不断退化的共享训练语料库为所有基于公共数据构建的模型设定了上限,且这一上限随着每一代模型的迭代而不断降低。
阅读完整分析为什么我无法精确回放智能体在生产环境中失败时的操作?
在生产环境中失败的大语言模型智能体无法可靠地复现以供调试,因为重新运行相同的提示词会产生不同的输出。大多数智能体框架只记录输入和最终输出,而丢弃了完整的执行追踪,这意味着每次运行结束后,所有中间工具调用、模型响应和状态变更均会消失。没有执行溯源,一次失败的运行就是一个取证的黑洞,工程师只能从表象而非根因来重建故障。2026 年 5 月的一篇论文提出将确定性执行图作为解决这一问题的基础原语,但指出在生产规模下捕获和回放非确定性追踪而不产生过高开销,仍是一个悬而未决的工程难题。2026 年另一项关于科学工作流中智能体失败的案例研究发现,看起来合理但实际错误的中间步骤之所以在流水线中悄然传播,正是因为没有相应的回
为何重要: 可复现的调试是以任何信心在生产环境中运行 AI 智能体的最低可行原语。
阅读完整分析为什么更换被盗钱包会抹去我所有的链上历史?
当私钥泄露或丢失时,唯一安全的做法是放弃该地址,但所有链上声誉、治理投票、借贷历史和证明都留在了旧密钥上。将这些记录迁移到新地址需要公开发布两者之间的关联,这会永久性地去匿名化两个地址。现有的ZK身份方案能处理全新的匿名集,但无法在假名之间迁移已积累的历史。2025年的一项arXiv去中心化身份系统调查将密钥可恢复性列为所有主要DID方法中两大尚未解决的核心属性之一。目前不存在任何生产级原语,能让用户在零知识条件下向新地址证明身份连续性,同时保持新旧地址之间的关联不被公开。
为何重要: 没有安全的迁移原语,对于任何拥有大量链上历史记录的人来说,密钥轮换几乎是不可能的,这意味着已泄露的密钥会比应有的时间更长地保持活跃状态。
阅读完整分析为什么我的钱包无法验证它所信任的 RPC 节点是否说了实话?
几乎每一个 dApp 和钱包都通过 Infura、Alchemy 或类似的中心化服务商来路由其区块链查询。这些服务商可以返回被篡改的状态、审查交易,或直接下线,而用户在密码学层面毫无保障。轻客户端可以验证特定值的 Merkle 证明,但必须从可信区块头引导,并依赖对等节点提供数据可用性。一篇被 IEEE ICDCS 2025 接收的论文指出了核心困境:无需许可的公共 RPC 端点缺乏问责机制,而注册服务商虽有问责但需要许可访问,且没有任何经济激励驱使利他型全非验证节点大规模提供读取流量服务。目前没有任何生产系统在单一协议中同时实现密码学可验证性、开放参与和可持续激励。
为何重要: 如果 RPC 层可以无代价地撒谎,用户就无法保证自己读取到的链状态是真实的,也无法确认其签名交易是否被诚实广播。
阅读完整分析为什么我使用的每个 Rollup 仍将交易排序权交由单一运营商掌控?
目前每一个主流 L2,包括 Arbitrum、Base、OP Mainnet 和 zkSync,都将所有交易路由至一家单一机构运营的排序器。该运营商决定交易执行顺序,可以审查特定地址,并在对用户毫无实质问责的情况下独吞排序器 MEV。仅 Arbitrum 和 Optimism 就已提取逾 7 亿美元的 MEV。Espresso Systems 等共享排序器方案目前停留在研究阶段和早期测试网,截至 2026 年 4 月,尚无任何方案在生产主网 L2 上线。去中心化路线图一再推迟至下一个发布周期。
为何重要: 拥有单边排序权的排序器既是审查瓶颈,也是监管靶点,从根本上动摇了每个 Rollup 宣称自身为中立基础设施的立场。
阅读完整分析为什么当测试集从未出现在训练数据中时,模型排行榜分数会骤然崩溃?
MMLU 等静态基准的数据污染率高达 45%,改写或翻译后的测试题能够绕过精确匹配去污染手段,同时仍然虚高已发布的分数。一个模型可以在受污染的任务上登顶排行榜,却在同一任务被干净地改写后失败。定期刷新任务的动态基准虽然存在,但缺乏标准化的设计标准,导致其结果无法相互比较,也无法验证是否能真正代表所声称衡量的能力。排行榜上发布的每一项能力和安全声明,都依赖于没有任何独立方能验证其清洁性的数据。
为何重要: 可信的评估是所有下游安全与部署决策的前提,而这些决策所依赖的数据目前并不可信。
阅读完整分析为什么我的稳定币能跨越大洋,却无法抵达本地银行账户?
稳定币可以在数秒内完成跨境价值转账,但将机构级 USDC 流量大规模兑换为 BRL、NGN、MXN 或 PHP,用于发放薪资、缴纳税款或结算供应商发票,至今仍碎片化且往往无法实现。大多数出金服务商缺乏必要的银行关系、合规基础设施或 API 可靠性,难以在新兴市场走廊处理每日超过六位数的稳定流量。企业不得不拼凑多家 KYC 标准和结算窗口各异的服务商。稳定币轨道很快,但通往本地银行账户的最后一米却不然。
为何重要: 可靠、可编程的法币出金层,才是将稳定币从交易工具转变为真正商业基础设施的关键。
阅读完整分析为什么查验我的凭证是否被吊销,会让签发方知晓我每次使用它的地点?
每个已部署的可验证凭证系统都需要吊销机制。主流方案 W3C Bitstring Status List 要求验证方在出示凭证时获取由签发方控制的状态端点,因此签发方能够确切得知每张凭证被使用的时间和地点。URL 加上凭证在位字符串中的固定位置,足以在不同验证方之间重新识别持有人身份,从而逆转了自我主权身份设计之初所承诺的隐私保护。CRSet 是一种于 2025 年 1 月发布的零知识累加器方案,从理论上解决了这一问题,但目前没有任何具有一定规模的签发方推出了不会将出示元数据泄露给自身的吊销方案。
为何重要: 兼具监控功能的吊销机制,从根本上背叛了持有人控制身份的核心隐私承诺。
阅读完整分析为什么没有安全、无需信任的方式来实时轮换 MPC 密钥份额?
机构级 MPC 钱包将签名份额分散到多个参与方,使得没有任何单一服务器持有完整密钥,这相比单密钥托管是一个实质性的进步。然而,当某个份额疑似遭到泄露时,在不于任何单一位置重建完整密钥的情况下轮换份额,需要一种大多数已部署系统在生产环境中并不支持的主动秘密共享刷新协议。轮换仪式通常需要所有份额持有方进行同步在线操作,若有任何一方不可用或存在恶意,整个流程就会阻塞或失败。目前不存在任何开放、经过审计的异步主动刷新标准,供桥接团队在无需自行实现密码学的情况下直接采用,导致许多托管方只能继续使用无法安全轮换的陈旧份额。
为何重要: 异步主动刷新原语将使任何 MPC 架构都能在对抗条件下轮换已泄露的份额,而无需在任何时候实体化完整密钥。
阅读完整分析为什么当我的智能体出错并耗尽某个协议的资金时,没有相应的惩罚条件?
权益证明验证者因模棱两可行为而遭到惩罚,因为该不良行为具有明确无误的链上定义。AI智能体越来越多地设定DeFi风险参数、执行交易并管理协议国库,但目前尚无针对它们的质押与惩罚体系,因为缺少一个关键要素:智能体不当行为的确定性链上定义。一个产生幻觉性抵押率或执行错误交易的智能体造成的危害与恶意验证者相同,但该行为无法仅凭链数据加以证明。在没有惩罚条件的情况下,智能体运营者对正确性没有经济上的利害关系,而将控制权委托给智能体的协议也无法向用户可信地承诺损失将得到覆盖。
为何重要: 经济上的切身利益是验证者网络值得信赖的根本所在,而控制链上资产的AI智能体在被委以重任之前,同样需要这一基础机制。
阅读完整分析我如何判断我的智能体在不同版本之间确实有所提升,而不只是运气好?
当一个智能体在数小时内执行数百个顺序步骤时,传统的A/B评估方法便会失效,因为早期的工具调用会影响每一个后续选择,使得结果在不同运行之间具有路径依赖性。运行足够多的独立试验以获取可靠信号所需的算力,与训练本身相当。该领域默认使用步骤成功率和工具调用准确率等代理指标,而这些指标被证明与真实工作中的最终任务结果不相关。2025年对445个已发布LLM基准测试的审计记录了大规模的构建效度失败:任务定义模糊、短时序数据集被挪作他用以及缺少统计检验,所有这些问题都随着任务时序的延长而愈发严重。构建智能体产品的团队依靠人工抽检来发布产品,因为目前尚不存在针对长时序智能体的、有原则且可复现的评估方法。
为何重要: 如果没有可靠的方法来衡量智能体是否有所提升,就无法对已部署在高风险任务中的智能体进行系统性改进。
阅读完整分析为何将个人数据上传至区块链会使法律层面的删除成为不可能?
GDPR第17条赋予用户要求删除其个人数据的权利,但公共区块链和许可型区块链在设计上均为只追加模式,因此任何写入链上的个人数据都将永久存在。目前通行的两种规避方案是:仅存储哈希值并删除加密密钥,或将数据保存在链下而链上仅存储指针。两者均未获得法律层面的明确认可:监管机构尚未确认删除密钥是否满足删除权的要求,而链下指针在后端存储发生变化时可能静默失效。欧洲数据保护委员会发布的《指南02/2025》明确指出了区块链不可篡改性与GDPR存储限制原则之间的冲突,但未提供技术层面的解决方案。每一个涉及受监管个人数据的通证化资产、链上身份和DeFi协议,都因此承载着这一悬而未决的合规风险。
为何重要: 一种获得法律认可的链上选择性删除原语,是让受监管金融数据、医疗记录和身份凭证在账本上存储而不产生永久合规风险的关键所在。
阅读完整分析智能合约如何为几乎从不成交的资产定价?
通证化私人信贷、商业房地产和基础设施基金是增长最快的RWA类别,但它们几乎没有活跃的订单簿可供读取。2026年5月一项针对九个非稳定币RWA市场的实证研究证实,大多数此类资产的二级交易量接近于零,也没有可靠的市场价格。当DeFi借贷协议将这些通证作为抵押品时,只能依赖通过中心化预言机推送的季度性第三方评估,这一过程不仅缓慢、昂贵,还容易出现数据陈旧的问题。链上的持续结算与链下的阶段性估值之间的落差意味着,抵押品可能在评估周期之间悄然跌破抵押率,却没有任何机制触发追加保证金的通知。
为何重要: 一种针对流动性不足的通证化资产、抗操纵的连续价格原语,是让RWA抵押品在DeFi借贷中安全运作的缺失环节。
阅读完整分析为什么我无法暂停正在运行的智能体、纠正其方向,并让它干净地恢复运行?
长时运行的智能体任务可能跨越数百次工具调用,持续数小时,但目前可用的控制手段只有两种:让任务运行完成,或直接终止。用户在运行途中发现错误时,无法注入修正指令、检查已积累的状态,也无法在不丢失所有前期进展的情况下重定向任务,否则便会向智能体注入与其所作用的世界状态脱节的上下文。2026 年 4 月的一篇 arXiv 论文首次系统研究了环境受限的智能体场景中的可中断性问题,揭示了当用户意图在执行中途改变时,现有智能体的脆弱程度。基础设施厂商在 2025 年底和 2026 年初发布了能够处理崩溃恢复的持久化执行运行时,但语义中断能力——即改变智能体目标而非重启它的能力——仍未被实现。
为何重要: 语义可中断性是将只能运行一次的演示转变为非工程师也能信赖的生产工具的关键所在。
阅读完整分析为什么丢失手机意味着要在账户锁定和短信备用方案之间二选一?
通行密钥消除了密码,却引入了 FIDO2 规范未能解决的脆弱性:账户恢复。如果您丢失了唯一注册的设备,且未提前配置厂商特定的同步功能,您将被锁定在账户之外,或被迫退回短信一次性密码,这重新打开了通行密钥本应关闭的 SIM 卡交换攻击大门。Apple、Google 和 Microsoft 各自构建了互不兼容的同步孤岛,因此从 iOS 迁移到 Android 意味着需要在每项服务上手动重新注册。WebAuthn 规范定义了如何创建和使用凭据,但明确将恢复机制委托给各平台自行决定。目前不存在任何厂商中立、密码学健全且能保留原始威胁模型的恢复原语。
为何重要: 恢复机制是无密码体系中最薄弱的环节,解决它是让通行密钥在大规模场景下真正取代密码的最后一公里。
阅读完整分析为什么授予 AI 代理工具访问权限就意味着要将一切都托付给它?
当你赋予 AI 代理一套工具时,无论是文件系统访问、网络请求还是 API 调用,目前都没有标准机制能将每次工具调用绑定至你批准任务时所授权的具体范围。代理可能将行动链式延伸至原始意图之外,或被提示注入攻击劫持,利用其自身工具侵害你的利益。Microsoft 于 2026 年 4 月发布了 Agent Governance Toolkit,arXiv 上关于代理工具调用密码学绑定的论文也于 2026 年 3 月相继出现,但这些方案仍处于早期阶段,尚未集成至任何主流代理运行时或 SDK。核心缺口在于语义层面缺少最小权限原语:一种能将单次工具调用与可验证的用户范围授权相绑定的机制,而非依赖宽泛的会话级权限授予。OWASP 于 2025 年 12 月发布的 Agentic AI Top 10 明确将意外工具执行归类为
为何重要: 在缺乏逐次调用授权绑定的情况下,每一个智能体应用都只需一次提示注入,便可将你自己的工具和凭证用来对付你。
阅读完整分析如何在不披露数据集的情况下证明模型是基于已获授权的数据训练的?
去中心化 AI 网络允许任何人贡献算力或数据来训练共享模型,但目前没有任何机制能让下游用户或监管机构在不要求网络披露训练内容的前提下,验证训练语料库排除了被污染、被盗取或未经授权的数据。当前的数据溯源要么依靠贡献者自行签署的声明清单,要么依靠与去中心化目的相悖的中心化审计。2025 年 2 月一篇关于激活反转攻击的论文表明,联邦训练期间交换的梯度信号可被用于部分重建训练数据,这意味着任何需要共享梯度的溯源方案同样会泄露数据。2025 年 OWASP LLM 十大风险明确将供应链数据投毒列为一个类别,但针对开放式去中心化训练的标准化缓解措施尚不存在。
为何重要: 在缺乏可验证数据溯源的情况下,任何在公共去中心化网络上训练的模型,对于面临监管或版权审查的下游应用而言,都是一项潜在责任。
阅读完整分析为什么我的交易在模拟中成功,却在链上回滚?
EVM 模拟工具针对链状态快照运行交易,但当该交易真正落入区块时,状态已经发生了变化。对于多跳 DeFi 操作,一次价格预言机的更新或一笔触碰同一流动性池的竞争交易,就能将有效的模拟变成链上回滚。开发者无法从模拟中得知其交易对调用与打包之间状态漂移的敏感程度。近期对生产环境中 EVM 工作负载的分析证实,执行行为对状态高度敏感,而当前的 Gas 和模拟工具并未考虑这种差异。差距在跨多个合约的复杂交互中最为显著,而这恰恰是风险最高的场景。
为何重要: 能够反映执行时状态敏感性的模拟,是让开发者得以预测复杂链上操作行为的基础原语。
阅读完整分析为何我从某个平台导出的数据,对下一个平台毫无意义?
《欧盟数据法》(2025年9月生效)与《数字市场法》均要求平台允许用户以机器可读的互操作格式导出数据,但两部法律均未要求接收平台能够理解这些数据的含义。项目历史记录、笔记或账目条目的 JSON 导出文件在语法上是有效的,但对任何竞争工具而言在语义上却是不透明的,因为每个平台都有自己的数据模型,字段名称、关系和单位各不相同。数据转移倡议的可移植性汇编将这一语义层认定为核心未解决缺口:格式标准化是可行的,但含义标准化则不然。欧盟《2026年数据互操作滚动计划》承认了语义标准的必要性,但将实施时间安排在数年之后,导致当前这波 DMA 合规工作所生成的导出文件在技术上
为何重要: 针对常见数据类型建立共享语义层,才能将法律赋予的可移植权利转化为真正可切换平台的能力,而软件市场的竞争只有在转换成本真正降低时才会变得有意义。
阅读完整分析为什么我必须在每个受监管的应用程序上重新证明身份?
每一家交易所、借贷协议和 DeFi 前端都要求提交完整的 KYC 文件,即便您上周刚在竞争对手那里通过了同样的审核。您的护照扫描件最终分散存储在数十个托管方手中,每一个都是独立的数据泄露风险点。零知识 KYC 证明可以在不重新共享原始文件的情况下验证合规性声明,但目前没有可互操作的标准将其与符合 FATF 要求的审计轨迹绑定。MiCA 2026 明确要求将可复用身份证明用于 CASP 许可,却未规定任何技术格式。监管预期与可用的便携式认证原语之间的差距依然巨大。
为何重要: 标准化的 ZK-KYC 认证将大幅降低身份注册摩擦,缩小数据泄露攻击面,并让用户的合规历史随身携带,而无需在每个入口重新采集。
阅读完整分析为什么单一执行客户端仍让以太坊 85% 的节点面临相同风险?
Geth 运行于约 85% 的以太坊执行节点上,远超社区认为任何单一客户端安全上限的 33%。Geth 中一个尚未被发现的共识或状态损坏漏洞,将同时影响网络中绝大多数节点,并可能导致错误的最终确认。合并后共识层有所改善,Lighthouse、Prysm、Teku 和 Nimbus 分担了负载,但执行客户端的多样性始终未能跟进。质押或节点部署流程中没有任何阻力阻止运营商选择 Geth,也没有自动预警系统在集中度恶化时告知网络。clientdiversity.org 上的社区看板多年来持续追踪执行层的这一差距,却始终未能触发运营商行为的实质性转变。
为何重要: 执行层的单一文化意味着,一个零日漏洞便可在任何熔断机制触发之前损坏整个网络的权威状态。
阅读完整分析当数据泄露导致我的生物特征信息外泄时,为什么没有任何恢复路径?
当密码数据库泄露时,每位受影响的用户可以重置密码,危害得以控制。但生物特征识别没有等效的重置机制。泄露的指纹模板或人脸编码可被终身用于重放攻击,针对任何未来接受该模态的系统。可撤销生物特征与模板保护技术虽存在于学术研究和少数细分企业产品中,但没有任何面向消费者规模运营的身份系统将其部署。2026年初,NYC Health + Hospitals事件导致180万人的指纹和掌纹记录永久受损,且无可操作的恢复路径。
为何重要: 建立在不可撤销秘密之上的身份系统,一旦发生单次事件,每位注册用户都将面临永久性的安全危机。
阅读完整分析为什么跨平台迁移数据仍然需要信任导出方?
欧盟《数字市场法》现已强制要求指定守门人提供数据可携性,欧盟委员会2026年5月发布的情况说明将Apple和Google的跨操作系统传输工作列为DMA里程碑。然而技术现实是,当今每种导出格式都是厂商自定义的归档文件,即一个JSON文件的ZIP压缩包,其完整性、准确性和时效性均无法由接收方或用户独立核实。互操作性义务涉及格式和API访问,但对数据存证只字未提。用户从一个平台迁移到另一个平台时,无法知晓导出是否完整、是否反映了请求时间戳时的状态,或者接收平台是否正确摄入了全部数据。Google、Apple和Meta的可携数据传输协议工作涵盖的是传输,而非溯源。
为何重要: 缺乏可验证完整性的数据可携性不过是另一种形式的锁定,因为用户仍然无法知晓哪些数据被遗留下来。
阅读完整分析为什么交付AI编写的代码不会留下任何关于是哪个模型编写的记录?
AI助手现在负责编写生产代码中相当大且不断增长的比例,但没有任何制品格式记录是哪个模型、哪个版本或哪个提示词生成了特定函数。当一个漏洞被追溯到某一特定模型世代稳定引入的代码模式时,没有办法查询代码库或软件包注册表来找出所有具有相同来源的函数。由SPDX和CycloneDX标准化的软件物料清单捕获的是库依赖关系,而非源代码的作者出处。2026年Cloudsmith供应链调查发现,29%的受访者将AI生成的软件包风险列为其首要的开源安全关切,四分之三的组织将SBOM视为静态合规制品,而非主动治理工具。欧盟《AI法案》和美国关于AI的行政令均提及软件供应链完整性,但均未具体规定w
为何重要: AI作者出处是SBOM领域的缺口,将定义未来十年软件供应链审计和事件响应的走向。
阅读完整分析为什么一个补丁版本的依赖升级仍然会导致我的生产应用崩溃?
语义化版本控制是一种约定,而非契约。对软件生态系统的系统性分析证实,补丁版本和次要版本发布往往会引入行为层面的破坏性变更,而这类变更是任何静态分析工具都无法检测到的。在已观察到的 npm 故障中,68% 属于这种最难自动捕获的行为类型。损害主要通过传递依赖传播,而在实际环境中,仅有 21% 的传递依赖具备任何测试覆盖。依赖扫描器能标记安全漏洞(CVE),却没有任何机制来检测两层之深的语义不兼容性。开发者今天更新一个直接依赖,却没有任何工具能告诉他们哪些生产行为将因此改变。
为何重要: 在传递依赖中的行为破坏到达 CI 之前将其检测出来,是版本锁定与安全升级之间缺失的关键一层。
阅读完整分析为什么一个 gas 数字能在所有链上以相同的方式为计算、存储和带宽定价?
EVM 使用单一整数同时为 CPU 周期、存储访问和网络带宽定价,将它们视为可互换的资源。2026 年 6 月一项针对生产环境 EVM 工作负载的实证研究发现,Base 将 29% 的 gas 消耗在计算上,而以太坊则将 34% 消耗在存储写入上,随着每个新 L2 的推出,两者的资源消耗模式差异还在进一步扩大。当某种资源的定价低于其真实成本时,它便成为攻击向量:EVM 重新定价的历史,就是一系列在攻击者发现定价过低的操作后打出的紧急补丁。目前没有任何 EIP 提议在执行层引入多维度计量机制。EIP-1559 时代的改革解决了费用市场问题,却未分解底层资源成本,因此定价错误的问题并未真正解决,只是被重新谈判了一遍。
为何重要: 用一个数字为多维资源定价,会产生永久性的定价偏差缺口,而攻击者发现这些缺口的速度,永远快于治理机制重新定价的速度。
阅读完整分析为什么我无法判断流水线中哪个子智能体消耗了我大部分的预算?
多智能体 AI 流水线如今已成标配:一个编排器会生成多个专业子智能体,每个子智能体各自调用其模型、工具和外部 API,由此产生的计算成本最终汇总在一张无明细分项的账单上。将令牌消耗归因到具体子任务需要专门的埋点,而当前主流的智能体框架均未默认提供此功能,导致财务和工程团队只能拿到无法归入正确业务单元、产品功能或客户账户的汇总支出数据。基于结果的定价模式(例如按解决的支持工单数量收费)依赖于在子智能体粒度层面了解每次处理的成本,但这些数据目前并不存在于任何标准的追踪或计费格式中。没有这些数据,智能体产品的单位经济模型只能是粗略估算,企业将 AI 成本回拨至正确成本中心的工作只能靠人工完成,而识别哪个部
为何重要: 针对多智能体流水线建立标准的成本归因追踪格式,才能让企业将智能体产品作为真正的业务单元而非黑箱实验来定价、治理和持续改进。
阅读完整分析为什么每个 L2 排序器都在提取如今被欧洲监管机构认定为市场滥用行为的 MEV?
截至 2026 年中期,每一个主要的 Ethereum L2 都运行着中心化排序器,通过交易排序捕获 MEV,而 2025 年第四季度发布的监管分析首次提供了正式分类,将三明治攻击和抢先交易明确归入 MiCA 市场滥用类别。任何服务于欧盟用户的 L2 运营商现在都有法律义务避免此类行为,但目前生产环境中不存在合规的排序器架构。来自 Espresso Systems、Astria 和 Superchain 路线图的去中心化排序器方案距离生产就绪还有 12 至 18 个月。法律义务与可用基础设施之间的差距是当下正在发生的问题,并随着 MiCA 执法的成熟而持续扩大。
为何重要: 首个拥有可证明 MEV 清洁排序架构的 L2 将在每个受监管的司法管辖区获得结构性合规优势。
阅读完整分析为什么监听我加密 LLM 流量的人仍然能推断出我问了什么?
2025 年底披露的 Whisper Leak 攻击表明,通过分析加密流式 LLM 响应中的数据包时序和大小模式,可以在 28 家主要服务商中以超过 98% 的精度对提示词主题进行分类。包括 OpenAI 和 Mistral 在内的部分服务商已部署修复措施,但这些缓解方案仅针对令牌长度模式。另一种攻击则利用推测解码:每个解码步骤接受的令牌数量随输出内容而变化,即便是填充连接也无法消除这一信号泄漏,因为填充无法消除接受率的波动。提议中的防御措施(如令牌批处理)可将攻击精度降低 50%,但无法彻底消除威胁,而随机填充会带来高达 8.7 倍的载荷开销且仍有残余泄漏。目前没有任何服务商为推测解码变体发布完整的缓解方案。
为何重要: 任何通过记录流量的网络向流式 LLM 发送查询的用户,无论是否使用 TLS 加密,都会泄露其查询主题,包括那些认为自己在与医疗、法律或金融助手私密通信的用户。
阅读完整分析为什么在网上证明年龄需要将浏览记录交给陌生人?
美国、英国和欧盟的法律现已要求网站核实访客年龄,而每个生产部署都将该核查路由至集中式年龄验证服务商。该服务商能看到哪些用户访问了哪些网站,并积累与真实身份关联的详细浏览记录。零知识证明替代方案存在于研究领域,欧盟正将其纳入EUDI钱包,但钱包规范最早将于2026年12月定稿,且仅覆盖欧盟居民,其他地区没有可比的基础设施。当今实际的选择是:要么谎报年龄,要么将浏览记录拱手相让给一家你并未选择的公司。
为何重要: 隐私保护型年龄验证是互联网缺失的基础要素,而这个互联网正在被法律迅速构建起年龄门槛。
阅读完整分析为什么跨链转移资产仍然需要数分钟并伴随未知风险?
自首批跨链桥上线六年后,用户仍面临不可预测的成本、复杂的故障模式,以及没有任何协议能同时解决的安全权衡。2025年6月,Nervos Network上的Force Bridge遭受超过三百万美元的漏洞攻击,延续了自2021年以来桥接黑客攻击累计损耗数十亿美元的规律。大多数桥接依赖小型验证者集合或多签,构成单点故障,而流动性池失衡对大额转账产生滑点且无补救途径。跨链协议如今占2025年互操作性总收入的57%,但这种集中度反映的是锁定效应而非已解决的可用性问题,安全性、速度与去中心化的三角悖论对于服务真实用户量的任何桥接而言仍悬而未决。
为何重要: 互操作性是多链世界的承重基础设施,而每一次新的桥接漏洞攻击都会重置用户信任。
阅读完整分析为什么我无法将去年颁发的凭证迁移到量子安全签名?
NIST于2024年最终确定了ML-DSA和ML-KEM标准,为新系统提供了明确的密码学目标,但目前流通中的每一张可验证凭证均以ECDSA或EdDSA签名。在不吊销并重新签发的情况下,没有任何技术途径可将已签发的凭证升级至新签名方案,而这一过程需要同时协调每一位签发方和每一位持有方。政府、医疗和教育领域的长效凭证,恰恰是对手今日存档、待量子计算能力成熟后再行解密的目标文件。在密钥迁移难题之上,ML-DSA签名的体积约为Ed25519的五倍,这将破坏现有选择性披露实现所依赖的紧凑呈现格式。密码学有标准化的演进路线图,凭证生命周期管理却没有。
为何重要: 在缺乏已签发凭证迁移路径的情况下,后量子过渡将迫使全球各国政府和卫生系统同时陷入大规模重新签发的危机。
阅读完整分析为什么合规的稳定币转账仍然需要猜测交易对手使用的协议?
金融行动特别工作组(FATF)第16号建议要求虚拟资产服务提供商(VASP)在符合条件的稳定币转账结算前交换发起方和受益方数据,但实际上承载这些数据的是三种互不兼容的协议:TRISA、TRP 和 OpenVASP。三者名义上均采用 IVMS101 数据标准,但信任模型各异,对可选字段的处理不一致,消息验证规则也各有不同。发起跨境 USDC 付款的 VASP 必须首先发现对方支持哪种协议,然而目前并不存在能够大规模运行的通用发现注册表或实时协议协商层。FATF 2025年6月的专项更新发现,正规 VASP 如今不得不支持多种协议,因为交易对手并非都使用同一种协议;金融稳定委员会(FSB)也已将 VASP 发现碎片化问题列为有待解决的关键基础设施缺口。
为何重要: 具备实时协议协商功能的通用 VASP 发现层,将把旅行规则合规从定制化的多协议集成项目转变为任何支付通道都能即插即用的基础服务。
阅读完整分析发现了一个问题?
If something in tech, crypto, or AI quietly drives you up the wall, send it over. The best ones get added to this board, and a few might turn into something I build.