functionhx.github.io

站点设置

显示或隐藏现有栏目,也可以按内容格式创建一组新的中英文栏目。

导航布局

选择桌面端导航的呼吸感,可即时预览并随设置一起发布。

导航布局

栏目

显示在导航栏
  • 博客 blog 文章列表
  • 论文 publications 普通页面 · 已隐藏
  • 项目 projects 项目卡片 · 已隐藏
  • 仓库 repositories 仓库列表 · 已隐藏
  • 简历 CV 普通页面 · 已隐藏
  • 教学 teaching 普通页面 · 已隐藏
  • 人物 people 人物档案 · 已隐藏
  • 书架 bookshelf 普通页面 · 已隐藏
  • 动态 news 普通页面 · 已隐藏
  • 工具 tools 项目卡片
  • 思考 thoughts 文章列表 · 已隐藏
  • 闪耀 Spark 普通页面
  • 日志 logs 文章列表 · 已隐藏
  • 更多 more 普通页面 · 已隐藏
新建栏目

修改暂时只保留在这个面板中,提交后才会更新站点。

连接 GitHub

创建时选择“Only select repositories → functionhx.github.io”,权限只开启 Contents: write 与 Actions: read。

在 GitHub 创建受限令牌

勾选后令牌会加密保存在这台浏览器的设备凭据库中。只应在你自己的电脑使用;令牌不会写入仓库、分析服务或日志。

DeepSeek 信达雅翻译

任何人都可以使用自己的 API Key 翻译;只有站主能够发布。翻译保留 Markdown、链接、代码与事实。

密钥只用于这一次翻译请求,不写入浏览器存储或仓库。

连接 GitHub

创建时选择“Only select repositories → functionhx.github.io”,权限只开启 Contents: write 与 Actions: read。

在 GitHub 创建受限令牌

勾选后令牌会加密保存在这台浏览器的设备凭据库中。只应在你自己的电脑使用;令牌不会写入仓库、分析服务或日志。

纯 CS 搞具身,正在把一个控制问题硬讲成一个融资故事

让纯 CS 范式主导具身智能,正在制造一场以 VLA 为名的泡沫

把动作当成另一种 token,把控制当成可以靠数据 scaling 绕过的麻烦——这是这个领域最贵的一个误会。

先叠个甲,并非看不起 CS,也完全不想制造文理对立或者学科鄙视链。这只是一个关于认知范式与真实系统工程的客观讨论。

长期以来,我一直有个很天真的想法,只要愿意认真学控制,大部分纯 CS 转过来的同学,哪怕之前主要做后端、打算法竞赛、搞视觉识别甚至炼大模型,去做机器人控制、自动驾驶决策、甚至成为控制理论研究者,都是完全没问题的。

但经历过高强度的控制理论沉淀、真实机器人调试,以及无数次跨学科的底层交流后,我发现我错了。

我必须承认一个残酷的现实,很多纯 CS 背景同学认知世界的底层原理,与我和一些做自动化、机械、机器人的同学围绕“物理系统—动态演化—反馈闭环”建立起来的这套严密体系,存在着天然的、难以兼容的认知摩擦。

在日常讨论中,每次开启机器人或者自动驾驶的话题,往往是他们先挑起。但只要讨论的边界一旦从“用了什么模型、网络多大、数据集刷到多少”,推进到系统动力学、状态估计、稳定性、可观测性、实时性、闭环安全,我观察到绝大多数纯 CS 同学的思维惯性就会开始被动回避。

为了填补这种认知空白,他们会本能地调用一些论文摘要式或者营销号式的泛化文字,去粗暴地抹平其中的复杂性——“端到端可以自动学出来”“数据够多就不需要建模”“Transformer 能统一解决一切”“控制器不就是最后接个 MLP 嘛”。

但技术硬核的地方在于,动力学约束、传感器噪声、执行器延迟、摩擦、饱和、建模误差和闭环稳定性,是绝对不能仅靠叙事消除的。

纯 CS 和互联网算法的范式,是离散输入、静态数据集、明确的损失函数、可复现的离线评测。控制与机器人的范式,是连续时间、动态演化、反馈闭环、物理约束与无处不在的不确定性。在离线数据集里,预测错一次无非是 accuracy 掉零点几个点;但在真实闭环系统里,一个采样周期的延迟、一个符号写反、一个坐标系变换搞错,甚至一个没人考虑的执行器饱和,都可能让整个系统从稳定直接走向发散。

用静态预测的思维去理解动态控制,在我看来必然导致高频的误解。

说点得罪人的:当下大半个 VLA,本质是讲给不懂控制的投资人听的故事

我知道这句话会被喷,但还是得说:这一轮具身智能里被吹得最凶的 VLA,与其说是一项落地中的控制技术,不如说是一套为融资量身定制的叙事。

VLA 的思路是把“视觉 + 语言 + 本体状态 → 动作”重新表述成一个大规模序列建模问题,言下之意是:只要模型够大、数据够多,机器人控制就能像大语言模型一样被“端到端学出来”。

这套叙事最迷人的地方,恰恰不在于它有多对,而在于它有多好卖。它把一个控制和机器人学界辛苦了几十年、至今没有彻底解决的闭环控制难题,重新包装成了一个“只要钱够多、数据够多就能解决”的 scaling 问题——而钱和算力,正好是投资人能提供的东西。一个几十年的工程硬骨头,被翻译成了一个投资人听得懂、也愿意为之买单的增长故事。

判断一个东西是技术还是话术,有几个非常朴素的检验标准:

第一,看它拿什么给你看。 融资看的是剪辑过的 demo 视频和实验室里布置好的桌面场景;落地看的是 7×24 小时不出事的闭环可靠性。一段挑出来的成功抓取,和一个能在开放环境里连续运行一周不撞、不掉、不失稳的系统,之间隔着的不是几个百分点,而是整个控制工程。Pitch deck 里永远是前者。

第二,看它报什么指标。 “动作预测准确率”“任务成功率”在精心布置的场景里刷到 90%+,听上去很唬人。但真正决定机器人能不能用的指标——闭环平均无故障时间、分布外状态下的安全边界、长时序滚动的误差累积、接触力是否导致滑移——这些既难看又难刷的数字,你几乎从不会在融资材料里见到。报喜不报忧本身不是骗局,但只报那个和真实可靠性几乎无关的指标,就很难说是无心。

第三,看它怎么解释失败。 真正的工程会告诉你失败的根因:是状态估计漂了、执行器延迟超了,还是控制器在某个工况下失稳了。而融资叙事解释失败永远只有一句话——“下一代模型就好了”“数据再多一个数量级就解决了”。它把证伪系统性地推迟到了下一轮融资之后。一个永远不可证伪、永远把答案押在“更大更多”上的技术承诺,和庞氏结构在认知形态上是高度同构的:都需要新的钱进来,才能维持上一轮叙事的体面。

我不是说做 VLA 的人都在骗。绝大多数研究者是真诚的,VLA 本身也确实给机器人带来了过去极度缺乏的开放世界语义理解能力。我说的是:

当一项还远没解决闭环可靠性的技术,被包装成“端到端即将取代状态估计、运动规划和反馈控制”的颠覆叙事,并以此撬动天量融资时,这套叙事服务的对象,已经从机器人悄悄变成了融资本身。

而最容易制造、也最容易相信这套叙事的,恰恰是那些只在静态数据集里训练过直觉、从没在真实闭环里被发散和撞车毒打过的纯 CS 背景。因为在他们的认知范式里,“预测得准”和“控制得住”本来就是一回事——而这,正是整个误会的起点。

第一性原理不是商业 PPT 里的口号

这种认知摩擦,在第一性原理这个词上展现得淋漓尽致。现在很多 CS 和 AI 从业者聊到第一性原理,脑子里蹦出的关键词永远只有那几个:马斯克、拆解问题、端到端、让模型自己发现规律。他们把一个源于物理建模和公理化推演的概念,降维简化成了一种商业方法论或者大模型时代的技术口号。

真正面向控制系统的第一性原理是什么?我认为是从牛顿—欧拉方程、刚体运动学、能量守恒、电路定律、系统约束这些东西出发,先建立一个能描述真实对象的数学模型,再去严密讨论平衡点、可控性、可观测性、稳定性、鲁棒性与最优性。一个倒立摆能立住,不是因为神经网络“理解”了平衡;一辆赛车能高速过弯,也不是因为模型在数据集里见过足够多的弯道。如果没有系统学习过经典控制、现代控制、信号与系统、动力学和状态估计,没有被拉普拉斯变换、状态空间、Lyapunov 稳定性和非线性系统的数学推导反复毒打过,所谓的“让模型自己学会控制”,不过是建立在有限数据分布上的空中楼阁。

很多人鼓吹的 AI 与机器人之间没有壁垒,其实混淆了工程工具的掌握与底层直觉的重塑。调 PyTorch、训感知模型、改网络结构、跑通开源代码,这更像是一种框架与流程的规范,纯 CS 同学通过高强度训练完全可以胜任。但涉及底层与前沿,比如非线性控制、模型预测控制、状态估计、实时优化、鲁棒控制,以及具身系统真正的闭环学习,这需要对系统状态、动态响应、时域与频域、噪声传播、物理约束、稳定裕度拥有极强的技术直觉。

这种直觉需要长期的数理与工程训练来做支撑,甚至需要在真实系统上一次次振荡、超调、发散、失稳、撞车之后,才能慢慢建立起来。缺乏这种训练,在面对模型失配、传感器异步、执行器延迟、轮胎打滑、闭环不稳定时,再漂亮的离线指标、再高级的叙事文字,也可能无能为力。

我的这种幻灭,是对一个假设的修正——以为一个擅长软件和算法的人,补几门控制课,就能自然跨越从“处理信息”到“操纵物理世界”的底层范式鸿沟。

当然,这种不兼容是双向的。如果让一个只会经典控制、从没受过系统计算机训练的人,去设计大规模分布式系统、优化 CUDA Kernel、分析编译器、构建基础模型、处理亿级数据,他同样可能陷入“加个 PID 就好了”式的自鸣得意。

理性的解法,不是争论哪个专业更高级,也不是否定 VLA 的全部价值,而是尊重思维范式的鸿沟,承认两种范式各有边界——CS 擅长构建计算系统、处理信息、扩展算法规模,控制与自动化擅长描述动态世界、处理反馈与约束、让系统在不确定环境里稳定运行——然后把不同的认知带宽,释放在正确的生态位上,而不是用一套融资叙事去掩盖另一套范式几十年都没绕开的硬约束。


本文于 2026 年 6 月 10 日发布于知乎,后于 2026 年 6 月 26 日由自动驾驶之心推出的「具身智能之心 TechDaily」转载

评论