长文
关于 AI 与 XR 究竟在哪里交汇的长篇;以及在两者的接缝处,实际要干的活比宣传里承认的多得多。
运行时给你几何,不给你意义
场景理解是视觉模型在头显上最显而易见的用途,也正是 Web 平台划下了一条并不打算挪动的线的地方。
约 9 分钟房间里没有「正在输入…」
文字界面能无声吸收的对话延迟,在说话的人有了身体之后,就变成了一个表演问题。
约 10 分钟生成出来的网格,离一个 WebXR 场景还隔着什么
生成这一步变快了,它两头的步骤没有。时间正是花在这两者之间的落差里。
约 10 分钟
为什么把它们和专题页分开
专题页是钉在某个接口上的。它回答一次调用做了什么、运行时拿它做了什么、以及你在细节上弄错时会出什么问题。那个格式成立,是因为问题有一个可以拿规范去对的答案。
这些长文讲的是规范定不了的那些问题 —— 它们大多出现在两种技术被推到一起、而有人必须决定谁让步的时候。一个生成出来的网格该不该占这份帧预算、当说话的人有了身体之后两秒的沉默意味着什么、一个运行时愿意把它所处的房间告诉一个网页多少:这些都不是 API 问题,把它们写进 API 参考里,形状就错了。
它们比专题页更有立场,而且凡是判断而非测量的地方,都会写明。凡是出现数字的地方都带着出处 —— 因为让这类论证失效最快的方式,就是为它编一个基准数据。