虚拟现实技术研发:别再画饼了,聊聊那些真能把人“骗”进虚拟世界的关键
上周我又把积灰的VR头显翻出来了。就为了一款新出的解谜游戏。戴了不到半小时。摘。想吐。——没错,又晕了。这都2025年了,说实话,晕动症还是没解决透。可问题是,为什么有人就不晕?我老婆玩那个节奏光剑能玩俩小时。她倒好,说是我脑子不协调。行吧。
显示光学那边的研发,其实已经悄悄往前挪了一大步。 但普通消费者感知不强。什么Pancake透镜,Micro-OLED,不少头显现阶段还是体积控制不下来。Meta去年发了那个Quest 3,清晰度是真上去了,可重量呢?压脸。每次摘下来脸颊两道红印。研发工程师们整天跟光学设计死磕,MTF曲线,色差控制……但一到量产,良率就给他们脸色看。
VR头显光学透镜畸变校正示意图
那该死的延迟,到底要降到多少?
业内都说20ms是条线。低于20ms,人眼基本察觉不到拖影。可真正想做到“无感”,得10ms以内。麻烦的是,这不止关乎显示屏刷新率。 从头部转动到对应的画面刷新,这条流水线上每个环节都藏着延迟——追踪、传输、渲染、显示。有个初创公司搞了个眼球追踪的注视点渲染,想法特好:只在你看的那一小块区域高分辨率渲染,其余地方糊弄过去,GPU直接少干活60%。实际用下来,嗯,有时候眼珠子转快了,还是会有那么一瞬,画面来不及精细,像近视眼没戴眼镜。我试过他们的工程机,那感觉怎么说呢……像在梦里重演贾樟柯的《车站》,画面总有种捉摸不定的模糊。但他们说最新算法已经把预测精度提上去了,等硅基OLED再便宜点,普及可期。
说到眩晕,我发现一个反直觉的事。 很多人以为画面越真越不容易晕。错。有时候,卡通渲染的低多边形的VR游戏,反而比那些追求“照片级真实”的演示让人更舒服。为什么会这样?视觉-前庭不匹配。你的眼睛告诉你在飞,耳朵里的前庭系统说你坐着呢。大脑混乱,你就吐。高真实度的画面可能进一步拉高了你的预期,结果身体不买账,落差更大,晕得更快。这里面牵扯的神经科学,研发团队现在才开始认真对待。所以以后买VR设备,光看分辨率没用了,得看厂商敢不敢把“生物反馈舒适度”标出来。
虚拟现实手势识别交互体验
虚拟现实力反馈手套原型展示
再说个有点凉水的事。脑机接口现在也号称要为VR带来终极形态。但说实话,目前那些非侵入式的脑电帽,读取信号的信噪比太低,延迟大得吓人,想靠意念在虚拟世界里行走?分分钟让你原地转圈。马斯克的Neuralink那类植入式,短期内别想普及。与其画这饼,不如踏踏实实把空间计算和实时3D重建搞好。比如,用VR头显上的深度摄像头,实时扫描周围环境,生成网格,然后虚拟内容就能和真实物体无缝互动。虚拟小人从你真实的书桌上走过,撞到真实的咖啡杯会掉头——这场景带来的可信度,比你给大脑插根线靠谱多了。
最后吐个槽。国内的VR行业,前几年被元宇宙那波炒得虚火太旺,骗子太多了。一堆VR看房、VR会议的项目,体验烂得抠脚,拿个手机盒子就敢说自己是VR。现在泡沫破了,活下来的公司反而踏实了。最近听说华为在搞空间音频的研发,想让VR声音摆脱耳机依赖,直接用头显上的微型扬声器阵列营造出三维声场,人走到哪声音追到哪。这才是正路啊。技术研发就该这样,在一个点上一个点地啃。
虚拟现实,这四个字说了都快一个世纪了。直到今天,它还是不够“现实”。但我看着那些实验室里默默迭代的原型机、那些在Reddit上兴奋分享新Demo的独立开发者、那些因为一块新透镜而欢呼的工程师……人类想骗过自己的感官,这件事,本身就浪漫得不行。对吧?
VR头显光学透镜畸变校正示意图
那该死的延迟,到底要降到多少?
那该死的延迟,到底要降到多少?
业内都说20ms是条线。低于20ms,人眼基本察觉不到拖影。可真正想做到“无感”,得10ms以内。麻烦的是,这不止关乎显示屏刷新率。 从头部转动到对应的画面刷新,这条流水线上每个环节都藏着延迟——追踪、传输、渲染、显示。有个初创公司搞了个眼球追踪的注视点渲染,想法特好:只在你看的那一小块区域高分辨率渲染,其余地方糊弄过去,GPU直接少干活60%。实际用下来,嗯,有时候眼珠子转快了,还是会有那么一瞬,画面来不及精细,像近视眼没戴眼镜。我试过他们的工程机,那感觉怎么说呢……像在梦里重演贾樟柯的《车站》,画面总有种捉摸不定的模糊。但他们说最新算法已经把预测精度提上去了,等硅基OLED再便宜点,普及可期。
说到眩晕,我发现一个反直觉的事。 很多人以为画面越真越不容易晕。错。有时候,卡通渲染的低多边形的VR游戏,反而比那些追求“照片级真实”的演示让人更舒服。为什么会这样?视觉-前庭不匹配。你的眼睛告诉你在飞,耳朵里的前庭系统说你坐着呢。大脑混乱,你就吐。高真实度的画面可能进一步拉高了你的预期,结果身体不买账,落差更大,晕得更快。这里面牵扯的神经科学,研发团队现在才开始认真对待。所以以后买VR设备,光看分辨率没用了,得看厂商敢不敢把“生物反馈舒适度”标出来。
内容荒?开发者都在观望什么
硬件年年有,爆款没几个。《半衰期:爱莉克斯》都2020年的老古董了,到现在还是天花板。Valve在那之后悄无声息,坊间传言在憋新头显,代号Deckard。鬼知道。大厂们不敢全力投入,因为用户基数实在太小。做了个精品VR游戏,卖几万份,连成本都收不回。这就恶性循环了:没内容→没人买硬件→没硬件→更没人做内容。说实话,有时候看看Steam VR热销榜,翻来覆去就那几样。Beat Saber,Skyrim VR(这都多少年的冷饭了),还有各种模拟器。是的,开车、开飞机用VR是好,沉浸感无敌,但那些都算小众硬核。普通用户买回去,新鲜劲儿一过,就是吃灰神器。 但也不是没亮色。最近有个小团队做的VR叙事冒险,融合了手势识别,不用手柄,全靠手捏、抓、扔。我通关了,玩到结局鼻子竟然有点酸。关键在哪?他们把交互做得特别自然。 伸手推门,就真的伸;要捡起地上的照片,就弯腰去够。这套自然交互的算法底层,涉及好多手部骨骼追踪的高精度模型,据说还用了点Transformer网络来预测意图。开发者在博客里吐槽,前期光手部不同角度遮挡的训练数据就要了老命。不过结果真好。这让我觉得,VR内容可能真的不是非要做3A,而是要把“直觉”还给玩家。再也不用记“A键跳跃,扳机键抓取”了。
虚拟现实手势识别交互体验
下一代交互:当手和眼真的被“看见”
苹果的Vision Pro虽然贵得离谱,但它把眼动追踪和手势交互的体验推到了一个前所未有的高度。那种精准度……咋说呢,我当初体验的时候,光标跟着瞳孔走,轻轻一捏就选中,有一种“魔法成真”的眩晕感——好的那种眩晕。 它证明了,只要硬件堆料够狠,软件优化到位,科幻电影里的操作方式是可以落地的。但3500美元的门槛,直接劝退99%的人。 国内厂商现在也在猛追眼动追踪,但大多还是基于红外LED反光的暗瞳方案,在极限角度和戴眼镜的情况下容易丢。有家实验室在研究基于事件相机的眼动跟踪,延迟能压到亚毫秒级,功耗还低,就是成本……吓人。不管怎样,眼球追踪绝对是打通VR次世代体验的任督二脉。 不仅能让交互更直觉,还能实现前面说的注视点渲染,还能做表情映射——虚拟化身能实时模仿你的眼神和眨眼,社交临场感瞬间拉升。想想远程会议,每个人的虚拟形象都带着灵动的眼睛,而不是死鱼眼。那会是多大的飞跃。 力反馈这块,更是坑。现在的消费级手柄就是简单的震动马达,叮当乱震。高级点的有线性马达,也就好那么一丢丢。真正的力反馈手套,能让手指感受到虚拟物体的形状、硬度、甚至纹理。实验室里确实有惊艳的,比如用气囊、用碟片锁止,但都太重、太贵、太易坏。我去年在展会上试过一个韩国团队的原型,戴上后模拟捏橡皮鸭子的手感,那一刻真被震撼到了——手指触摸到阻力,感觉那玩意儿就在指尖。可是,整个装置连着胳膊那么粗一堆线缆和电机,离家用还有十万八千里。不过话说回来,这种触觉的研发一旦突破,VR就不只是“看”和“听”了,是真正的“触”。色情产业肯定最先嗅到商机。(笑)但正经严肃地说,这对远程手术、高危作业培训的意义,才是颠覆性的。
虚拟现实力反馈手套原型展示
再说个有点凉水的事。脑机接口现在也号称要为VR带来终极形态。但说实话,目前那些非侵入式的脑电帽,读取信号的信噪比太低,延迟大得吓人,想靠意念在虚拟世界里行走?分分钟让你原地转圈。马斯克的Neuralink那类植入式,短期内别想普及。与其画这饼,不如踏踏实实把空间计算和实时3D重建搞好。比如,用VR头显上的深度摄像头,实时扫描周围环境,生成网格,然后虚拟内容就能和真实物体无缝互动。虚拟小人从你真实的书桌上走过,撞到真实的咖啡杯会掉头——这场景带来的可信度,比你给大脑插根线靠谱多了。
最后吐个槽。国内的VR行业,前几年被元宇宙那波炒得虚火太旺,骗子太多了。一堆VR看房、VR会议的项目,体验烂得抠脚,拿个手机盒子就敢说自己是VR。现在泡沫破了,活下来的公司反而踏实了。最近听说华为在搞空间音频的研发,想让VR声音摆脱耳机依赖,直接用头显上的微型扬声器阵列营造出三维声场,人走到哪声音追到哪。这才是正路啊。技术研发就该这样,在一个点上一个点地啃。
虚拟现实,这四个字说了都快一个世纪了。直到今天,它还是不够“现实”。但我看着那些实验室里默默迭代的原型机、那些在Reddit上兴奋分享新Demo的独立开发者、那些因为一块新透镜而欢呼的工程师……人类想骗过自己的感官,这件事,本身就浪漫得不行。对吧?