当前位置:首页 > 科研成果库

多媒体制作技术:藏在日常内容里的技术变革

2026-09-14 22:31:40小研科研成果库6
我上个月整理旧硬盘,翻出来零八年上学时候做的课程作业,一个几十兆的Flash多媒体课件,那时候为了做这个东西,泡了半个月机房,还找计算机系的同学帮我调交互代码,现在打开看,其实就是几个点击按钮跳转到不同页面,插几张图加一段配音,粗糙得不行,但放在当年,那可是能拿满分的作业。

早在上世纪八十年代,核心逻辑就已经在实验室跑通了

很多人以为多媒体制作是互联网普及之后才出来的新东西,其实不对。早在上世纪八十年代,麻省理工的媒体实验室就已经启动了交互式多媒体的科研项目,那时候研究者就已经验证了:把文字、图片、音频、视频整合在一起,让用户可以主动交互,而不是被动接受,这个方向完全可行。 1980年代麻省理工多媒体实验室早期设备实拍1980年代麻省理工多媒体实验室早期设备实拍 放现在,这就是一个普通网页就能实现的功能。在当年,可是炸了整个计算机圈的大成果。那时候整套设备下来,要上百万美元,只有国家级实验室和顶尖高校能碰,普通从业者想都不用想。 九十年代国内引进这套技术,最早用在百科全书光盘出版上,一套《中国大百科全书》图文音频都有,点哪里出哪里的内容,当年卖得火到断货,那就是我们国家最早一批民用多媒体制作技术落地的成果。 零几年电视台做专题片,非编系统一套要几十万,一块非线性编辑卡的价格,能抵得上市中心半套小户型,那门槛高得吓人。

AI浪潮下,科研方向早就换了新赛道

现在大家天天刷短视频,用剪映一键成片,觉得这就是个给普通人玩的工具,没什么高端科研可言。其实不是,你随手用的智能抠像、自动字幕、文本配音,背后都是最近五年多媒体制作领域顶会卡了无数次才发出来的科研成果。 我去年去行业论坛听数字媒体所的老师分享,现在基于扩散模型的端到端文本生成多媒体内容技术,已经能做到输入几百字的脚本,直接输出分镜、配音、BGM全齐的4K成片,精度已经能满足大部分商单的需求。 说实话,当时听完我后背都发麻。以前接一条十万块的商业宣传片,从策划勘景到拍摄后期,最少要半个月,现在最快一天就能出样片,效率翻了几十倍不止。 AI辅助多媒体分镜制作工作界面截图AI辅助多媒体分镜制作工作界面截图 不过话说回来,现在的技术也没那么完美。AI生成的人物,时不时还是会多一根手指少一根头发,生成的叙事逻辑有时候前言不搭后语,还得人工一点点改。去年有个博主想用AI做一部半小时的独立动画,最后改bug改了半个月,比自己手绘还累,说出来都是圈子里的笑谈。 现在圈内的科研方向,早就不是早年研究怎么把文件压得更小、怎么存下更多素材了,现在大家研究的,是怎么让AI读懂人类模糊的创作需求,怎么给生成的内容加不可篡改的版权水印,怎么降低普通人的创作门槛,这些都是实打实解决当下行业痛点的方向。

技术下放,对普通人到底是好事还是坏事

技术下放,对普通人到底是好事还是坏事技术下放,对普通人到底是好事还是坏事 我见过很多老设计师吐槽,说现在多媒体制作技术太傻瓜了,阿猫阿狗都能进来做,内容质量越来越差,全是模板堆出来的垃圾。 我反倒不这么想。当年活字印刷出来的时候,也有老学者骂,说手抄本才有灵魂,印刷出来的东西都是粗制滥造,结果呢,印刷把知识的门槛拉低,让更多普通人能读到书,整个文明都往前跑了一大截。 现在多媒体制作技术的发展也是一个道理。十年前你要做一个合格的多媒体作品,得会PS修图,会PR剪视频,会写基本的代码,最少学三五个月才能入门,很多有好创意的人,就卡在技术这一步,根本出不了作品。现在呢,你打开手机,十分钟就能做出来带特效带交互的短视频,哪怕你只会打字说话,也能把自己的想法做出来给别人看。 当然坑也有,很多割韭菜的AI工具,收了几百块年费,生成出来的内容糊得像打了马赛克,版权还不归用户,这个真的要擦亮眼睛。 技术从来都是工具,再好的工具也能出烂内容,再朴素的工具也能出好作品。多媒体制作技术走了几十年,从实验室的百万设备,到现在揣在口袋里的手机APP,核心从来没变过——就是帮你把脑子里飘着的想法,变成别人能看得见、摸得着、听得见的内容。 未来只会有更多人能加入创作,这本来就是技术发展最该有的样子。对吧。