才1天，谷歌Gemini被曝视频造假！多模态视频竟通过剪辑配音“作弊”

136 0 0

当地时间12月6日，谷歌宣布推出“最大、最强、最通用”的新大型语言模型Gemini。Gemini被视为对于AI（人工智能）新锐巨头OpenAI旗下最新大模型GPT-4的直接回应，也象征着一度因聊天机器人ChatGPT而处于被动状态的谷歌终于正式冲回赛道。

然而才过一天，谷歌Gemini被质疑造假、夸大宣传的议论声淹没了。多模态视频是剪辑拼贴的，AlphaGo也并未结合进Gemini中。谷歌这波公关，属实是着急了。

在推出Gemini后，谷歌发布了一个时长六分钟的演示视频，展现了测试员和Gemini的一些有趣互动，其中包括让Gemini识别图片并用多种语言描述、让Gemini利用一张地图设计智力问答、和Gemini玩杯子游戏和推理小游戏等等。在整个过程中，Gemini的反应速度都非常快，还会生成音频和图片来辅助回答，并用上一些口语化乃至幽默化的表达，可谓是让人大开眼界。

然而，很快就有网友从视频开篇的文字免责声明中发现了问题，认为其可能暗示了视频中展示的是精心挑选的好结果，不是实时录制，而经过剪辑的。随后，谷歌在一篇博客文章中解释了多模态交互过程，基本上也间接承认了只有使用静态图片和多段提示词拼凑，才能达成演示视频中的效果。

才1天，谷歌Gemini被曝视频造假！多模态视频竟通过剪辑配音“作弊”
例如，在文章中，谷歌承认，不同于视频中对于猜拳手势的快速反应，只有在向Gemini同时展示这三个手势并提示其这是游戏时，Gemini才会得出猜拳游戏的结论。（官网截图）

有分析指出，这和谷歌在视频中所暗示的可以说是完全不同，因为从视频看来，Gemini可以实时观察周围的世界并做出反应，用户可以与Gemini进行流畅的语音对话。沃顿商学院教授伊桑·莫利克（Ethan Mollick）也在X平台上进行了演示，如果是使用静态图片和多段提示词，完全可以通过ChatGPT Plus来复制Gemini的表现。

在质疑发酵后，谷歌DeepMind产品副总裁伊莱·柯林斯（Eli Collins）对外媒回应称，视频中的画鸭子演示（画一个鸭子的简笔画，Gemini可以对每一步骤做出正确的解释）确实是研究级别的功能，至少目前还没有出现在谷歌的实际产品中。

谷歌DeepMind研究和深度学习负责人副总裁奥里奥尔·维尼亚尔斯（Oriol Vinyals）也在X（原推特）平台上发布长文，解释了团队是如何制作该视频的：“视频中的所有用户提示和输出都是真实的，只是为了简洁而进行了缩短。”维尼亚尔斯还表示：“该视频展示了使用Gemini构建的多模态用户体验是什么样子。我们这样做是为了激励开发人员。”

然而，维尼亚尔斯的回应引发了更多的争议。有网友评论道：“如果你想激励开发者，为什么不发布真实的内容呢？被缩短的用户提示就不算‘真实’。这样做既不真诚，又具有误导性。”

有谷歌员工对外媒透露，他们认为这段视频描绘了一幅“不切实际的画面”。有员工表示，对这种夸张的演示并不感到惊讶，因为员工们已经习惯了公司会对产品在某种程度上进行夸大营销：“我认为大多数使用过大语言模型技术的员工都知道，要对（演示中的）这一切持保留态度。”

有外媒认为，谷歌“庞大的官僚体系和各级产品经理使其直到现在都无法像OpenAI那样敏捷地推出产品”。对于正在应对AI转型影响的社会而言，这并不是坏事。但对于谷歌最近这种迅速推进的表现，应该保持一定的保留态度。