OpenAI 全新发布文生视频模型 Sora,功能有多强大?将带来哪些影响?

简介: OpenAI 全新发布文生视频模型 Sora,功能有多强大?将带来哪些影响?

前言:

关于OpenAI的新技术

这个新技术啊,你知道嘛,就是那个 OpenAI 最近搞出来的,搞得好像挺神秘的,都不怎么透露技术细节,就说用了个叫 Transformer 的东西。可真是,这个模型到底怎么回事,为啥放大了效果就这么惊艳,我们还真是一头雾水啊。

技术细节的神秘

国内国外对比起来,我们好像又落后了点,特别是这次这个新玩意,连个头绪都找不到。国内的一些团队可能要跟着追赶,但貌似现有技术路线都不太对路,哎,追起来也难。

那么说到用途,其实就是老话题了,这东西到底有啥用?它主要冲击的又是谁?去年在某淘宝活动上,我们搞技术的一直在研究,可这东西可控性太差了,生成的沙发虽然漂亮,但要控制尺寸啥的却不现实,你想让它变成电视两倍大,那就别想了。对于建筑效果图啥的也是一样,想控制各种细节都难。所以,要想在实际应用中发挥作用,还得想想怎么才能控制这玩意。

技术层面的探索

再说技术层面,有些大牛一开始觉得可能得用游戏引擎帮忙,毕竟生成的视频质量太高了。我也没想到,刚出来就在视频领域大显身手,但要是靠游戏引擎,数据量就成问题了,要标注的话成本也高得离谱。

对通用人工智能(AGI)和世界模型的思考

至于是不是真的跟通用人工智能(AGI)和世界模型有关,我个人觉得还差得远。虽然有些人把它扯上了AGI的关系,但我觉得那还早呢。至于世界模型,是不是学到了,学到了多少,这个还真说不清楚。反正总的来说,这个新玩意确实惊艳,但大家也别忘了该干啥还得干啥。

Transformer的崛起

想深挖一下这个技术,其实就得从它的基础开始说起。所以,先来聊聊Transformer。这个东西算是现代自然语言处理领域的一股清流,它采用了自注意力机制,把句子中的每个词都能够关联起来,形成了一个非常强大的语义理解网络。在语言生成任务上,它能够生成非常流畅、准确的文本,因为它不像传统的循环神经网络那样容易产生梯度消失或爆炸的问题。这也就是为什么很多人对Transformer感兴趣,而OpenAI的这个新技术也使用了Transformer,可见Transformer在自然语言处理领域的强大影响力。

但是,就像我之前说的,我们对这个新技术的具体细节了解得并不多。OpenAI发布的博客里基本没提到什么技术细节,只字片语都没有,只说用了Transformer。这就让人有点摸不着头脑了,这个模型到底是怎么回事,为啥放大了效果就这么惊艳,我们还真是一头雾水啊。或许在技术上,这个模型做了一些非常厉害的优化或者改进,但具体是什么,我们还是一头雾水。

不过,虽然我们对技术细节一无所知,但我们可以猜想一下,这个新技术可能有着怎样的潜力和影响。首先,从国内外的情况来看,国内可能要在这方面跟着追赶了。毕竟,现在这个新技术出来了,国内还没有太多消息,也没人搞清楚具体怎么玩。而且,貌似现有的技术路线都不太对路,想要追上也不容易。可见,要想在这个领域有所作为,还得花不少心思啊。

然后,再说说这个新技术可能的应用场景。这东西到底有啥用?它主要冲击的又是谁?这个问题可不简单。我们去年在某淘宝活动上做技术支撑的时候,就一直在琢磨这个问题。可这玩意可控性太差了,生成的沙发虽然漂亮,但要控制尺寸啥的却不现实,你想让它变成电视两倍大,那就别想了。对于建筑效果图啥的也是一样,想控制各种细节都难

相关文章
|
2月前
|
机器学习/深度学习 人工智能 并行计算
"震撼!CLIP模型:OpenAI的跨模态奇迹,让图像与文字共舞,解锁AI理解新纪元!"
【10月更文挑战第14天】CLIP是由OpenAI在2021年推出的一种图像和文本联合表示学习模型,通过对比学习方法预训练,能有效理解图像与文本的关系。该模型由图像编码器和文本编码器组成,分别处理图像和文本数据,通过共享向量空间实现信息融合。CLIP利用大规模图像-文本对数据集进行训练,能够实现zero-shot图像分类、文本-图像检索等多种任务,展现出强大的跨模态理解能力。
218 2
|
17天前
|
Go 开发工具
百炼-千问模型通过openai接口构建assistant 等 go语言
由于阿里百炼平台通义千问大模型没有完善的go语言兼容openapi示例,并且官方答复assistant是不兼容openapi sdk的。 实际使用中发现是能够支持的,所以自己写了一个demo test示例,给大家做一个参考。
|
3天前
|
编解码 人工智能 自然语言处理
OpenAI Sora 怎么用:最新详细教程-新手小白必看 | Sora 如何使用?(202412月最新更新)
OpenAI的Sora模型现已正式开放使用,本文将详细介绍Sora的注册、使用方法及视频生成技巧。Sora能根据简洁文本生成长达60秒的高质量视频,具备远超以往模型的时间连续性和视觉效果。文章涵盖从零开始的准备工作、操作界面介绍、视频生成设置、编辑功能(如Re-cut、Remix、Blend、Loop)以及Storyboard故事板功能,帮助新手轻松上手世界顶级AI视频创作工具。此外,还解答了关于Sora的常见问题,包括订阅计划、视频类型和局限性等,适合全媒体创作者参考。
45 3
OpenAI Sora 怎么用:最新详细教程-新手小白必看 | Sora 如何使用?(202412月最新更新)
|
12天前
|
人工智能 编解码 机器人
OpenAI又出王炸了!正式推出超强AI视频模型Sora
OpenAI正式推出AI视频生成模型Sora,可根据文本提示生成逼真视频,面向美国及其他市场ChatGPT付费用户开放。Sora Turbo支持生成长达20秒的视频及多种变体,具备模拟物理世界的新兴能力,可创建多镜头视频,提供Remix和Storyboard等创新功能。
42 4
OpenAI又出王炸了!正式推出超强AI视频模型Sora
|
20天前
|
人工智能 自然语言处理 计算机视觉
OpenAI发布sCM提升50倍效率,扩散模型重大技术突破!
OpenAI近期发布了Simplified Consistency Models (sCM) 技术,这是在扩散模型基础上的重大改进,实现了50倍效率提升。sCM通过简化和稳定连续时间一致性模型的训练过程,解决了传统模型中的离散化误差和训练不稳定性问题,显著提升了生成模型的性能和效率。在多个数据集上的测试结果表明,sCM不仅超越了现有模型,还在生成模型的实际应用中展现了巨大潜力。论文地址:https://arxiv.org/abs/2410.11081
39 3
|
1月前
|
人工智能 计算机视觉 网络架构
OpenAI攻克扩散模型短板,清华校友路橙、宋飏合作最新论文
扩散模型在生成AI领域取得显著成果,但其训练不稳定性和采样速度慢限制了发展。OpenAI与清华校友合作,提出连续时间一致性模型(CMs),通过TrigFlow等创新解决了这些问题,大幅提升了训练稳定性和计算效率,实现了与最优模型相当的样本质量,同时减少了计算资源消耗。
42 2
|
1月前
|
SQL 机器学习/深度学习 人工智能
今日 AI 开源|共 4 项|DeepSeek 推出新一代 AI 推理模型,实力比肩 OpenAI o1-preview!
本文介绍了四个最新的 AI 开源项目,涵盖多模态生成式 AI、自然语言到 SQL 转化、多模态数学推理和复杂逻辑推理等多个领域,为 AI 应用开发提供了丰富的资源和工具。
117 0
今日 AI 开源|共 4 项|DeepSeek 推出新一代 AI 推理模型,实力比肩 OpenAI o1-preview!
|
3月前
|
机器学习/深度学习 人工智能 UED
OpenAI o1模型:AI通用复杂推理的新篇章
OpenAI发布了其最新的AI模型——o1,这款模型以其独特的复杂推理能力和全新的训练方式,引起了业界的广泛关注。今天,我们就来深入剖析o1模型的特点、背后的原理,以及一些有趣的八卦信息。
370 73
|
2月前
|
人工智能 自然语言处理 安全
【通义】AI视界|Adobe推出文生视频AI模型,迎战OpenAI和Meta
本文精选了过去24小时内的重要科技新闻,包括微软人工智能副总裁跳槽至OpenAI、Adobe推出文本生成视频的AI模型、Meta取消高端头显转而开发超轻量设备、谷歌与核能公司合作为数据中心供电,以及英伟达股价创下新高,市值接近3.4万亿美元。这些动态展示了科技行业的快速发展和激烈竞争。点击链接或扫描二维码获取更多资讯。
|
3月前
|
人工智能 Serverless API
一键服务化:从魔搭开源模型到OpenAI API服务
在多样化大模型的背后,OpenAI得益于在领域的先发优势,其API接口今天也成为了业界的一个事实标准。
一键服务化:从魔搭开源模型到OpenAI API服务
下一篇
DataWorks