2022 年度盘点 | 更成熟的 AI,更破圈的技术狂欢

简介: 2022 年度盘点 | 更成熟的 AI,更破圈的技术狂欢

image.png

内容一览:2022 年 AI 领域发展不断提速,新技术成果纷纷落地,模型迭代加速升级。本文总结了 2022 年 AI 领域各大公司的技术成就。关键词:年终盘点   大厂   技术创新

2022 年在此起彼伏的咳嗽声中接近尾声,这一年,AIGC 成为人工智能领域最大黑马,ScienceAI 有了更多实际落地的应用,这一年我们经历了各大厂商缩减预算、裁撤员工,也体验了绝处逢生的技术狂欢……

今天,我们将通过这篇文章,与各位同行共同回顾 2022 年那些人工智能领域具有突破性意义的研发成果。

data2vec

语音、视觉及文本自监督学习的通用框架

发布机构:Meta AI

发布时间:2022 年 1 月

项目地址:https://github.com/facebookre...

data2vec 是一个大一统的多模态自监督学习模型,可以以较高的性能处理图像、文本、语音等任务。12 月 16 日 data2vec 2.0 发布,与现有的计算机视觉自监督算法相比,相同精度下速度快了 16 倍。

image.png

data2vec 2.0 原理简介

AlphaCode

竞赛级别代码生成 AI

发布机构:DeepMind

发布时间:2022 年 2 月

项目地址:https://github.com/deepmind/c...

借助大型语言模型,依据问题的语言描述构建代码。在 Codeforces 挑战赛中,AlphaCode 击败了 46% 的参赛者。该研究不仅登上了 Science 封面,还被该杂志评入年度十大科学突破。

image.png

AlphaCode 概览

Dall·E 2

文本到图像的生成工具

发布机构:OpenAI

发布时间:2022 年 4 月

项目地址:https://openai.com/dall-e-2/

Dall·E 2 依据文本描述,可以创建更加具有现实主义色彩的艺术图像。与 OpenAI 2021 年发布的 Dall·E 相比,Dall·E 2 可以生成更真实、更准确的图像,且分辨率提高了 4 倍。

image.png

An astronaut riding a horse in a photorealistic style

Dall·E 2 生成的图像示例

Gato

全能型智能体

发布机构:DeepMind

发布时间:2022 年 5 月

项目地址:https://www.deepmind.com/blog...

Gato 是一个全能型智能体,可以玩雅达利游戏、对图像进行描述、聊天以及根据上下文决定输出文本、关节扭力或其他 token。这种通用模型解决所有任务类似人工智能,最终或超过特定于专门领域的模型。

image.png

ESM Fold

蛋白质结构预测模型

发布机构:Meta AI

发布时间:2022 年 7 月

项目地址:https://github.com/facebookre...

ESM Fold 是一个预测蛋白质序列的模型,能够直接进行高准确度、端对端、原子层级结构预测。它仅使用单个输入序列,只需查看单个蛋白质序列,这极大加快了推理速度。

image.png

用 ESM Fold 进行单序列结构预测

Make-A-Video

依据文本生成视频的 AI 系统

发布机构:MetaAI

发布时间:2022 年 9 月

项目地址:https://makeavideo.studio/

Make-A-Video 是一个文本-视频生成模型,它通过带有文字描述的图像,来学习常用的描述方式,同时使用无标签视频,了解和学习移动方式。Make-A-Video 生成的视频风格多样,对文本还原度高,是生成短视频方面的 SOTA 模型。

image.png

AlphaTensor

依据文本描述生成视频的部分示例改进矩阵乘法,提升计算速度

发布机构:DeepMind

发布时间:2022 年 10 月

项目地址:https://github.com/deepmind/a...

AlphaTensor 改进了目前最优的 4*4 矩阵乘法,并且进一步提升了其他 70 余种不同大小矩阵乘法计算速度。该成果登上了 Nature 封面,被 Scinece 杂志评入年度十大科学突破。

image.png

AlphaTensor 架构一览

Magic 3D text-to-3D content 创建工具

发布机构:NVIDIA

发布时间:2022 年 11 月

项目地址:https://deepimagination.cc/Ma...

NVIDIA 入局 AIGC,凭文字描述就可生成 3D Mesh 模型。它结合 image conditioning 技术以及基于文本提示的编辑方法,提供了一个控制 3D 合成的新思路,使得创建高质量 3D Mesh 模型成为可能。

image.png

Magic 3D 通过两个阶段创建 text-to-3D content

ChatGPT

超级对话模型

发布机构:OpenAI

发布时间:2022 年 11 月

项目地址:https://openai.com/blog/chatgpt/

ChatGPT 的训练使用了 RLHF (Reinforcement Learning from Human Feedback),与 InstructGPT 使用的方法相同,仅在数据收集设置上有细微差别。ChatGPT 可以像人类一样聊天交流,完成撰写邮件、视频脚本、文案、翻译及代码等任务。自上线以来,引起了海内外无数开发者的争相试用和热烈讨论,堪称 2022 年开发人员参与度最高的技术项目。

image.png

ChatGPT 训练过程概览

Point·E

依据文本描述生成 3D 点云

发布机构:OpenAI

发布时间:2022 年 12 月

项目地址:https://github.com/openai/poi...

用 Point·E 依据文本提示生成 3D 点云的过程分为三个步骤:1、依据文本提示,生成一个合成视图 (synthetic view)2、依据合成视图,生成 coarse point cloud (1024 point)3、基于低分辨率点云和合成视图,生成 fine point cloud (4096 Point)利用 Point·E 单卡 1 分钟生成 3D 点云,text-to 3D 告别高算力消耗时代。

image.png

冬去春来,畅想 2023

2022 即将画上句点,2023 注定是充满未知的一年,AIGC 领域会有哪些新成果?ScienceAI 将如何应对基础科学与 AI 交叉带来的挑战?芯片研发、国产操作系统,又会产生哪些新突破?你对 2023 年人工智能领域的技术和应用有哪些预判,欢迎留言交流讨论~

相关文章
|
24天前
|
人工智能 JSON 前端开发
Agentic AI崛起:九大核心技术定义未来人机交互模式​
本文系统梳理AI智能体架构设计的九大核心技术,涵盖智能体基础、多智能体协作、知识增强、模型优化、工具调用、协议标准化及人机交互等关键领域,助力构建高效、智能、协同的AI应用体系。建议点赞收藏,持续关注AI架构前沿技术。
356 1
|
1月前
|
机器学习/深度学习 人工智能 程序员
Reflexion:让AI智能体学会反思的神奇技术
想象一下AI智能体能像人类一样从错误中学习,Reflexion技术让智能体不再需要重新训练就能自我改进。本文通过一个智能体助手小R的成长故事,带你轻松理解这个改变智能体学习方式的创新技术。
|
2月前
|
数据采集 人工智能 分布式计算
ODPS在AI时代的发展战略与技术演进分析报告
ODPS(现MaxCompute)历经十五年发展,从分布式计算平台演进为AI时代的数据基础设施,以超大规模处理、多模态融合与Data+AI协同为核心竞争力,支撑大模型训练与实时分析等前沿场景,助力企业实现数据驱动与智能化转型。
259 4
|
18天前
|
存储 机器学习/深度学习 人工智能
​​解锁AI检索的7大Embedding技术:从稀疏到多向量,一文掌握!​
本文系统解析七种主流文本嵌入技术,包括 Sparse、Dense、Quantized、Binary、Matryoshka 和 Multi-Vector 方法,结合适用场景提供实用选型建议,助你高效构建文本检索系统。
148 0
|
2月前
|
人工智能 自然语言处理 机器人
智能体平台哪家值得选?盘点国内外12家AI Agent平台技术特色
智能体平台正引领人机协作新潮流,将“智能”交给机器,让“平台”服务于人。2024年被Gartner定义为“AgenticAI元年”,预示未来企业交互将由智能体主导。面对百余平台,可从三条赛道入手:通用大模型、RPA升级派与垂直场景定制。不同需求对应不同方案,选对平台,才能让AI真正助力工作。
|
2月前
|
机器学习/深度学习 人工智能 搜索推荐
思维树提示技术:让AI像人类一样思考的魔法
想象一下,如果AI能像你思考问题一样有条理,从一个想法延伸到多个分支,会发生什么?思维树提示技术就是这样一种让AI更聪明的方法,通过结构化思维引导,让AI等大模型给出更深入、更全面的回答。本文将用最轻松的方式,带你掌握这个让AI智商飞升的秘技。
|
2月前
|
存储 人工智能 算法
AI 图纸表格识别与智能文档协同处理技术介绍
针对制造业、工程建设等领域图纸表格数据提取效率低、误差高的问题,本文介绍了一套涵盖表格识别、数据导出、EBOM转MBOM及智能文档协同处理的技术方案,实现图纸数据结构化与全生命周期管理。
103 0
|
2月前
|
设计模式 人工智能 API
​​混合检索技术:如何提升AI智能体50%的响应效率?​
本文深入解析检索增强智能体技术,探讨其三大集成模式(工具模式、预检索模式与混合模式),结合实战代码讲解RAG组件链构建、上下文压缩、混合检索等关键技术,并提供多步检索工作流与知识库自更新机制设计,助力高效智能体系统开发。
249 0
|
24天前
|
数据采集 Web App开发 人工智能
如何让AI“看懂”网页?拆解 Browser-Use 的三大核心技术模块
Browser-Use 是一种基于大语言模型(LLM)的浏览器自动化技术,通过融合视觉理解、DOM解析和动作预测等模块,实现对复杂网页任务的自主操作。它突破了传统固定选择器和流程编排的限制,具备任务规划与语义理解能力,可完成注册、比价、填报等多步骤操作。其核心功能包括视觉与HTML融合解析、多标签管理、元素追踪、自定义动作、自纠错机制,并支持任意LLM模型。Browser-Use标志着浏览器自动化从“规则驱动”向“认知驱动”的跃迁,大幅降低维护成本,提升复杂任务的处理效率与适应性。
676 28

热门文章

最新文章