Claude3发布成为大模型之王,Openai是否真的跌落神坛,附试用链接

简介: Claude3发布成为大模型之王,Openai是否真的跌落神坛,附试用链接

前言

今天Claude3发布了,展现出了比GPT4更强大的效果,各项性能跑分已经全面超越了GPT4。OpenAI也连夜发布了两个新功能来应对此次冲击。

Claude3包括三个模型:Claude 3 Haiku、Claude 3 Sonnet与Claude 3 Opus,性能依次提升。每个模型均提供更高的性能,让用户能根据需求,找到理想的智能、速度及成本平衡。

Openai的应对


OpenAI同时推出了一个新功能,名为“朗读”(Read Aloud)。这个功能允许ChatGPT以五种不同的声音朗读其回复,目的是为了提供更便捷的用户交互体验。这项功能支持37种语言,并能自动检测文本语言进行朗读,适用于GPT-4和GPT-3.5版本的ChatGPT。

此外,OpenAI通过这次更新展示了其在多模态交互方面的努力。此功能现已在ChatGPT的网页端、iOS和安卓应用上线。新的“朗读”功能进一步丰富了用户与聊天机器人的互动方式,用户可以通过移动应用长按文本激活朗读播放器,或在网页端点击文本下方的扬声器图标来使用朗读功能。


大模型的新标准

Opus,Claude最智能的模型,在大多数常见的AI系统评估基准上超越了其同行,包括本科水平的专家知识(MMLU)、研究生水平的专家推理(GPQA)、基础数学(GSM8K)等等。它在复杂任务上展现出接近人类水平的理解和流畅度,引领了通用智能的前沿。


所有Claude 3模型在分析和预测、细腻内容创作、代码生成以及用西班牙语、日语和法语等非英语语言进行交流方面显示出了增强的能力。

以下是Claude 3模型与我们其他常用模型在多个能力基准[1]上的比较:


更快的速度

Claude 3模型能够支持实时客户聊天、自动完成和数据提取任务,其中响应必须是即时的并且实时的。

Haiku是市场上在其智能类别中速度最快、成本最高效的模型。它能够在不到三秒的时间内阅读一个信息和数据密集的arXiv研究论文(约10k令牌),包括图表和图形。启动后,我们预计进一步提高性能。


对于绝大多数工作负载而言,Sonnet的速度是Claude 2和Claude 2.1的两倍,且具有更高水平的智能。它擅长需要快速响应的任务,如知识检索或销售自动化。Opus的速度与Claude 2和2.1相似,但具有更高水平的智能。

强大的视觉能力

Claude 3模型具有与其他领先模型相当的复杂视觉能力。能够处理各种视觉格式,包括照片、图表、图形和技术图纸。能够为企业客户提供新的模式,其中一些客户高达50%的知识库以各种格式编码,如PDF文件、流程图或演示幻灯片。

更少的拒绝回答

以前的Claude模型经常做出不必要的拒绝,这表明缺乏上下文理解。Claude 3在这方面取得了巨大的进展:与前几代模型相比,Opus、Sonnet和Haiku大大降低了拒绝回答接近系统安全边界的提示的可能性。如下所示,Claude 3模型显示出对请求的更细腻理解,识别真正的危害,并且更少拒绝回答无害的提示。

超长上下文记忆

Claude 3系列模型在发布时最初将提供200K的上下文记忆。三个模型都能够接受超过100万token的输入,可能会使这一功能可用于需要增强处理能力的选定客户。

为了有效处理长上下文提示,模型需要强大的回忆能力。'Needle In A Haystack'(NIAH)评估衡量模型从大量数据语料库中准确回忆信息的能力。通过使用每个提示的30个随机针/问题对中的一个,并在一个多样化的众包文档语料库上测试,增强了这个基准的健壮性。Claude 3 Opus不仅实现了接近完美的回忆,准确度超过99%,而且在某些情况下,它甚至识别出评估本身的局限性,通过认识到“针”句子似乎是人为插入到原始文本中的。


相关文章
|
2月前
|
机器学习/深度学习 人工智能 并行计算
"震撼!CLIP模型:OpenAI的跨模态奇迹,让图像与文字共舞,解锁AI理解新纪元!"
【10月更文挑战第14天】CLIP是由OpenAI在2021年推出的一种图像和文本联合表示学习模型,通过对比学习方法预训练,能有效理解图像与文本的关系。该模型由图像编码器和文本编码器组成,分别处理图像和文本数据,通过共享向量空间实现信息融合。CLIP利用大规模图像-文本对数据集进行训练,能够实现zero-shot图像分类、文本-图像检索等多种任务,展现出强大的跨模态理解能力。
122 2
|
3月前
|
机器学习/深度学习 人工智能 UED
OpenAI o1模型:AI通用复杂推理的新篇章
OpenAI发布了其最新的AI模型——o1,这款模型以其独特的复杂推理能力和全新的训练方式,引起了业界的广泛关注。今天,我们就来深入剖析o1模型的特点、背后的原理,以及一些有趣的八卦信息。
340 73
|
2月前
|
人工智能 前端开发
大模型体验体验报告:OpenAI-O1内置思维链和多个llm组合出的COT有啥区别?传统道家理论+中学生物理奥赛题测试,名不虚传还是名副其实?
一个月前,o1发布时,虽然让人提前体验,但自己并未进行测试。近期终于有机会使用,却仍忘记第一时间测试。本文通过两个测试案例展示了o1的强大能力:一是关于丹田及练气的详细解答,二是解决一道复杂的中学生物理奥赛题。o1的知识面广泛、推理迅速,令人印象深刻。未来,或许可以通过赋予o1更多能力,使其在更多领域发挥作用。如果你有好的测试题,欢迎留言,一起探索o1的潜力。
|
2月前
|
人工智能 自然语言处理 安全
【通义】AI视界|Adobe推出文生视频AI模型,迎战OpenAI和Meta
本文精选了过去24小时内的重要科技新闻,包括微软人工智能副总裁跳槽至OpenAI、Adobe推出文本生成视频的AI模型、Meta取消高端头显转而开发超轻量设备、谷歌与核能公司合作为数据中心供电,以及英伟达股价创下新高,市值接近3.4万亿美元。这些动态展示了科技行业的快速发展和激烈竞争。点击链接或扫描二维码获取更多资讯。
|
3月前
|
人工智能 Serverless API
一键服务化:从魔搭开源模型到OpenAI API服务
在多样化大模型的背后,OpenAI得益于在领域的先发优势,其API接口今天也成为了业界的一个事实标准。
一键服务化:从魔搭开源模型到OpenAI API服务
|
2月前
|
前端开发 开发者
大模型代码能力体验报告之贪吃蛇小游戏《二》:OpenAI-Canvas-4o篇 - 功能简洁的文本编辑器加一点提示词语法糖功能
ChatGPT 的Canvas是一款简洁的代码辅助工具,提供快速复制、版本管理、选取提问、实时编辑、代码审查、代码转写、修复错误、添加日志和注释等功能。相较于 Claude,Canvas 更加简单易用,但缺少预览功能,适合一般开发者使用。
|
3月前
|
搜索推荐 算法
模型小,还高效!港大最新推荐系统EasyRec:零样本文本推荐能力超越OpenAI、Bert
【9月更文挑战第21天】香港大学研究者开发了一种名为EasyRec的新推荐系统,利用语言模型的强大文本理解和生成能力,解决了传统推荐算法在零样本学习场景中的局限。EasyRec通过文本-行为对齐框架,结合对比学习和协同语言模型调优,提升了推荐准确性。实验表明,EasyRec在多个真实世界数据集上的表现优于现有模型,但其性能依赖高质量文本数据且计算复杂度较高。论文详见:http://arxiv.org/abs/2408.08821
68 7
|
2月前
|
API
2024-05-14 最新!OpenAI 新模型 GPT-4 omni 简单测试,4o速度确实非常快!而且很便宜!
2024-05-14 最新!OpenAI 新模型 GPT-4 omni 简单测试,4o速度确实非常快!而且很便宜!
48 0
|
3月前
|
机器学习/深度学习 人工智能 供应链
【通义】AI视界|OpenAI的“草莓”模型预计两周内上线!像人类一样思考!
本文介绍了近期科技领域的五大亮点:OpenAI即将推出的新一代AI模型“草莓”,具备高级推理能力;亚马逊测试AI技术加速有声读物生产,通过语音克隆提高效率;Kimi API新增联网搜索功能,拓宽信息来源;顺丰发布物流行业专用大语言模型“丰语”,提升工作效率;钉钉推出“AI班级群”功能,改善家校沟通体验。更多详情,请访问[通义官网]。
|
4月前
|
人工智能 机器人
OpenAI推出了其最强大模型的迷你版本
OpenAI推出了其最强大模型的迷你版本
OpenAI推出了其最强大模型的迷你版本