我做了个网站,随时掌控 500 个 AI 模型的动态!

简介: 天天被新 AI 模型轰炸,我终于出手了!我用 Vibe Coding 做了个 AI 大模型世界网站,帮你快速了解 DeepSeek / GPT / Claude / Kimi / GLM 等新模型、多模态模型、国内外模型发展、AI 编程最好的模型排行等等

大家好,我是程序员鱼皮。

  • 什么?又有新模型发布了?
  • 现在最好的文本模型是哪个?
  • DeepSeek 有多模态模型了么?
  • 国外模型是不是真的把国内开源模型远远甩在了后面?

AI 模型发展得太快了,你有没有这样一种感觉,仿佛天天瘫坐在原子弹上看椅子爆炸。

一段时间不关注 AI,就会开始迷茫,觉得自己好像和时代掉队了。

那有没有一个工具,能让我随时随地,从上帝视角快速全面地了解地球上 所有 AI 模型 的现状和发展过程呢?

很抱歉,没有。

不过没关系,作为一名 AI 编程博主,我掏出我的豆包(bushi

掏出顶级模型,运用我从自己 《AI 编程教程》 里学到的高超 AI 编程技巧,输入一段看起来很牛批、实际上非常无脑的提示词,然后等着 AI 疯狂输出三天三夜。

我的「AI 大模型世界」网站就这么诞生了!

指路:https://bilibili.com/toy/ai-model-world

本文视频版:https://bilibili.com/video/BV1eCe36GELv

1、进门先看今日格局

进入这个世界,你能最直接不绕弯子地看到当下最聪明、最会编程、性价比最高、最新发布的 AI 模型分别是谁。

今日格局

每块牌子底下都写清楚了凭什么。比如最聪明那位 GPT-6 Astra,综合智力指数 166,是 206 个受测模型里的第一名;最划算的 DeepSeek V4 Flash 0731 智力全球第 31,价格却远低于同级。

顺便说一句,这些分数没有一个是我自己拍脑袋定的,全都来自 Epoch AI、LiveBench 这些第三方公开评测,网站只负责把它们抓回来、对齐、排好队。

2、分类查看模型

往下滚动网页,能看到按类型划分的模型。

按类型看

文本模型 226 个、视觉模型 239 个、全模态 44 个,图像生成、视频生成、语音模型也都单独成组。点进任何一类,就能看到这一类里目前排名最靠前的模型。

3、国内外有哪些模型

再往下,世界被分成了国外和国内两个区域,国外有 27 家模型厂商。每个模型都是这个世界里的一个像素小人。名字下面那四根能力条分别是聪明、编程、记性和便宜,条越长越强,右边还标了它在全球的排名。

国外分区

国内有 13 家模型厂商:

国内分区

小人的长相也全是数据算出来的。体型对应模型规模,参数量越大块头越壮;身上的装饰越华丽,说明它的调用价格越贵;家里的书架越高,它能读的上下文就越长;右边那台电脑代表编程能力,没有公开编程成绩的模型,电脑上直接盖着一块防尘布。

4、模型搜索

先问问看,大家现在最喜欢的是哪个模型呢?

我个人非常喜欢鲸鱼(娘),所以想把它家的模型一次性看个够。不用翻页找,直接在顶部搜索框里敲几个字母就行。

搜索深度求索

搜索功能非常灵活,支持按照模型名、厂商名,还有模型能力搜索。比如你输入「多模态」,它会把所有多模态模型列出来;输入「deepseek」,第一条就是深度求索这家厂商,底下跟着它的 24 个模型。

点进厂商页,DeepSeek 的进化过程就按时间线铺开了。

DeepSeek 厂商页

一路往下翻,能看到它每个月都发布了什么。翻到最底下,2025 年 1 月那一排里躺着当初全网爆火的 DeepSeek-R1。

R1 时期

到现在已经过去一年零八个月了。爷青回啊……

5、查看单个模型的一生

点开最新的 DeepSeek V4.1 Flash,先看到的是它的身份卡。

模型详情页

这是一个视觉模型,中等价位、能读长文、会看图,而且开放权重。上面那条小时间线告诉你它是从 V4 Flash Vision Exp 这个视觉实验模型进化过来的,属于同一个系列的第二代。

右边的能力条里,记性那一项是满的,上下文窗口 100 万 tokens。网站还给了个换算,说这个长度一次能读完《哈利·波特》全七部,比干看一个数字有感觉多了。

继续往下,能看到 AI 的身世和战绩:

身世与战绩

发布日期、知识截止、开源许可、输入输出价格都列在左边,右边是各项专业测试的评分。V4.1 Flash 刚发布不久,几个学术榜单还没收录它,所以这里老老实实写着「未参评」。

这一点我专门跟 AI 强调过,没有成绩就写没参评,绝对不许用估算值把空缺填上。一个模型没被测过,不代表它不行。

页面最底下,还能刷到各位 UP 主对这个模型的评测视频。

对了,下图第一个评测视频的博主是狗 🐶

B 站评测视频

这些视频是用 B 站公开的搜索接口抓回来的,搜索词就是模型名加上「测评」两个字,抓到的结果按播放量排好序存进仓库,页面直接读,我完全不用手动挑选视频。

至于第一条为什么是我自己的视频,因为站长的视频会置顶,算是我给自己开的一个小后门,很合理吧?

6、几百个模型的发布史,一条时间线看完

看完 DeepSeek,别的模型又是怎么一步步发展过来的呢?

切换到「时间线」,全世界 556 个主流 AI 模型,按发布月份从新到旧都排好了!

彩色名字表示这个模型有第三方综合评测成绩

时间线

光是 2026 年 8 月这一个月,就有 33 个模型发布,密密麻麻铺满了大半屏,太卷了!

一路往下翻,最早的记录停在 2023 年 3 月。也就是说,从 AI 全面爆火到现在,满打满算才三年半,AI 的进步真的是太快了。

7、模型排行榜

如果你好奇现在哪些模型能力最强,哪些模型性价比最高、适合日常办公,那就去看排行榜。

排行榜

这里一共有 81 个榜单,综合智力、性价比、上下文窗口、最便宜,还有 SWE-bench、Terminal-Bench 这些专门测编程能力的。

榜单上方可以按地区、开源闭源、模型类型来筛选,非常灵活~

开源赛道排名

开源赛道的冠军是国内的 Kimi K3,综合智力 157.6,放到全球总榜上排第 11,已经很逼近国外顶级闭源模型的水平了。

更有意思的是前十名里有九个都来自国内厂商,月之暗面、深度求索、智谱轮着上,国产加油!

8、数据是怎么来的

做这个网站的时候,我给 AI 定的第一条规矩就是:上线之后不能靠我人工维护

所以整套数据都是脚本自动同步的。利用 GitHub Actions 自动化,每 12 小时跑一次,从 Epoch AI 拿综合智力评测、从 models.dev 拿模型规格和价格、从 LiveBench 拿各项能力成绩,合并之后生成一份快照提交进仓库。

新模型发布之后,最快半天就会自己出现在 AI 大模型世界里,我不用动一根手指~

最后哔哔

这个网站我已经完全开源了,代码和数据都在 GitHub 上,你想自己部署一份、或者改成你喜欢的样子都没问题。

开源指路:https://github.com/liyupi/ai-model-world

同时它也部署到了 B 站的 Toy 平台,完全免费、免登录、免注册,打开就能用。

说真的,这个项目技术上没什么难度,就是一堆数据抓取加一个静态页面。但在有 AI 之前,光是把几百个模型的参数和评测成绩整理成表格,就够我折腾一整个周末了。现在我只要把想法讲清楚,剩下的交给 AI,几天就能做出一个能自己跑起来的完整产品。

如果你也想试试用 AI 做点自己的小工具,我写了一套免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注哦~

相关文章
|
9天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
|
9天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。
|
15天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
10天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1912 15
|
8天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1034 1
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
14天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1670 4
|
10天前
|
缓存 人工智能 自然语言处理
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
本文是阿里云百炼平台Qwen3.8-Flash大模型的选型接入指南,作为兼顾性能与响应速度的高性价比多模态模型,它支持百万级上下文窗口、全场景多模态输入与完整智能体能力矩阵,适配编程辅助、智能体协作等核心场景。文中同步梳理了最新下调的阶梯定价、夜间4折等优惠活动,搭配OpenAI兼容流式调用示例,帮助开发者低成本快速落地高并发AI应用。
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
|
16天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
1831 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
11天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
829 2
|
9天前
|
缓存 测试技术 API
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
DeepSeek V4.1 Flash 内测不用申请,base_url 不变、改个模型名就能调,9/10 到期。本文讲清接入、计费限流与多模态注意点。
832 0
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)

热门文章

最新文章