【AI】Agent 全栈进阶|大模型基础与对话调用

简介: 本文开启Agent代码实操,先讲解大语言模型底层原理,依托LangChain框架搭配阿里百炼接口,演示基础对话、系统提示词角色扮演、图片多模态识别与多轮上下文会话,附带完整可运行Python代码

200x200

  ◆ 博主名称: QuZhengRong

  AI俘虏,样式苦手

⭐️ LuckReport专栏LuckReport

⭐️ SpringBoot专栏SpringBoot

⭐️ SpringCloud专栏SpringCloud


目录

微信图片_20260807092511_767_3_resized
上一篇博客我梳理了 Agent 的学习路线,这一章开始动手写代码,先从最基础的环节——调用大模型对话开始。

搞 Agent 绕不开跟大模型打交道,学会用代码跟它对话是第一步

一、什么是大模型

大语言模型(LLM):基于 Transformer 架构的超大规模神经网络,经海量文本训练,核心能力是预测下一个词。

简单说,你问它“1+1=”,它能根据学到的知识,猜出下一个词是“2”。它并不理解数学运算,只是基于统计概率做出预测。

Transformer 架构:大模型的核心技术,其优势在于:

  1. 理解上下文:擅长捕捉句子中的逻辑关系和指代(如“苹果很好吃,它很甜”中的“它”指代苹果)。
  2. 并行处理:能同时处理整句话,而非逐词顺序处理,大幅提升了训练和推理速度。

二、调用大模型接口

先从零搭一个 Python 项目,演示从最基础的对话到进阶的 多模态 交互。

1、准备工作

  • Python 环境:建议 3.8 以上版本。
  • API Key:调用大模型需要 Key

我用阿里百炼来演示,它是阿里云的大模型服务平台,内置通义千问全系列模型,新用户有免费额度。

  1. 阿里百炼官网 注册登录。
  2. 开通服务后进入 API-KEY 管理页面
  3. 点击创建新的 API-KEY,把生成的 Key 复制下来。
  • 安装依赖库:我们用 LangChain 这个框架来调用模型。

LangChain 框架:一个用于开发 大模型应用 的开源框架,把大模型、提示词、工具、记忆等组件封装成统一接口,可以像搭积木一样组合出 AI 应用,它的优势如下

  1. 屏蔽底层差异:各模型厂商的 API 各不相同,LangChain 提供统一封装,换模型只需改个配置,不用重写业务代码。
  2. 生态完整:工具调用、RAG、Agent、记忆等组件开箱即用,后续进阶不用重复造轮子。
  3. 社区主流:目前最主流的 LLM 应用框架之一,遇到问题容易找到解决方案。
pip install langchain langchain-openai python-dotenv

2、简单的对话

先来个最简单的:问大模型“毛利率怎么算”。

  • Step 1:创建一个 .env 文件,存放我们的 API Key。这样代码里就不用直接写密钥了,比较安全。
# 阿里百炼 API 配置
API_KEY=sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx
# 阿里百炼 API 地址(OpenAI 兼容接口)
BASE_URL=https://dashscope.aliyuncs.com/compatible-mode/v1
  • Step 2:编写 basic_chat.py 脚本。
from dotenv import load_dotenv
import os
from langchain_openai import ChatOpenAI

# 加载环境变量,从 .env 文件读取配置
load_dotenv()

# 1. 初始化大模型
# 指定模型名称和 API 信息,这里用 qwen3.7-max 模型
llm = ChatOpenAI(
    model="qwen3.7-max",
    api_key=os.getenv("API_KEY"),
    base_url=os.getenv("BASE_URL")
)

# 2. 准备要问的问题
# messages 是一个列表,里面放对话历史。这里只有一轮对话,角色是 user
messages = [
    {
   "role": "user", "content": "毛利率怎么算?"}
]

# 3. 发送请求,获取回答
# invoke 方法会等待模型生成完整的回答
response = llm.invoke(messages)

# 4. 打印结果
# response.content 就是大模型返回的文本
print("大模型回答:", response.content)
  • 运行一下:执行 python basic_chat.py,你就能看到大模型的回答了。

3、让大模型扮演角色

刚才的对话里,大模型是个百科全书,但很多时候,我们希望它能扮演特定角色,比如客服、作家,工程师。这就需要用到系统提示词(System Prompt)。

让我们来让大模型扮演一下“勇哥”,360度转一圈

  • 编写 role_play_chat.py
from dotenv import load_dotenv
import os
from langchain_openai import ChatOpenAI

load_dotenv()

# 初始化大模型
llm = ChatOpenAI(
    model="qwen3.7-max",
    api_key=os.getenv("API_KEY"),
    base_url=os.getenv("BASE_URL")
)

# 1. 定义系统提示词
# 这是角色扮演的关键,用一段话告诉模型它应该是谁、怎么说话
system_prompt = """
你现在扮演抖音"勇哥餐饮创业说"的勇哥。

【说话风格】
- 直接、不留情面,说话干脆犀利、一针见血
- 口头禅:"我滴妈"、"别干了"、"穷人的钱好骗,但不好赚"
- 结论斩钉截铁,不模棱两可

【核心价值观】
- 90%的餐饮项目注定失败,止损比盈利更重要
- 永远先算账,用数据说话
"""

# 2. 构造对话
# 注意:messages 列表的第一条通常是 system,用来设定全局规则
messages = [
    {
   "role": "system", "content": system_prompt},
    {
   "role": "user", "content": "勇哥,我想加盟哪吒仙饮奶茶店,靠谱不?"}
]

# 3. 流式调用,一边生成一边打印
print("勇哥附体:")
for chunk in llm.stream(messages):
    print(chunk.content, end="", flush=True)
  • 运行一下:你会发现大模型的回答风格瞬间变了,可能会蹦出一句:“我滴妈!你加盟奶茶店?之前看过我视频吗?”

4、让大模型识别图片

现在的大模型已经能处理图片了,这叫多模态(Multimodal)能力。我们可以让它看一张图,然后描述内容。

  • 编写 multimodal_chat.py
from dotenv import load_dotenv
import os
from langchain_openai import ChatOpenAI
from langchain_core.messages import HumanMessage

load_dotenv()

# 初始化支持视觉的模型,qwen3.7-max 不支持图片输入,这里用 qwen3.7-plus
llm = ChatOpenAI(
    model="qwen3.7-plus",
    api_key=os.getenv("API_KEY"),
    base_url=os.getenv("BASE_URL")
)

# 1. 构造包含图片的消息
# HumanMessage 可以包含多种内容:文本、图片等
message = HumanMessage([
    {
   "type": "text", "text": "描述一下这张图片"},
    {
   "type": "image_url", "image_url": {
   "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20241022/emyrja/dog_and_girl.jpeg"}}
])

# 2. 流式调用,一边生成一边打印,体验更好
# stream 方法返回一个迭代器
for chunk in llm.stream([message]):
    # flush=True 让内容立即显示,不要等缓冲
    print(chunk.content, end="", flush=True)
  • 运行一下:执行脚本,你就能看到大模型对图片的描述。也可以换成自己的图片 URL 试试。

5、让大模型记住上文

前面几段都是一问一答,模型答完就结束了。但真实对话是连续的,比如你问完毛利率怎么算,紧接着问那净利率呢,模型得知道你在接着上文聊,不然它不知道你在说什么。

大模型本身没有 记忆 ,它的上下文全靠 messages 列表来维持。多轮对话的关键就一步:每次拿到回答后,把它以 assistant 角色追加回 messages,这样下一轮提问时模型就能看到完整的历史。

  • 编写 multi_turn_chat.py
from dotenv import load_dotenv
import os
from langchain_openai import ChatOpenAI

load_dotenv()

llm = ChatOpenAI(
    model="qwen3.7-max",
    api_key=os.getenv("API_KEY"),
    base_url=os.getenv("BASE_URL")
)

# 1. 初始化对话历史
messages = [
    {
   "role": "user", "content": "毛利率怎么算?"}
]

# 2. 第一轮对话(流式输出,同时把回答攒下来)
print("第一轮回答:")
reply = ""
for chunk in llm.stream(messages):
    print(chunk.content, end="", flush=True)
    reply += chunk.content
print()

# 3. 把模型回答追加回 messages,角色是 assistant
# 这步是多轮对话的关键,不塞回去下一轮模型就看不到上文
messages.append({
   "role": "assistant", "content": reply})

# 4. 追问,这个问题依赖上文
messages.append({
   "role": "user", "content": "那净利率呢?和它有什么区别?"})
print("\n第二轮回答:")
for chunk in llm.stream(messages):
    print(chunk.content, end="", flush=True)
  • 运行一下:第一轮模型解释毛利率,第二轮它能直接对比净利率和毛利率的区别,不用你再重复一遍背景。

不过 messages 会越攒越长,迟早撑爆模型的上下文窗口。怎么压缩、怎么取舍,就是后面记忆机制要解决的问题,这里先不展开。

三、总结

今天我们搞定了调用大模型的四件事:

  1. 基础对话:实现了最简单的一问一答。
  2. 角色设定:学会了用 System Prompt 控制模型的人设。
  3. 多模态交互:尝试了让模型处理图片。
  4. 多轮对话:学会了用 messages 列表管理对话历史,让模型接得住上下文。

下一步,我们将进入更核心的环节——Function Calling,让大模型从只会说变成能做。

四、LuckReport 项目推荐

在这里插入图片描述

导航:LuckReport专栏

1、项目简介

Luck-Report 是一款基于开源项目 UReport2 重构的 Java 高性能报表引擎,通过迭代单元格可以实现任意复杂的中国式报表。相较于 UReport2,在技术架构上进行了全新升级,后端基于 SpringBoot 框架开发、前端采用 Vue 框架构建,技术选型贴合当下主流项目开发标准,可精准适配各类实际开发需求。

Luck-Report 提供了全新的基于网页的报表设计器,可以在 Chrome、Firefox、Edge 等各种主流浏览器运行(IE 浏览器除外)。使用 Luck-Report,打开浏览器即可完成各种复杂报表的设计制作。

Luck-Report 基于 Apache-2.0 开源协议 开源

2、在线体验

相关文章
|
5天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1572 112
|
12天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1939 8
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
6天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
|
6天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
526 112
|
18天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
2559 4
|
10天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
720 111
|
20天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2634 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
6天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
7天前
Qoder 一周年 × Qwen3.8-Max 正式上线,多重好礼限时领
8月3日,Qwen3.8-Max 正式上线Qoder,迎来Qoder一周年。新老用户可领800次免费调用,下单再赠2000次;夜间(22:00–08:00)调用5折;邀请好友双方得积分与调用额度。
446 1

热门文章

最新文章