大模型长文本处理实践:基于分段提取与结果合并生成结构化摘要
本文提出一种高效、稳定的长文本处理方案:通过智能分段(支持句子级切分与上下文重叠)、并行结构化提取(JSON格式事实抽取)、多级去重(精确匹配+语义相似度)、冲突识别与溯源校验,最终生成可追溯、低成本、高可控的摘要。适用于录音转写、会议纪要等场景,显著提升准确性与可解释性。(
Apache Flink 在同程艺龙实时计算平台的研发与应用实践
本文主要介绍 Apache Flink 在同程艺龙的应用实践,从当前同程艺龙实时计算平台现状、建设过程、易用性提升、稳定性优化四方面分享了同城艺龙实时计算平台的建设经验,供大家参考。
CTR_GBDT_LR
基于CTR的GBDT和LR方法融合<br />数据源:直播提供数据<br />数据大小:770 KB<br />字段数量:20<br />使用组件:拆分,读数据表,特征编码<br />
2026企业AI如何真正落地?深度拆解60+全球案例
2026年企业AI应用已告别“大模型万能论”。本文基于斯坦福《企业AI实战手册》及16家头部企业案例,提炼7条落地共性:AI须嵌入核心业务流程;高风险行业坚持“人先于AI”;数据质量决定成效上限;行业分化加剧,通用方案失效;价值重心从个人提效转向组织决策;AI需持续运营而非一次性项目;推荐以8周闭环验证真实场景,本质是经营能力的竞争。
10月17日Spark社区直播【Tablestore Spark Streaming Connector -- 海量结构化数据的实时计算和处理】
本次直播我们邀请了Tablestore存储服务技术专家 朱晓然 ,为大家详细介绍如何基于Tablestore的CDC技术,将大表内实时数据更新对接Spark Streaming来实现数据的实时计算和处理。
test_multiEvaluation
多分类评估<br />数据源:多分类评估<br />数据大小:779 KB<br />字段数量:42<br />使用组件:读数据表<br />
Flink Weekly | 每周社区动态更新-20200429
大家好,本文为 Flink Weekly 的第十四期,由李本超整理,伍翀 Review。本期主要内容包括:近期社区开发进展、邮件问题答疑、Flink 最新社区动态及技术文章推荐等。
人口普查统计案例_3584
这是一个测试 请删掉<br />数据源:<br />数据大小:584 KB<br />字段数量:15<br />使用组件:读数据表,SQL脚本,过滤与映射<br />
Flink 消息聚合处理方案
在本篇文章中我们将详细介绍 Flink 中对消息进行聚合处理的方案,描述不同方案中可能遇到的问题和解决方法,并进行对比。
原来GNN这么好上手,OMG!用它!
GraphLearn(GL)是阿里巴巴开源的一个大规模图神经网络平台,本文将对GL的接口做基本介绍,帮助用户快速上手。项目地址:https://github.com/alibaba/graph-learn 。
心脏病自传数据_07_03
心脏病自传数据预测<br />数据源:<br />数据大小:5.88 KB<br />字段数量:14<br />使用组件:读数据表<br />
深度学习入门01-数学概念介绍
本文首先介绍了向量的概念及其表示方法,随后详细解释了向量间的点乘运算及计算公式。接着通过几个典型角度展示了正弦(sin)值的计算方法,并简要提及了余弦定理。文章进一步探讨了切线斜率的概念,将其定义为曲线上某点y/x的值,并举例说明。导数部分解释了导数作为函数在某点斜率的意义,以及它是如何衡量输入变化引起输出变化的方向与速率的。此外,还讨论了基本初等函数的导数公式。对数(log)和自然对数(ln)的概念被引入,包括它们的定义及计算方式。接着,文章解释了根号表示的意义,即寻找哪个数的平方等于给定数值。
10月17日Spark社区直播【Tablestore Spark Streaming Connector -- 海量结构化数据的实时计算和处理】
本次直播我们邀请了Tablestore存储服务技术专家 朱晓然 ,为大家详细介绍如何基于Tablestore的CDC技术,将大表内实时数据更新对接Spark Streaming来实现数据的实时计算和处理。
【评分卡】0925_信用卡消费分析_215
0925_信用卡消费分析_215<br />数据源:<br />数据大小:1.36 MB<br />字段数量:25<br />使用组件:分箱,样本稳定指数(PSI),评分卡训练,拆分,评分卡预测,读数据表<br />
心脏病预测案例_test_2455
test<br />数据源:<br />数据大小:7.49 KB<br />字段数量:15<br />使用组件:归一化,拆分,过滤式特征选择,SQL脚本,读数据表,类型转换<br />
【推荐算法】商品推荐_2587
asdf<br />数据源:adsf<br />数据大小:328 KB<br />字段数量:4<br />使用组件:过滤与映射,SQL脚本,读数据表,JOIN<br />
Apache Flink 进阶(一):Runtime 核心机制剖析
本文主要介绍 Flink Runtime 的作业执行的核心机制。首先介绍 Flink Runtime 的整体架构以及 Job 的基本执行流程,然后介绍在这个过程,Flink 是怎么进行资源管理、作业调度以及错误恢复的。最后,本文还将简要介绍 Flink Runtime 层当前正在进行的一些工作。
【推荐算法】商品推荐_2587
asdf<br />数据源:asdf<br />数据大小:328 KB<br />字段数量:4<br />使用组件:Filter and Mapping,JOIN,Read ODPS table,SQL Script<br />
如何通过Dataworks禁止MaxCompute 子账号跨Project访问
之前有很多DataWorks用户问MaxCompute访问权限问题,比如子账号为什么可以增删查别人在别的项目创建的表,即使这个子账号并没有加入那个项目 。 今天手把手教大家实现子账号授权并关闭跨Project的数据访问权限。
PyCharm 2025.1 完整教程:下载安装 + 中文设置 + 激活,一步到位,附安装包
PyCharm 2025.1 发布,重磅升级AI代码补全、类型推断与ruff集成,提升开发效率。支持渐进式补全、智能提交信息生成、冲突可视化解决,优化启动速度与内存占用,全面增强云原生及现代Python开发体验。
Spark Codegen浅析
Codegen是Spark Runtime优化性能的关键技术,核心在于动态生成java代码、即时compile和加载,把解释执行转化为编译执行。Spark Codegen分为Expression级别和WholeStage级别,分别针对表达式计算和全Stage计算做代码生成,都取得了数量级的性能提升。本文浅析Spark Codegen技术原理。
Egde卸载教程!edge浏览器卸载工具!EdgeRemover v18.38新版本,单文件便携版!
Edge浏览器虽功能强大,却常因无法彻底卸载让用户体验困扰。本文推荐一款专清工具——Edge Remover,支持一键移除Edge及WebView2运行时,两种模式灵活选择,操作简单,无需专业技能,彻底清理不留残留,释放C盘空间,提升系统纯净度,是Windows用户必备的卸载利器。
12月5日Spark社区直播【是时候改变你数仓的增量同步方案了】
本分享会先介绍传统数据增量同步方案,之后对比新方案(完全基于Spark无需额外组件),介绍新方案如何结合最新的数据湖(delta lake)实现,同时引入spark-binlog,极大的简化了数据增量的门槛和架构。如果时间允许,我们也会简单介绍开源项目spark-binlog,delta-plus等的内部设计是如何支持我们新的数据增量方案的。
Microsoft Activation Scripts v3.6 (MAS)激活工具安装教程!中文汉化版(激活工具)
Microsoft Activation Scripts v3.6(MAS)是一款开源、轻量级的批量激活工具,支持HWID、KMS38、TSforge等多种方式,可离线永久激活Win7至Win11及Office全系列。兼容旧系统如Vista,操作简单,无误报风险。
YOLOv13-pose关键点检测:训练实战手把手教程篇| 自己数据集从labelme标注到生成yolo格式的关键点数据以及训练教程
本专栏详解YOLOv13-pose关键点检测:含自研HyperACE超图增强、FullPAD全链路协同及轻量DSC3k2模块,Pose mAP50达0.893;手把手教学数据标注(LabelMe)、格式转换与训练实战,适配红外、小目标、医疗等多场景,附创新代码与论文写作支持。
Miniconda 安装与环境配置全流程图解(2025 最新版)
Miniconda 可以看作是 Anaconda 的“轻装版”,只自带 conda 包管理器与基础的 Python 运行时。它体积小、部署速度快,特别适合按需创建与管理虚拟环境的用户。与 Anaconda 相比,Miniconda 不会预先安装一大堆科学计算库,你可以根据项目需求再单独选择、安装需要的包,因此整体更轻巧、更灵活。 本文将手把手演示在 Windows 下安装 Miniconda 的全过程:从下载安装器、完成向导配置、设置环境变量,到最后的基础验证与简单示例,帮助你迅速把 Miniconda 用起来。
Multisim14.0中文下载安装步骤教程
Multisim14.0是由美国NI公司开发的EDA工具,适用于电路设计与仿真。本文提供详细中文安装步骤:下载安装包后解压,运行安装程序并设置路径,填写用户信息,选择安装位置,接受协议完成安装。随后安装NILicense激活器及中文语言包,最终实现软件汉化与正常运行。附带网盘下载链接,方便国内用户获取资源。
一文说明白 AI API中转站是什么?
AI API中转站是连接国内开发者与海外大模型(如OpenAI、Claude)的代理平台,破解网络、支付、注册三重壁垒。支持微信/支付宝充值、统一OpenAI格式调用、智能路由与自建号池,以“倍率”计费(官方价×倍率)。适合中小团队降本提效,但需警惕低价掺水、数据安全与服务稳定性。
官宣|Apache Flink 1.17 发布公告
Apache Flink PMC(项目管理委员)已宣布发布 Apache Flink 1.17.0。Apache Flink 是领先的流处理标准,流批统一的数据处理概念在越来越多的公司中得到认可。
1949AI轻量化AI自动化:定时任务浏览器自动化+数据分发代码实战
基于1949AI轻量化理念,本工具以Python实现浏览器自动化采集、本地存储与飞书/邮箱双通道通知,全程无云依赖、低资源占用、安全合规,适配个人开发者及小型团队的轻量工程化需求。(239字)
开发无货源店群自动化工具:聊聊1688商品详情API核心价值
本文详解1688官方商品详情API如何成为无货源店群ERP的核心数据底座:解决爬虫合规与稳定性难题,提供标准化结构化数据;支撑多平台批量铺货、实时库存价格同步、一件代发履约闭环及智能选品分析,显著降低开发运维成本,保障系统长期稳定运行。(239字)
端到端GPU性能优化在深度学习场景下的应用实践
摘要在2017杭州云栖大会机器学习平台PAI专场上阿里巴巴高级算法专家杨军结合具体案例分享了端到端GPU性能优化在深度学习场景下的应用实践。 本文内容根据嘉宾演讲视频以及PPT整理而成。 目前深度学习和GPU已经成为了人工智能的基础一软一硬的结合能够帮助我们实现图像识别、语音识别以及视频的处理那么如何优化深度学习框架与GPU资源也是机器学习平台的一个研究方向。
本地自动化工具 零代码开箱即用 1949AI 适配个人办公单机轻量化运行
本文介绍零代码本地自动化工具的轻量化落地实践,专为个人办公单机场景设计:开箱即用、无需配置、资源占用低、离线运行、安全稳定。支持文件批量重命名、智能归类等高频任务,低配电脑亦流畅执行,零技术基础用户可快速上手。(239字)
告别“垃圾进垃圾出”:打造高质量数据集的完整指南
本文深入解析AI时代“数据比算法更重要”的核心理念,系统阐述高质量数据集的定义、黄金标准(含16条可操作规范)与七步构建法,并提供自动化检查、基线验证及人工评审等实用评估手段,助力开发者高效打造可靠、合规、可持续迭代的优质训练数据。(239字)
盘点 7 款文本转语音工具:从免费朗读到可控情绪合成
参考社区里关于免费文本转语音工具的盘点思路,整理 Edge TTS、TTSMaker、Luvvoice、FlowSpeech、Fish Audio、ChatTTS、EmotiVoice 7 类 TTS 工具的适用场景,并从脚本验证、创作者旁白、情绪控制、开源实验和素材管理角度给出选型建议。
10 万文档 RAG 落地实战:从 Demo 到生产,我踩过的所有坑
本文分享10万级文档RAG系统从Demo到生产的实战经验,剖析检索慢、召回率低、部署复杂三大痛点,涵盖文档切分、Embedding选型、向量库优化、重排序与生成约束等关键步骤,并提供可落地的工程方案与评估方法,助力构建高效、稳定的企业级RAG系统。
流量分配机制解析:抖音中心化与小红书搜索架构的适配逻辑
本文深度拆解抖音与小红书流量机制差异:抖音依赖“瞬时反馈赛马算法”,重前3秒吸引力与完播率;小红书基于“搜索召回模型”,重关键词布局与收藏率。二者对内容的要求几乎相反,需针对性适配——低决策成本产品适配抖音,高决策成本产品深耕小红书。
中小制造工厂数字化瓶颈破局:AI 流程精细化 + 工业自动化一体化落地架构实践
离散制造企业普遍存在产线自动化与管理系统数据割裂、管理颗粒粗放、人工流程成本高的痛点。本文基于产学研落地项目,介绍AI 驱动企业管理流程自动化整套技术架构,结合AI 精细化分析细化管理颗粒度能力,联动现场工业自动化设备,搭建工业自动化与企业管理流程一体化云边协同方案,给出轻量化分步落地路径与真实工厂量化收益数据,面向制造 IT、智能制造架构师提供可复用落地思路。
Origin2024 汉化安装专业解析|企业级部署教程+批量激活解决方案
Origin是一款由OriginLab开发的科学绘图与数据分析软件,支持Windows系统,提供丰富的2D/3D图形模板和强大的数据分析功能,如统计、信号处理、图像处理等。本文详细介绍Origin2024的下载与安装步骤,包括解压文件、运行安装程序、输入序列号、安装路径设置及破解方法,帮助用户快速完成软件安装与激活。
摸鱼必备-80款在线HTML小游戏
本文推荐了80款精彩的HTML5在线小游戏,涵盖益智、冒险、射击、体育等多种类型,适合各年龄段玩家。无需下载安装,随时随地畅玩。地址:[https://game.share888.top/](https://game.share888.top/)
动动嘴就能建模?Blender全流程部署AI建模插件教程 | 零门槛实现AI驱动3D创作
本文为Blender用户详解mcp插件部署全流程:基于MCP协议,实现Cursor等AI客户端与Blender双向通信。无需写代码,一句自然语言即可完成建模、材质、灯光、渲染等3D创作,10分钟极速启用AI生产力。
DataWorks AI助理实践:让AI助理帮你做代码评审
DataWorks AI助理支持按团队代码评审规范自动检查、决策并写回结果。只需提供规范,即可替代人工完成重复性代码审查,支持主动发起评审和定时自动巡检两种模式,大幅提升评审效率与一致性。
2026 GEO优化技术解析:AI搜索引擎内容引用机制与5步落地方法
2026年Q1中国AI搜索月活破2亿,豆包、Kimi等生成式引擎重塑内容分发。传统SEO失效,GEO(生成式引擎优化)成为新关键——聚焦RAG架构下语义理解与可信度评估。本文解析AI引用三机制,提出5步结构化方法:问题标题、前置FAQ、因果链正文、权威引用、知识图谱钩子,助技术团队提升AI可见度。
【下载安装】Adobe XD 免费下载与安装教程
Adobe XD 2025是一款专业的UI/UX设计工具,支持矢量绘图、交互原型制作与响应式布局,兼容PS、AI及Jira、Slack等协作平台。内置动画、语音交互功能,提升设计效率。安装前需关闭杀毒软件,解压后以管理员身份运行安装程序即可。
python爬取m3u8实战!!
本文详细介绍了如何抓取和处理m3u8视频文件,包括从网页源代码中提取m3u8文件地址、下载m3u8文件及其对应的ts片段、处理加密的ts文件以及使用ffmpeg合并视频片段。通过多线程下载和文件路径处理,确保了高效和准确的视频抓取与合并。文中还提供了具体的Python代码示例,帮助读者理解和实现整个过程。
你发了那么多文章,DeepSeek可能连看你一眼都没有
本文深度拆解DeepSeek联网搜索的答案生成机制:它不自建搜索引擎,而是调用Bing API;答案生成含7步——判断联网、需求拆解、语义扩词、Bing检索、精读筛选(重标题具体度/域名信任度/时效性)、交叉验证(仅逻辑可信,非事实核查)、整合输出。揭示GEO优化必须先确保内容被Bing收录,结构化、多源一致、Schema标记等动作才有效。知其所以然,方能精准优化。
2026年GEO(生成引擎优化)技术指南:从原理到实战
2026年,AI搜索成企业信息入口,传统SEO失效。GEO(生成引擎优化)聚焦让AI模型“引用”而非仅“排名”你的内容。本文详解GEO三大支柱:结构化标记(Schema)、语义意图优化、AI可信度工程,并结合实战案例与多模态、实时数据等前沿趋势,助技术决策者抢占AI时代信息分发主动权。(239字)
2026年 最值得关注的 6个 开源 AI 工具
2026年,开源AI已迈入“Agent+Toolchain”时代。本文精选6个真正落地的开源工具:LingtiStudio(AI视频全自动生产)、OpenClaw(系统级自动化Agent)、Ollama(本地LLM基石)、Dify(AI应用开发平台)、Cline(编程Agent)和Gemini CLI(终端AI入口),聚焦自主执行、本地优先、多模型兼容与开发者深度集成四大趋势。(239字)
大数据与机器学习
大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。