
AI 晚报|9月29日
今天的快讯密度有点高:一边是 AMD 出手把李飞飞的 World Labs 收入囊中,两位 AI 领军者正式联手;另一边是 OpenAI 据称因为新模型"能力过强"而按下了发布暂停键。再加上 Anthropic 递交招股书、英伟达要给每个智能体配"看门狗",这
阅读全文 →最新文章
全部专栏
教程上手 Sonnet 5.5:编码任务按成本分层迁移
这篇能做出什么 先看结果。跟着做完,你会得到一个能跑起来的小工具,它做三件事: 1. 分档:把每天遇到的编码任务分成「琐碎」「常规」「硬骨头」三类,前两类默认交给 Sonnet 档位的模型,第三类才动用 Opus 档位。
教程用 Modal 部署按需伸缩的开源模型推理 API
适用场景 手里有一个开源模型(例如 Llama、Qwen、Mistral 系列),想把它变成 HTTP API 给内部系统或产品调用;流量不稳定,白天高峰、夜里几乎没人用,不想为此长期养一台 GPU 服务器;团队没有 K
教程用 ESP32-S3 集群跑 BitNet 1.58-bit:从模型烧录到多节点推理
把大模型压到 1.58 bit,是端侧推理里绕不开的方向。但大多数讨论停在 GPU 和手机 SoC 上,很少有人真的把它塞进一块几块钱的 MCU。这篇教程带你把这件"看起来不可能"的事拆成可执行的步骤:训练一个小尺寸的三
教程ElevenLabs v4 多语种配音:情绪标签与批量合成
这套流程最终能做出什么 把一份中文脚本,变成多语种的成品音频:中文、英文、西班牙语各一版,同一个音色贯穿全片,句子之间有情绪起伏(兴奋、压低声音、停顿),并且整批文件可以自动拼接成一条完整的节目音频。 具体交付物是这样几
教程把 Cloudflare 交给编码智能体:安装与权限收敛
适用场景 手里有若干域名的 DNS、缓存、WAF 都在 Cloudflare 上,日常改一条解析、刷一次缓存、加一条 WAF 规则都要点控制台,重复且容易点错。这套方案把 Cloudflare 的操作封装成一个命令行工具
教程Shopify 智能体代下单:结账接入与风控报错排查
智能体自助下单,链路比人类点鼠标长得多:它要过应用权限、店铺结账规则、机器人防护、支付风控四道门。任何一道没开,最终看到的报错都长得很像"结账失败"。下面按排查顺序拆开讲。 报错现象 先对照一下,你遇到的是哪一类。 现象
AI 词典嵌入漂移:同一句话,坐标却变了
一句话定义 嵌入漂移(Embedding Drift)指同一段文本,在不同时间、不同模型版本或不同运行环境下,被映射成的向量(embedding)分布发生了变化,导致原本可用的缓存、索引和相似度判断失准。 为什么会漂 嵌
AI 词典WebSocket:一次握手后的双向长连接
一句话定义:WebSocket 是一种网络通信协议,客户端与服务端经过一次 HTTP 握手(handshake)建立连接后,这条连接会持续保持,双方随时可以互相发送数据——也就是全双工(fullduplex)。 它解决了
AI 词典声纹识别:听声辨人是怎么做到的
一句话定义:声纹识别(Speaker Verification)是让机器听一段语音,判断“说话的人是不是他声称的那个人”的技术。它认的不是说了什么,而是谁在说。 原理:每个人都是一把独一无二的琴 发声像演奏一件乐器:声带
AI 词典唤醒词:设备一直在听,但大多时候没在算
一句话定义 唤醒词(Wake Word)是一段预设的短口令。设备听到它,才从"挂机监听"状态切换到"完整语音识别"状态,开始真正听你说话。你喊一声"小爱同学""Hey Siri",灯亮了,它才开始工作——之前它其实一直在
AI 词典意图识别与槽位填充:听懂一句话里的目的和参数
一句话定义:意图识别(Intent Detection)是判断用户这句话「想干什么」,槽位填充(Slot Filling)是把这句话里的关键信息「抽出来填进表格」。 比如用户说:「帮我订一张明天上午从北京去上海的高铁票」
AI 词典对话状态跟踪:让机器记住聊到哪儿了
对话状态跟踪(Dialogue State Tracking,DST)指的是:在多轮对话的每一轮,把"用户到目前为止说了什么、还缺什么"整理成一份结构化记录。 像服务员记菜单一样 想象你在餐厅帮一桌人点单。客人说"来一份
AI 词典显著性图:看清模型到底在盯着哪里
一句话定义 显著性图(Saliency Map)是一张和输入同尺寸的热力图,颜色越"烫"的位置,表示该位置的像素(或文本里的 token)对模型当前这个输出影响越大。 它怎么来的:把"轻推一下"做成图 想象一台看不懂内部
AI 词典视频时序建模:让机器看懂"前后发生了什么
一句话定义:视频时序建模(video temporal modeling)指的是让模型显式地处理帧与帧之间的顺序、运动和因果关系,而不是把每一帧当成互不相干的独立图片。 为什么单帧不够:视频是一串按时间排列的图像。逐帧看
AI 词典Span 掩码与去噪目标:挖掉一整段,逼模型读懂全局
一句话定义 Span 掩码(span masking)是一种自监督预训练目标:把输入文本里连续的一整段内容遮住,让模型根据剩下的上下文把它还原;去噪目标(denoising objective)是更大的一类,泛指“先把输