龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。

963

清华 Zeva:不更新权重也能越用越聪明,成功率 26%→73%

机器人一直有个老大难问题:换个环境就「失灵」。在实验室里学会的操作,换个场地、换个工具,往往要重新采集数据、重新训练。9 月 1 日,清华 AIR(智能产业研究院)联手域变换发布了一个名为 Zeva 的模型,给出了一条完全不同的路:模型权重不用更新,机器人也能从自己的交互经验里持续学习,越用越聪明。 Zeva 是什么:首个实现 ICCL 的具身世界模型 Zeva 的定位是首个实现 In-Conte…

用开源 Agent 跑内容流水线?Easel 副业实操全链路

做内容副业的人,几乎都卡在同一个问题上:时间。找选题两小时、写内容三小时、排版发布一小时——一天就没了,产出却只有一篇。浙大实验室开源的社媒 AI Agent Easel(GitHub 99 星),把「发现趋势 → 创作内容 → 发布」整条链路打包成一个 Agent,正好切中这个痛点。这篇不聊工具参数,聊实操:副业党怎么用它搭一条内容流水线。 先理解:副业的瓶颈从来不是内容,是流程 内容副业的本质…

ChatGPT Ads 不到 200 天年化破 10 亿美元:40+ 国家开放

8 月 31 日,OpenAI 官方公布了一个对广告圈、跨境电商和内容创作者都算得上重磅的数字:ChatGPT Ads 上线不到 200 天,年化收入运行率已经突破 10 亿美元。这不仅是 OpenAI 商业化的重要里程碑,更是「AI 对话场景广告」这个新赛道跑通的信号——对想做副业、做投手、做代理的人来说,值得认真拆一拆。 先看硬数据:10 亿美元年化是怎么来的 根据 OpenAI 官方公告,几…

DeepSeek Vision 拆解:视觉编码器+Aligner 塞进 305B MoE

8 月 31 日 DeepSeek 开源了 V4 家族首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,新闻已经刷屏。但大部分报道只讲了「305B 参数、逼近 Opus 4.8」这些结论,很少有人拆开讲:这双「眼睛」在架构上到底怎么装进语言模型的?为什么它不给人类看图、专给 Agent 用?想本地跑起来,到底要什么配置?这篇从技术角度完整拆一遍。 架构:视觉编码器 + Al…

从选题到发布全自动:Easel 开源社媒 Agent 新基建

做自媒体的人都知道,内容生产的完整链路是:找选题 → 写内容 → 发布。过去这三步每一步都要人工参与,尤其「找选题」最烧时间。8 月 28 日,浙江大学实验室(ZJU-REAL)在 GitHub 上开源了一个叫 Easel 的项目,瞄准的正是这条链路——发现趋势、创作内容、发布,一个 AI Agent 一条龙跑完。 Easel 是什么:给社媒运营配的「全自动内容 Agent」 Easel 的官方描…

useagent 开源 AI 同事:每个 Agent 自带云电脑,团队可自建

过去一年,AI Agent 从「聊天机器人」进化成了「能干活的工作流」:写代码、查资料、填表格。但你有没有想过,Agent 能不能不只是「工具」,而是变成团队里的一名「同事」——有自己的电脑、能并行跑任务、能和别的 Agent 协作?8 月 29 日刚创建的开源项目 useagent,做的就是这件事,短短几天已收获 262 星。 useagent 是什么:给每个 Agent 配一台云电脑 usea…

GitHub 7 天破千星的 sepia:93.2% 识别 AI 味,改词没用

用 AI 写稿早已不是新鲜事,但几乎所有用 AI 写过东西的人,都遇到过同一个尴尬:写出来的文字「一眼假」。改改同义词、调调句式,好像也没什么用。这个困扰,本周被一个 GitHub 项目给出了科学答案——sepia,一个 8 月 28 日创建、7 天涨到 1295 星的开源「去 AI 味」写作技能。 它不是玄学,是建立在 6 万篇故事研究上的 sepia 与市面上「去 AI 化」工具最大的不同,是…

Runway 发布首个界面世界模型:不用写代码,界面边用边生成

现在的网页和 App,基本都遵循同一套逻辑:设计师画出界面,工程师把它翻译成代码,用户再按照开发者预先设计好的按钮、菜单和流程操作。8 月 31 日,Runway 公布了一个大胆的方向:如果界面不再由固定代码提前写死,而是由 AI 根据你的动作实时生成,会发生什么? 这个名为 Solaris 的系统,被 Runway 称为 Interface World Model,也就是「界面世界模型」。它不是…

DeepSeek 开源首个多模态模型:305B 免费商用,读屏能力逼近 Opus 4.8

过去我们聊多模态模型,第一反应都是「AI 看图说话」——你发一张照片,它给你描述一段话。但 8 月 31 日 DeepSeek 在 Hugging Face 开源的 V4 家族首款多模态模型 DeepSeek-V4-Flash-Vision-Exp,方向完全不一样:这双「眼睛」不是给人看图,而是专供 AI Agent 看屏幕干活。 305B 参数的「眼睛」,MIT 许可直接免费商用 先说硬指标。D…

测试工程师的 AI 进阶指南开源了:AI 辅助测试、自动化测试、Agent 测试开发全路线,GitHub 免费学

AI 编程正在重塑每一个技术岗位,而「测试」可能是其中最容易被波及、也最有机会借势转型的一个。最近 GitHub 上一个中文开源项目火了——「AI 测试开发学习路线大全」,把测试工程师在 AI 时代的进阶路径整理成了一份持续更新的路线图,涵盖 AI 辅助测试、自动化测试、Agent 测试开发等方向,对想转型的测试工程师和零基础学习者都很友好。 这份开源路线图里有什么 这个仓库(GitHub 上搜索…

Grok Bot 更新:接 Stripe Link 全网自动下单,每笔付款生成一次性虚拟卡、真实卡号对 AI 隐形,美区桌面端已全量上线

AI 会替你买东西了。8 月 29 日,Grok Bot 官方更新:接入 Stripe Link 钱包后,它可以在全网自动比价、加购并完成结账,你只需要在最后审批一下账单。同日,它还上线了 X 平台插件,能搜索帖子、读取时间线、查看提及。这是「AI Agent 接管真实交易」第一次以这么完整的产品形态落地。 它能做什么:从「帮你找」到「替你买」 过去 AI 购物助手最多做到「帮你比价、给你链接」,…

英伟达拟 129 亿美元收购 Hugging Face:全球最大开源模型平台(托管 270 万+ 模型)要被「卖铲子的」收编?

多家媒体 8 月 30 日报道,英伟达已同意以约 129 亿美元收购全球最大的开源 AI 模型平台 Hugging Face。目前这一消息仍属「据公开报道」层面,未经英伟达或 Hugging Face 官方证实。但如果成真,这将是 AI 产业格局里一枚分量极重的棋子:一家「卖铲子」的芯片公司,要买下全球开发者分发模型的那座「仓库」。 129 亿美元买的是什么 Hugging Face 是今天开源 …

MiniMax H3 Max 上线:5 秒视频不到 3 秒生成,AI 视频「比播放还快」,24 小时 AI 电视台已开播

8 月 31 日,MiniMax 宣布 H3 Max 768P、H3 Max 480P 正式接入 MiniMax 开放平台和 MiniMax Design。这款由 fal 基于 MiniMax H3 开源权重做后训练和推理优化的模型,把一段 5 秒、768p 的完整音视频生成时间压到了不到 3 秒——生成速度第一次跨过了播放速度。与此同时,海外开发者已经用它搭出了 Twitch 实时直播和 24 …

零基础语音工作流入门:用 Gemini 3.5 Transcribe 把会议、采访、周报变成文字,10 分钟就能上手

如果你从没用过语音转文字,这篇是给你写的。不需要懂 API,不需要装软件,读完你就能把「说话」接进自己的日常工作流。 我们从一件最烦的事说起:会议纪要。 一、先搞清楚它能替你做什么 语音转文字工具的定位很明确:它负责把声音变成文字,不负责替你思考内容。所以正确的用法不是「录完扔进去就完事」,而是把它当成流程里的第一道工序。 以 Google 8 月 26 日发布的 Gemini 3.5 Trans…

大模型不靠蛮力:拆解混元 Hy4 的 MoE 稀疏激活 + 1M 上下文,看懂参数背后的成本与算力账

先抛一个反直觉的事实:腾讯混元 8 月 28 日发布的 Hy4 preview,总参数 770B,每次推理只激活 49B,上下文 1M,API 输入定价 6 元每百万 token。 大,通常意味着贵。但这次是又大又便宜。中间的矛盾,靠一个叫 MoE 的架构给抹平了。 这篇不讲公式,只把三件事讲明白:MoE 稀疏激活到底省了什么、1M 上下文意味着什么、以及这次发布里真正值钱的那条信息是什么。 一、…

Claude 能自己操作浏览器了:不会写代码也能接「网页自动化」私单,批量填表、抓数据、抢券全包

「我不会写代码,能不能接自动化的活?」 过去这个问题的答案很尴尬:能,但你得先学 n8n、学影刀、学一堆节点配置,学习曲线比想象中陡。8 月 26 日 Claude in Chrome 全面上线之后,答案变了一点——你把活儿说清楚,让 AI 自己在浏览器里点。 这篇不聊技术原理,只聊一件事:这个能力能变成什么服务,怎么接第一单,以及有哪些坑必须提前知道。 一、Claude in Chrome 现在…

打工人效率神器实测:Gemini 3.5 Transcribe 自动去「嗯啊」、自动格式化,会议纪要字幕采访稿一键出

一场两小时的会议开完,最痛苦的不是开会本身,是整理纪要。 录音听一遍要两小时,边听边打字要四小时,中间还得反复倒回去听清某句话。采访、播客、课程、客户沟通——凡是涉及「把说的话变成文字」的场景,都在吃这份苦。 8 月 26 日,Google DeepMind 发布了 Gemini 3.5 Transcribe,官方称它是目前最精准的语音转文本模型。我们来看看它到底强在哪,以及普通人能怎么用。 一、…

Gemini Omni 1.1 Flash 发布:AI 视频能续写到 40 秒,360p 草稿便宜 2/3,过稿再上 4K

做 AI 视频的人,大概都经历过同一种无力感:抽了二十次,终于出来一条满意的镜头,但你没法让它「接着往下演」。 想让镜头再往后走两秒?只能重新生成,而新生成的画面里,人物的脸、衣服的颜色、光线的方向全都变了。AI 视频过去最大的问题不是画质,是不可控——你只能抽,不能改;只能重来,不能接续。 8 月 27 日,Google 发布的 Gemini Omni 1.1 Flash,就是冲着「可控」这两个…

Midjourney 首个编辑模型 V8.2 全员开测:一句话改图、4 张图合成、局部重绘扩画,不用再重画

用 AI 生图最崩溃的时刻,不是生成得丑,而是「就差一点点」。 背景对了、人物对了,就是衣服颜色不对;构图很好,就是画面太窄撑不满海报;想要的效果只差换个道具,结果只能重抽十几次,抽到一张更差的。 8 月 27 日,Midjourney 把这个问题正式摆上台面——首个 V8.2 图像编辑模型开始向所有用户开放测试。AI 绘画从「只能生成」进入「能改了」的阶段。 一、这次开放的是什么 Midjour…

腾讯混元发布并开源 Hy4 preview:770B 总参 / 49B 激活 / 1M 上下文,输入只要 6 元,WorkBuddy 免费 2 周

先问一个问题:你觉得现在用一次「旗舰级」大模型,要花多少钱? 很多人的印象还停留在「能力越强越贵」。但 8 月 28 日腾讯混元发布的 Hy4 preview,把这个印象按在地上摩擦了一遍——770B 总参数、1M 上下文的旗舰模型,开源免费拿走,API 输入只要 6 元每百万 token,还有产品端限时 2 周免费。 这不是一个小版本更新,而是国产大模型第一次把「旗舰能力」和「白菜价格」同时摆到…

大模型降价,副业党受益:API 成本降 33% 意味着什么

标题里说”API 成本降 33%”,这个数字是准的——它特指这一轮最猛的一刀:OpenAI 把旗舰 GPT-5.6 Sol 的输出 token 从 30 美元砍到 20 美元,降幅正好 33%(输入降 20%),多家媒体 8 月 22 日已坐实。全行业不是都降 33%,而是 20%–33% 不等。对靠 API 吃饭的副业党来说,结论不变:用 AI 的成本,正在肉眼可见地变便…

用 AI 精读大型开源仓库:四阶段方法论 + 28 条踩坑清单

你有没有过这种经历:老板甩来一句”研究下这个开源项目,下周汇报”,你兴冲冲 git clone 下来,打开目录,几百个文件、十几个包,瞬间懵了。从头读 main 函数?读了三天还在 import 里打转。这是绝大多数人精读大型仓库的死法——不是不努力,是方法错了。本文给你一套用 AI 四阶段精读大型开源仓库的方法论,再附上我们整理的「28 条踩坑清单」。 为什么传统读法必然…

刚刚!小米玄戒 O100 发布,手机本地跑大模型再提速

手机本地跑大模型这事儿,过去总卡在一个字上:慢。参数一大,云端来回传、显存带宽不够,体验就垮了。8 月 24 日,小米一口气发了三颗自研玄戒芯片,其中专门盯住”端侧大模型加速”的那颗——玄戒 O100——就是冲着这个瓶颈去的(来源:新华网客户端 xinhuanet.com,2026-08-25;21世纪经济报道,2026-08-25)。 玄戒 O100 到底是什么 玄戒 O…

打工人新装备:TabTin 让你和一群 AI Agent 一起干活

你有没有这种感觉:一天的工作被切碎在十几个工具里。写代码用一个窗口,整理数据用一个表格,做对外文档又开一个,剪视频再开一个。更累的是,每个工具里的 AI 都得重新认识你——你是谁、你要干嘛、之前的上下文是什么。于是”全栈”成了常态,可工具链还停留在石器时代。这正是 TabTin 想解决的事。 一句话说清:它到底是个啥 TabTin 是一个开源的人与 AI Agent 协作平…