# creative **Repository Path**: code-me/creative ## Basic Information - **Project Name**: creative - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-08-31 - **Last Updated**: 2026-08-31 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 用大模型做应用、做创作 —— 系统学习指南 > 面向熟练程序员的中文实战指南。先讲思维模型,再讲工具与用法。 > 工具信息截至 **2026 年 8 月**,会过时;方法论不会。 --- ## 这套指南解决什么问题 「如何用大模型做应用、做创作」其实是两个互补的问题: 1. **创作**:把大模型当作协作者,产出文本、图像、音频、视频等内容 —— 核心是**提示词与工作流**。 2. **应用**:把大模型当作一种新的软件组件(一个"不确定性引擎"),构建 Chatbot、Agent、知识库等产品 —— 核心是**工程化**。 四个方向对应五篇文档,每篇独立可读,建议按顺序通读一遍,再按需跳读: | 文档 | 内容 | 适合什么时候读 | |---|---|---| | [01-文本创作.md](01-文本创作.md) | 提示词工程、迭代创作工作流、小说/文案/剧本场景技巧 | 想用 AI 写点什么的时候 | | [02-图像音视频创作.md](02-图像音视频创作.md) | 文生图、视频生成、音乐与配音、短视频流水线 | 想产出视觉/听觉内容的时候 | | [03-LLM应用开发.md](03-LLM应用开发.md) | API、结构化输出、Function Calling、RAG、Agent、MCP、评估与成本 | 想动手写代码接入大模型的时候 | | [04-AI辅助编程做应用.md](04-AI辅助编程做应用.md) | AI 编程工具、vibe coding 方法论、从想法到上线 | 想让 AI 帮你把想法变成应用的时候 | | [05-学习路径与资源.md](05-学习路径与资源.md) | 30 天学习路径、实战项目清单、资源汇总 | 随时,用来规划进度 | --- ## 一、大模型能力全景 把当前大模型能做的事按「输出模态」和「自主性」两个维度铺开: ``` 输出模态 文本 图像 音频/视频 代码 自主 ┌─────────────────────────────────────────┐ 性低 │ 对话写作 文生图 TTS 配音 补全 │ │ 摘要翻译 图生图 音乐生成 重构 │ ├─────────────────────────────────────────┤ 自主 │ 长文创作 视频流水线 数字人 全栈 │ 性高 │ (Agent (分镜→生成 (脚本→合成) 应用 │ (工具) │ 编排) →剪辑) 生成 │ └─────────────────────────────────────────┘ ``` - **左上角**:一次对话就能完成,今天就能上手(01、02 篇)。 - **右下角**:需要把模型、工具、流程编排起来,是"应用"的领域(03、04 篇)。 - **趋势**:模型的原生多模态能力和 Agent 自主性都在快速上移 —— 2026 年的趋势是"给模型工具,让它自己编排",而不是人肉串 pipeline。 ## 二、核心概念速览 只需要理解这几个概念,就能读懂 90% 的相关讨论: | 概念 | 一句话解释 | 为什么要懂 | |---|---|---| | **Token** | 模型处理文本的最小单位,1 个汉字 ≈ 1~2 token,1 个英文单词 ≈ 1.3 token | 计费、上下文限制都按 token 算 | | **上下文窗口** | 模型一次能"看到"的全部内容长度,当前主流为 128K~1M+ token | 决定你能塞多少资料、多长的对话 | | **System Prompt** | 设定模型角色、规则、输出格式的"幕后指令" | 控制行为的最高优先级手段 | | **Temperature** | 随机度旋钮:低 = 稳定精确,高 = 多样有创意 | 写代码调低,做创意调高 | | **Few-shot** | 在提示词里给几个输入→输出示例 | 比任何描述都更能对齐格式和风格 | | **推理模型 (Thinking)** | 先产出一段内部思考再作答的模型,擅长复杂推理/规划 | 难题用推理模型,简单任务用普通模型省钱 | | **多模态** | 同一模型能同时理解/生成文本、图像、音频 | 看图说话、截图改 UI 都依赖它 | | **Embedding** | 把文本变成向量,语义相近则距离相近 | 搜索、推荐、RAG 的地基 | | **RAG** | 检索增强生成:先查资料,再让模型基于资料作答 | 让模型回答私有/最新知识的标准方案 | | **Function Calling** | 模型输出"我要调用某工具+参数",由你的代码执行后回填结果 | 一切 Agent 和插件的基础 | | **Agent** | 让模型在循环中自主决策:思考→调工具→看结果→再思考 | 2026 年应用开发的中心范式 | | **MCP** | Model Context Protocol,模型连接外部工具/数据的标准协议 | 工具生态的 USB-C,企业采用已成主流 | | **微调 (Fine-tune)** | 用自己的数据继续训练模型,改变其默认行为 | 90% 的场景用不到,先想 RAG 和提示词 | ## 三、模型选型(截至 2026-08) ### 当前格局一览 **闭源前沿**(能力最强,按 API 调用): | 厂商 | 当前主力 | 特长 | |---|---|---| | OpenAI | GPT-5.6(Sol / Luna 两个档位) | 综合能力标杆,长任务 | | Anthropic | Claude 5 家族(Fable 5 旗舰 / Opus 5) | 长文写作、编程、Agent 任务 | | Google | Gemini 3.5 / 3.6 Flash | 超长上下文、原生多模态 | | xAI | Grok 4.x | 实时信息、风格化输出 | **开源权重 / 国产**(可自部署,性价比高): | 模型 | 特点 | |---|---| | GLM-5.3 系列(GLM-5.3 / 5.3G / 5.3-Flash) | 智谱旗舰线,Agent 与编程能力强,有免费档 Flash | | DeepSeek V4(含 Pro / Flash) | 万亿参数、推理强、价格低 | | Qwen 3 系列 | 阿里通义,尺寸齐全,中文生态好 | | Llama 4 系列 | Meta,英文生态最大 | > ⚠️ 型号迭代极快(GLM 从 5 到 5.3 只用了几个月)。**选型时看"当前哪个在榜上",而不是记型号**。榜单可看 [LMArena](https://lmarena.ai)、[llm-stats.com](https://llm-stats.com) 等。 ### 怎么选:按任务选,不按品牌选 | 你的任务 | 选什么 | 理由 | |---|---|---| | 日常对话、问答、翻译 | 中档模型或各家 Flash 档(GLM-5.3-Flash、Gemini Flash、DeepSeek V4 Flash) | 便宜 + 快,质量足够 | | 长文创作、剧本、小说 | Claude / GPT 旗舰,或 GLM-5.3 | 文风与长程一致性好 | | 编程 | Claude / GPT 旗舰,或 GLM-5.3 | SWE-bench 类基准领先 | | 复杂推理、数学、规划 | 推理模型(各家 thinking / pro 档) | 慢而准 | | 看图、截图、音视频理解 | 原生多模态模型(Gemini / GPT / GLM) | 别用 OCR 中转 | | 海量批处理、分类抽取 | 最便宜的 Flash 档 + 批处理接口 | 成本可差 10~50 倍 | | 数据不能出内网 | 开源权重自部署(GLM / DeepSeek / Qwen + vLLM) | 见 03 篇部署节 | ### 成本的直觉 - 同一任务,旗舰模型和 Flash 档的价差可达 **10~50 倍**;先拿 Flash 档试,不够好再升级,比反过来省钱得多。 - 典型个人用量下,API 花费通常只有几美元/月 —— **不要让对成本的焦虑阻碍动手**。 - 订阅制(ChatGPT Plus / Claude Pro / GLM Coding Plan 等)适合高频交互;API 适合程序化调用。 ## 四、贯穿全套指南的五个心法 1. **你是导演,不是打字员。** 模型提供速度和广度,你提供品味、判断和最终责任。产出质量的上限由你提的需求质量决定。 2. **迭代胜过完美提示词。** 没有一次到位的提示词;正确姿势是:快速生成 → 具体反馈 → 再生成。把"改"当成创作流程的主体。 3. **把不确定性当工程问题。** 模型输出是概率性的,所以应用开发的核心变成了:约束输出格式、给工具和资料、建评估集、做回归测试(03 篇)。 4. **先问"要不要",再问"怎么做"。** 并非所有环节都该上大模型:规则能解决的不用模型,小模型能解决的不用旗舰,检索能解决的不用微调。 5. **保持手感,保持时效。** 这个领域按月迭代。每两周亲手试一个新的模型或工具,比读十篇综述有用(跟进渠道见 05 篇)。 --- *编写于 2026-08;模型与工具信息基于当月公开资料核实,引用来源见各篇文末。*