Lux's Blog

Lux's Blog

Agent State and Model APIs
发表于2026-08-23|LLM Notes概念笔记
Agent State and Model APIs一句话解释每次模型推理请求可以是无状态原子调用,但 Agent 通过显式重建或引用外部状态、对话历史、工具轨迹、推理项和压缩项,实现跨推理请求的状态连续性。 四层区分 层次 是否天然跨轮 核心对象 主要影响 Model inference 否 Transformer forward pass...
GGUF
发表于2026-08-23|LLM Notes概念笔记
GGUF一句话解释GGUF 是 llama.cpp 生态的单文件模型容器格式:把权重(可能已按 Q/K/I 方案量化)、tokenizer、metadata 和计算图描述打包成一个可分发文件。 它解决什么问题 单文件分发:不需要多个 shard/config 文件即可加载。 元数据内嵌:架构信息、tokenizer、量化参...
llama.cpp
发表于2026-08-23|LLM Notes工具笔记
llama.cpp一句话定位llama.cpp 是以 CPU/Mac/边缘设备为一等公民的 LLM 推理引擎,也是 GGUF 量化生态的核心运行时。 它主要负责什么 加载和执行 GGUF 模型文件。 提供 Q/K/I 系列量化格式的 kernel 和反量化路径。 支持 GPU offload(Metal/...
Ollama
发表于2026-08-23|LLM Notes工具笔记
Ollama一句话定位Ollama 是面向个人本地环境的模型管理平台:下载、存储、版本管理和 API 服务 GGUF 模型,底层推理通常由 llama.cpp 承担。 它主要负责什么 模型 pull/push/list/delete 等生命周期管理。 统一本地 REST API(OpenAI 兼容接口)。 封装 llama...
飞书一拆为二后,新 BAT 为什么都在猛攻办公?
发表于2026-08-06|产品文档
一家已经跨过商业化门槛、据报道仍在增长的产品,被字节一拆为二。 2026 年 7 月 30 日,字节调整豆包、飞书和火山引擎:飞书产品团队与豆包产品团队整合;飞书的 GTM 团队,也就是市场、销售和客户服务,则与火山引擎整合,负责 MaaS、SaaS 等云服务的商业化。——产品归豆包,商业化归火山引擎。 飞书 CEO 谢欣曾披露,飞书 2023 年 A...
从 Hidden Decoding 看微信为什么需要自己的大模型
发表于2026-07-29|产品文档
最近看到WeChat AI Team发的一篇文章:Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models,并发现了他们团队的博客:https://welm.weixin.qq.com,微信团队不止在做垂类的应用,而是真的花精力去做了ai基建。腾讯刚刚进...
技术与判断
发表于2026-07-24|技术笔记
偶然浏览各家大厂的岗位列表时,我看到一个实习岗位: 投资分析(技术方向) 这是一个连接投资决策与市场动态的关键角色。在这里,你将运用自己的洞察力和判断力,提供客观且精准的投资建议。 岗位描述 主导以科技领域为主的行业及经济研究工作; 参与并助力项目搜寻、评估、尽职调查及交易执行全流程; 参与并助力交易完成后的标的公司研究工作; 完善并维护团队的知识...
Agent Evaluation
发表于2026-07-13|LLM Notes概念笔记
Agent Evaluation核心指标 task success rate tool selection / argument correctness step efficiency 与不必要调用数 latency、token、工具费用 recovery rate、timeout 和 failure taxonomy safety、权限和数...
Agent Loop
发表于2026-07-13|LLM Notes概念笔记
Agent Loop12345goal and state→ model decides next action→ tool or environment executes→ observation enters state→ model continues, stops or asks for help 状态不是 messages[] 的同义词。跨...
AI Infra Seven Layer Stack
发表于2026-07-13|LLM Notes概念笔记
AI Infra Seven-Layer Stack七层地图12345677. LLM Applications & Agents6. Training paradigms & model lifecycle5. Serving & LLMOps4. Training & inference engines3. Dist...
12…8
avatar
Lux
笔记
文章
75
标签
103
分类
9
GitHub
分类
  • LLM Notes72
    • 主题地图10
    • 工具笔记10
    • 概念笔记43
    • 知识库总览4
    • 问题笔记4
    • 项目笔记1
  • 产品文档2
  • 技术笔记1
标签
MQA Low-Rank Adaptation Iteration-level Scheduling hx_llm infra, inference, training, serving PD 分离之后 KV Cache 怎么传输 AI Infrastructure rag, agent, application AI办公 vLLM 推理引擎 奖励模型 Proximal Policy Optimization PD Disaggregation LLM 面试准备 Training Parameter-Efficient Fine-Tuning, 参数高效微调 inference, serving, infra 商业分析 推测解码 推理引擎选型, vLLM SGLang TensorRT-LLM LMDeploy 选型 agent, training 键值缓存 解码阶段 training, transformer training 连续批处理 AI Infra 七层技术栈 分页注意力 RAG 端到端优化地图 推理强化学习, Reasoning Reinforcement Learning inference 未解决问题 大模型训练生命周期 多头注意力 AI 系统性能瓶颈 training, agent Agents infra, inference, training Quantized LoRA 飞书
© 2025 - 2026 By Lux框架 Hexo 8.1.2|主题 Butterfly 5.6.1