Agent State and Model APIs
Agent State and Model APIs一句话解释每次模型推理请求可以是无状态原子调用,但 Agent 通过显式重建或引用外部状态、对话历史、工具轨迹、推理项和压缩项,实现跨推理请求的状态连续性。 四层区分 层次 是否天然跨轮 核心对象 主要影响 Model inference 否 Transformer forward pass...
GGUF
GGUF一句话解释GGUF 是 llama.cpp 生态的单文件模型容器格式:把权重(可能已按 Q/K/I 方案量化)、tokenizer、metadata 和计算图描述打包成一个可分发文件。 它解决什么问题 单文件分发:不需要多个 shard/config 文件即可加载。 元数据内嵌:架构信息、tokenizer、量化参...
llama.cpp
llama.cpp一句话定位llama.cpp 是以 CPU/Mac/边缘设备为一等公民的 LLM 推理引擎,也是 GGUF 量化生态的核心运行时。 它主要负责什么 加载和执行 GGUF 模型文件。 提供 Q/K/I 系列量化格式的 kernel 和反量化路径。 支持 GPU offload(Metal/...
Ollama
Ollama一句话定位Ollama 是面向个人本地环境的模型管理平台:下载、存储、版本管理和 API 服务 GGUF 模型,底层推理通常由 llama.cpp 承担。 它主要负责什么 模型 pull/push/list/delete 等生命周期管理。 统一本地 REST API(OpenAI 兼容接口)。 封装 llama...
飞书一拆为二后,新 BAT 为什么都在猛攻办公?
一家已经跨过商业化门槛、据报道仍在增长的产品,被字节一拆为二。 2026 年 7 月 30 日,字节调整豆包、飞书和火山引擎:飞书产品团队与豆包产品团队整合;飞书的 GTM 团队,也就是市场、销售和客户服务,则与火山引擎整合,负责 MaaS、SaaS 等云服务的商业化。——产品归豆包,商业化归火山引擎。 飞书 CEO 谢欣曾披露,飞书 2023 年 A...
从 Hidden Decoding 看微信为什么需要自己的大模型
最近看到WeChat AI Team发的一篇文章:Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models,并发现了他们团队的博客:https://welm.weixin.qq.com,微信团队不止在做垂类的应用,而是真的花精力去做了ai基建。腾讯刚刚进...
技术与判断
偶然浏览各家大厂的岗位列表时,我看到一个实习岗位: 投资分析(技术方向) 这是一个连接投资决策与市场动态的关键角色。在这里,你将运用自己的洞察力和判断力,提供客观且精准的投资建议。 岗位描述 主导以科技领域为主的行业及经济研究工作; 参与并助力项目搜寻、评估、尽职调查及交易执行全流程; 参与并助力交易完成后的标的公司研究工作; 完善并维护团队的知识...
Agent Evaluation
Agent Evaluation核心指标 task success rate tool selection / argument correctness step efficiency 与不必要调用数 latency、token、工具费用 recovery rate、timeout 和 failure taxonomy safety、权限和数...
Agent Loop
Agent Loop12345goal and state→ model decides next action→ tool or environment executes→ observation enters state→ model continues, stops or asks for help 状态不是 messages[] 的同义词。跨...
AI Infra Seven Layer Stack
AI Infra Seven-Layer Stack七层地图12345677. LLM Applications & Agents6. Training paradigms & model lifecycle5. Serving & LLMOps4. Training & inference engines3. Dist...