代表工作
本页按两个相互关联的视角组织。研究主题覆盖可信 AI、AI 安全、AI 在安全中的应用、AI 助手质量、多媒体安全、隐私保护计算和系统方向,并在相关主题下列出论文、专利和产品影响。产品团队主题覆盖在微软产品组织中的直接工作。完整记录见 论文和专利页面。
研究主题
按主要学术和技术方向整理的代表性研究主题。
可信 AI 与 AI 安全
该主题覆盖现代 AI 系统的安全性、鲁棒性和完整性:后门检测与净化、对抗鲁棒性、模型篡改检测与知识产权保护、LLM jailbreak 和提示注入风险,以及 agentic 系统投毒。
- 后门检测、净化与鲁棒学习研究隐藏后门如何进入模型、如何判断模型是否被攻陷,以及如何在保留有用能力的同时移除投毒行为;同时包括对抗迁移攻击和防御。相关论文:PVDI (IEEE TIFS 2026);ABDP (IEEE TIFS 2026);Consensus-Robust Transfer Attacks (NeurIPS 2025);DorPatch (NDSS 2024)。
- LLM 与 agent 安全研究 LLM 和 agentic 系统在恶意指令、间接提示注入、投毒或特定模态攻击下的失效方式,并结合攻击分析与防御评测。相关论文:Indirect Prompt Injection (KDD 2025);SoK: LLM Jailbreak Robustness (IEEE S&P 2026);Sirens' Whisper (USENIX Security 2026);Quantifying LLM Attacks (USENIX Security 2026);Fact2Fiction (AAAI 2026)。
- 模型篡改检测与知识产权保护在访问受限的情况下判断模型是否被复制、修改或篡改,并为部署中的 AI 服务提供黑盒和 hard-label 验证方法。相关论文:ESF (ACL Findings 2025);RESF (EMNLP 2025);SDBF (CVPR 2025);Intersecting-Boundary-Sensitive Fingerprinting (ICML 2024);Backdoor Watermark for LLM Copyright (ACL 2023)。
AI 在安全中的应用
该主题将 AI 和机器学习用于实际安全问题:钓鱼和欺诈检测、恶意 URL 和恶意脚本检测、账号攻陷检测、勒索攻击防御、滥用防护,以及面向安全运营的可解释信号。
- BehaviorGuard 与人工操作勒索攻击防御使用多分辨率用户行为建模检测人工操作勒索攻击中的账号攻陷,目标是在企业约束下尽早捕获横向移动。专利:Detecting and Mitigating Ransomware Attacks。产品影响:微软 Defender for Endpoint 中的 BehaviorGuard 用于检测人工操作勒索攻击中的受害账号。
- 基于 AI 的恶意 PowerShell 脚本和恶意 URL 检测检测恶意 URL 和恶意 PowerShell 脚本,并通过强规避攻击发现检测器弱点,再针对真实对抗变化进行加固。论文:Detecting Malicious Web Links and Identifying Their Attack Types (USENIX WebApps 2011)。专利:Malicious Uniform Resource Locator Detection。产品影响:微软 Defender for Endpoint 中的恶意 PowerShell 加固。
- 钓鱼、欺诈与账号滥用检测结合网页分类、logo 检测、不变内容特征、账号信息和用户行为信号降低钓鱼与欺诈风险,并在强隐私和可部署性约束下设计系统。论文/专利:Protect Sensitive Sites from Phishing Attacks (ICC 2013);Detecting Malicious Web Links and Identifying Their Attack Types (USENIX WebApps 2011);ML-based account classification;malicious URL detection;detection and categorization of malicious URLs。产品影响:Office 365、微软 Forms 和账号保护系统。
AI 助手、搜索与优化
该主题覆盖 AI 助手和搜索系统质量:提示词优化、多轮 agent 评估、模型选择、深度搜索、文档理解、搜索支撑推理和多向量检索。
- 自动提示词优化将提示词视为可以系统搜索、评估和改进的对象,而不是单纯依赖手工调参;包括树/多分支探索和策略引导优化。论文:AMPO (EMNLP 2024);StraGo (EMNLP Findings 2024)。专利申请:Automatic Tree-Structured Prompt Optimization;Strategic-Guided Prompt Optimization。产品影响:多个 Bing 团队使用的实用提示词优化流程。
- AI 助手和 agent 评估评估 AI 助手的多轮一致性、搜索支撑推理、引用质量、模型选择,以及更长任务中的 agent 行为。论文:Evaluating LLM-Based Agents for Multi-Turn Conversations: A Survey (ACM TIST 2026)。
- Web 系统、缓存与搜索基础设施研究 Web 和搜索系统如何在延迟、成本和生产约束下改进缓存、度量、存储效率和长尾文档新鲜度。论文/专利:Smart Caching for Web Browsers (WWW 2010);WPBench (WWW 2009);Structure-Based Adaptive Document Caching。产品影响:Bing 文档理解流水线。
人机交互证明(CAPTCHA)与认证
该主题覆盖认证和人机验证系统:图像、覆盖式、可操作和音频 HIP/CAPTCHA 设计,图形密码安全分析,以及设备辅助或零负担认证概念。
- CAPTCHA 与人机交互证明设计设计对人可用、对自动攻击者困难的人机验证机制,涵盖图像识别 CAPTCHA、音频 HIP、覆盖式和可操作 HIP,以及人机计算框架。论文:Attacks and Design of Image Recognition CAPTCHAs (ACM CCS 2010);Comprehensive Human Computation Framework (ACM MM 2008)。专利:image-based CAPTCHA;Audio HIP;manipulable HIPs;overlay HIP。产品影响:Windows Live 中的 Visual HIP 和 Audio HIP。
- 图形密码安全分析点击式图形密码,证明若干离散化方法会泄露密码信息,并连接人类记忆性、图像结构和攻击可行性。论文:Security Implications of Password Discretization (WWW 2013);Security Analyses of Click-Based Graphical Passwords (ACM CCS 2014);CAPTCHA as Graphical Passwords (IEEE TIFS 2014)。
- 用户和设备认证探索在降低用户负担的同时增强安全性的认证方案,包括隐私保护分布式单点登录、腕戴设备辅助的零负担手机锁定和硬件辅助密码增强。专利:Distributed Single Sign-On Technologies;privacy-protecting SSO。产品影响:MSN Mobile v6.5 中的移动完整性检测。
多媒体安全、水印与内容保护
该主题覆盖音频、图像和视频水印,多媒体认证,可伸缩媒体加密和 DRM,内容保护,以及图表、幻灯片等视觉媒体中的数据嵌入。
- 水印与多媒体认证从博士研究延伸到创业产品,覆盖鲁棒音频、图像和视频水印、感知掩蔽、多媒体认证、版权保护、追踪、链接和隐蔽通信。论文/章节:Multimedia Authentication and Watermarking (Springer chapter 2003);Robust Audio Watermarking (Signal Processing 1998);Video Watermarking Using Perceptual Models (IEEE JSAC 1998);Robust Data Hiding for Images (DSP Workshop 1996)。产品影响:Cognicity AudioKey、tMark 和 TurnKey 商业水印产品。
- 可伸缩加密、DRM 与内容保护在保持可伸缩性和自适应能力的同时保护多媒体,包括语法兼容加密、分层访问控制、转码兼容保护和 DRM 设计。论文/章节/专利:Multimedia Encryption (Academic Press chapter 2006);Scalable Encryption and Multi-Access Control (Academic Press chapter 2006);Scalable Protection for MPEG-4 FGS (IEEE TMM 2005);Syntax-compliant JPEG 2000 encryption (EURASIP JIS 2007);Secure Key Management for Scalable Codestreams (MMSP 2005);Scalable Layered Access Control for Multimedia (ISCAS 2005);JPEG 2000 Encryption Enabling Fine Granularity Scalability (ISCAS 2005);Fully Scalable Encryption for MPEG-4 FGS (ISCAS 2003)。产品影响:MUSE、4C DVD-Audio proposal 和 SDMI screening 等音乐行业版权保护工作。
- 图表、幻灯片和图像中的数据嵌入在图表/幻灯片图像中嵌入并恢复信息,用于从截图重建图表对象、提升图表内容可访问性等应用。论文:ChartStamp (ACM MM 2022);OneLabeler (CHI 2022)。专利:Data Embedding and Data Extraction in Image。
隐私保护计算与系统可靠性
该主题覆盖受保护数据上的计算和大规模服务可靠性:同态加密域媒体处理、加密视频分析、异常检测、故障预测,以及面向 Web 规模基础设施的压缩。
- 加密域中的媒体处理研究是否可以在不暴露媒体本身的情况下完成有用媒体处理,包括在同态加密域中进行 JPEG 解压和 FLAC 解码。论文:JPEG Decompression in the Homomorphic Encryption Domain (ACM MM 2018);Decoding Homomorphically Encrypted FLAC Audio without Decryption (ICASSP 2019)。
- 加密视频分析与多媒体隐私在保护隐私的同时对监控视频进行有用分析,包括在加密 HEVC 压缩视频上直接进行运动检测和轨迹推断。论文:Privacy-Preserving Motion Detection for HEVC-Compressed Surveillance Video (ACM TOMM 2022);Privacy-Preserving Cloud-Based Video Surveillance (ICIP 2018);Efficient Privacy-Preserving Motion Detection for HEVC Video (INFOCOM WKSHPS 2018)。
- 系统可靠性、异常检测与压缩将机器学习和系统分析用于大规模服务可靠性与效率,包括事故预测/分诊、无干净标签异常检测、搜索索引存储压缩和 Web 系统性能改进。论文/专利:Smart Caching for Web Browsers (WWW 2010);WPBench (WWW 2009);Structure-Based Adaptive Document Caching。产品影响:微软亚洲研究院(MSRA)反向索引压缩研究转化到 Bing PDI,平均降低约 23% 存储且不降低压缩/解压速度。
产品与创业工作主题
按应用领域整理的代表性产品和创业工作,与上面的研究主题分开呈现。
M365 Core: Copilot、BizChat 与 Researcher Agent
面向企业 AI 助手的应用研究与开发,使 Copilot 和相关 agent 更容易评估和改进:诊断推理轨迹、衡量引用质量、比较模型选择、支持深度搜索,并提升真实企业任务中的多轮可靠行为。
- 推理评估与回放基础设施构建可回放和分析生产推理轨迹的基础设施,帮助团队以可重复方式诊断答案质量、引用质量、意图理解、搜索支撑推理和模型选择行为。
- Researcher agent 与 agentic deep search推进企业信息工作中的深度搜索和 agentic 能力,关注任务分解、证据收集、基于证据的综合,以及揭示多轮 agent 成功或漂移的评估方法。
微软 Bing Core Search: 检索、提示词与文档理解
在微软 Bing Core Search 中开展检索和 Web 规模文档理解产品工作,将 LLM 和多向量检索能力转化为实用搜索流程:开发替代稀疏+稠密检索的新多向量检索机制,改进提示词优化,更丰富地表示文档,为新鲜和长尾页面生成信号,并衡量检索和推荐影响。
- 提示词优化流程构建实用提示词优化流程,帮助多个 Bing 团队系统搜索、比较和改进提示词,而不是只依赖手工试错。
- 替代稀疏+稠密检索的多向量检索为微软 Bing Core Search 构建灵活的多向量检索机制,并配套基于 LLM 的文档理解流水线,为真实交互数据稀疏的新鲜和长尾 Web 文档生成合成查询和点击信号。
Cognicity: 商业水印产品
作为联合创始人和主管科学家,将多媒体水印和数据嵌入博士研究转化为商业音频、图像和视频产品。工作结合算法设计、产品架构、核心模块实现,以及与版权保护和媒体行业需求的直接对接。
- AudioKey、tMark 与 TurnKey领导零售音频水印、下载时交易水印和刻录时每张 CD 唯一 ID 水印的产品架构和核心水印模块开发。
- 图像、视频与数据嵌入产品将产品线从音频扩展到图像和视频水印、指纹、版权保护、访问控制、追踪、链接和隐蔽通信场景。
- 音乐行业版权保护工作为版权保护和访问控制行业工作贡献水印技术,包括 MUSE、4C Entity DVD-Audio proposal 和 SDMI Phase 2 screening。