Linux命令去除BOM头_sed和vim批量清理
网站程序从网上下载或从其他服务器迁移后,经常出现各种诡异问题——页面乱码、顶部空白、验证码不显示、登录跳转异常。这些问题很多时候是因为文件编码不一致,部分文件带BOM头部分不带,导致输出异常。解决方法是把所有PHP、HTML、CSS、JS文件统一转为UTF-8无BOM编码。本文讲解如何检测哪些文件有BOM头、如何用编辑器单个去除、如何用脚本批量去除整个网站目录的BOM头,以及如何设置编辑器默认保存为无BOM格式防止以后再出现这个问题。
防止BOM头的最佳实践。一是统一团队编辑器设置,所有开发者设置默认保存为UTF-8无BOM,在编辑器配置或团队规范中明确。二是代码提交前检查,Git可以配置pre-commit钩子检测BOM头,SVN可以用pre-commit脚本。三是网站程序上线前用批量脚本扫描一次,确保没有BOM头。四是从官方渠道下载程序,很多第三方修改版可能带BOM头。五是PHP项目中在入口文件开头用ob_start()开启输出缓冲,可以缓冲BOM头输出,避免header失败,但这只是临时方案,根本解决还是去除BOM头。六是模板文件(HTML、CSS、JS)也要检查,不只是PHP文件。
BOM头与编码乱码的关系。BOM头本身不会导致中文乱码,乱码通常是因为文件编码和页面声明的编码不一致(文件是GBK但页面声明UTF-8,或反之)。但BOM头会加剧编码问题——带BOM头的UTF-8文件被当作GBK解析时,BOM头三个字节会显示为乱码字符(锘?)。解决乱码的根本方法是统一所有文件编码为UTF-8无BOM,同时在页面head中声明,PHP文件设置header('Content-Type: text/html; charset=utf-8'),数据库连接设置SET NAMES utf8。编码统一后,BOM头和乱码问题都能解决。
检测文件是否有BOM头的方法。方法一:用十六进制编辑器打开文件,查看开头三个字节是否是EF BB BF。Notepad++的「插件」-「HEX-Editor」-「View in HEX」可以查看十六进制。方法二:用PHP脚本检测,代码:<?php $file = 'test.php'; $f = fopen($file, 'r'); $bom = fread($f, 3); fclose($f); if ($bom == pack('CCC', 0xEF, 0xBB, 0xBF)) { echo '有BOM头'; } else { echo '无BOM头'; }。方法三:Linux命令检测:head -c 3 file.php | xxd,输出开头是efbbbf说明有BOM头。方法四:用编辑器查看编码,Notepad++底部状态栏显示「UTF-8-BOM」说明有BOM头,显示「UTF-8」说明无BOM头。
Notepad++去除BOM头。打开文件后,点击菜单「编码」-「转为UTF-8无BOM编码」,然后保存文件。底部状态栏会从「UTF-8-BOM」变为「UTF-8」。批量去除多个文件:在Notepad++中打开所有需要处理的文件,点击「编码」-「转为UTF-8无BOM编码」,然后按Ctrl+Shift+S全部保存。注意Notepad++的「编码」菜单中有「使用UTF-8无BOM编码」和「转为UTF-8无BOM编码」两个选项,「使用」是设置编辑器显示编码不改变文件内容,「转为」才是真正转换文件编码去除BOM头,一定要选「转为」。设置默认保存为无BOM:「设置」-「首选项」-「新建」,编码选择UTF-8,不勾选「应用到打开的ANSI文件」。
Sublime Text去除BOM头。Sublime Text默认保存UTF-8不带BOM。如果文件有BOM头,点击「File」-「Save with Encoding」-「UTF-8」,保存后去除BOM。注意不要选「UTF-8 with BOM」。安装「EncodingHelper」插件可以在状态栏显示文件编码和BOM状态,方便检测。设置默认编码:「Preferences」-「Settings」,添加"default_encoding": "UTF-8","show_encoding": true。Dreamweaver去除BOM头:「修改」-「页面属性」-「标题/编码」,编码选择Unicode (UTF-8),不勾选「包括Unicode签名(BOM)」,确定后保存页面。旧版Dreamweaver默认保存UTF-8时会添加BOM,需要手动取消勾选。
PowerShell批量去除BOM头(Windows环境)。代码:$path = "." $files = Get-ChildItem -Path $path -Recurse -Include *.php,*.html,*.css,*.js,*.txt $count = 0 foreach ($file in $files) { $bytes = [System.IO.File]::ReadAllBytes($file.FullName) if ($bytes.Length -ge 3 -and $bytes[0] -eq 0xEF -and $bytes[1] -eq 0xBB -and $bytes[2] -eq 0xBF) { $newBytes = $bytes[3..($bytes.Length-1)] [System.IO.File]::WriteAllBytes($file.FullName, $newBytes) Write-Host "已去除: $($file.FullName)" $count++ } } Write-Host "完成,共处理$count个文件"。保存为remove_bom.ps1,右键「使用PowerShell运行」,或在PowerShell中执行。如果提示执行策略限制,先运行Set-ExecutionPolicy RemoteSigned。
Linux命令批量去除BOM头(适合有SSH权限的用户)。方法一:find命令配合sed,扫描当前目录及子目录下所有PHP文件,去除开头三个字节:find . -type f -name "*.php" -exec sed -i '1s/^xefxbbxbf//' {} ;。把*.php改为*.html、*.css、*.js等处理其他类型。方法二:用find配合vim:find . -type f ( -name "*.php" -o -name "*.html" -o -name "*.js" -o -name "*.css" ) -exec vim -c "set nobomb" -c "wq" {} ;。方法三:用dos2unix工具(部分系统自带):dos2unix *.php。dos2unix会同时转换换行符和去除BOM。执行前先备份文件,批量操作有风险。
Python脚本批量去除BOM头(适合本地开发环境)。代码:# -*- coding: utf-8 -*- import os def remove_bom(path): count = 0 for root, dirs, files in os.walk(path): for f in files: if f.lower().endswith(('.php', '.html', '.htm', '.css', '.js', '.txt', '.xml', '.json')): filepath = os.path.join(root, f) with open(filepath, 'rb') as fp: data = fp.read() if data[:3] == b'xefxbbxbf': with open(filepath, 'wb') as fp: fp.write(data[3:]) print(f'已去除: {filepath}') count += 1 print(f'完成,共处理{count}个文件') if __name__ == '__main__': remove_bom('.')。保存为remove_bom.py,在网站目录下运行python remove_bom.py。Python3环境下运行,处理前备份文件。
BOM头导致验证码不显示的原理。验证码图片通过PHP的GD库生成,用header('Content-Type: image/png')设置内容类型,然后输出图片二进制数据。如果PHP文件有BOM头,BOM头会在图片数据之前输出,导致浏览器接收到的数据是「BOM头 + 图片数据」,不是合法的PNG格式,浏览器无法解析,显示为叉号或空白。解决方法是去除生成验证码的PHP文件(以及include的所有文件)的BOM头。注意不仅验证码文件本身不能有BOM头,它include/require的所有文件(如数据库配置文件、函数库文件)也不能有BOM头,任何一个文件有BOM头都会导致输出异常。
BOM头导致的其他问题。CSS文件有BOM头时,部分浏览器会忽略CSS的第一行规则(因为BOM头在@charset或第一条规则之前),导致第一条样式失效。JS文件有BOM头时,某些旧浏览器会解析报错,因为BOM头在JS代码之前被当作非法字符。JSON接口返回的数据有BOM头时,前端的JSON.parse()会抛出「Unexpected token」错误,因为JSON数据开头多了三个字节。XML文件有BOM头时,XML解析器可能报错「XML declaration not at start of document」,因为XML声明<?xml之前有BOM头。下载文件的PHP脚本有BOM头时,下载的文件开头多了三个字节,导致文件损坏(如ZIP无法解压、图片无法打开)。
BOM头的原理。UTF-8编码的BOM头是三个字节:EF BB BF,位于文件最开头。UTF-16和UTF-32编码的BOM头是FE FF或FF FE,用于标识字节顺序(大端或小端)。UTF-8编码本身不需要BOM头来标识字节顺序(因为UTF-8的字节顺序是固定的),BOM头在UTF-8中仅用于标识这是一个UTF-8文件。很多Windows编辑器(如旧版记事本)在保存UTF-8时自动添加BOM头,因为Windows系统通过BOM头区分UTF-8和系统默认编码(如GBK)。但在Linux和Web开发中,UTF-8文件不应该带BOM头。
站长反馈:「网站页面顶部一直有空白,验证码也不显示,排查了两天才发现是BOM头的问题,用Notepad++批量转为UTF-8无BOM后全部正常了」「下载的网站程序安装后乱码,按文中PHP批量脚本跑了一遍,去除了几十个文件的BOM头,页面立刻正常,虚拟主机用户用这个脚本太方便了」。
安全提醒:批量去除BOM头的PHP脚本上传到网站后,使用完立即删除,不要留在服务器上被他人访问。不要用不明来源的第三方工具处理网站文件,可能植入恶意代码。编辑器从官方渠道下载,避免被篡改。文件编码转换不会改变文件内容(除了删除BOM头三个字节),但操作前备份是好习惯。如果转换后文件内容异常,用备份恢复。

更新时间:2026-08-27 11:22:34