范叶亮写智能体、模型和数据系统时,习惯先把定义和边界钉死。把「Spark 集群搭建」整理成可落地的中文笔记:问题在哪、默认做法会踩什么坑、该怎么选。原站导航和广告已去掉。

Scala 配置

按照 Hadoop 集群搭建 (Hadoop Cluster Setup) 搭建 Hadoop 集群。

cd /opt tar -zxvf scala-2.12.14.tgz ln -s /opt/scala-2.12.14 /opt/scala 将如下信息添加到 /etc/profile 中:

Spark 配置

# Scala export SCALA_HOME=/opt/scala export PATH=$PATH:$SCALA_HOME/bin 方便起见可以使用 rsync 命令同步 Scala:

rsync -auvp /opt/scala-2.12.14 leo@vm-02:/opt rsync -auvp /opt/scala-2.12.14 leo@vm-03:/opt Spark 配置 将 Spark 安装包解压缩到 /opt 目录并创建软链接:

启动 Spark

cd /opt tar -zxvf spark-3.1.2-bin-hadoop3.2.tgz ln -s /opt/spark-3.1.2-bin-hadoop3.2 /opt/spark 将如下信息添加到 /etc/profile 中:

# Spark export SPARK_HOME=/opt/spark export PATH=$PATH:$SPARK_HOME/bin 复制环境变量文件:

NFS 配置

cp /opt/spark/conf/spark-env.sh.template /opt/spark/conf/spark-env.sh 在 spark-env.sh 结尾添加如下内容:

export JAVA_HOME = /opt/jdk export SCALA_HOME = /opt/scala export HADOOP_HOME = /opt/hadoop export HADOOP_CONF_DIR = $HADOOP_HOME /conf export YARN_CONF_DIR = $HADOOP_HOME /conf export SPAKR_HOME = /opt/spark export SPARK_CONF_DIR = $SPAKR_HOME /conf export SPARK_EXECUTOR_CORES = 1 export SPARK_EXECUTOR_MEMORY = 1G export SPARK_DRIVER_MEMORY = 1G export SPARK_HISTORY_OPTS = "-Dspark.history.retainedApplications=10" 复制配置文件:

Python 配置

cp /opt/spark/conf/spark-defaults.conf.template /opt/spark/conf/spark-defaults.conf 修改 spark-defaults.conf 文件内容如下:

spark.eventLog.enabled true spark.eventLog.compress true spark.eventLog.dir hdfs://vm-01:9000/logs/spark spark.history.fs.logDirectory hdfs://vm-01:9000/logs/spark spark.yarn.historyServer.address vm-01:18080 spark.yarn.jars hdfs://vm-01:9000/spark/jars/* 复制 Worker 节点列表文件:

PySpark 测试

cp /opt/spark/conf/workers.template /opt/spark/conf/workers 修改 workers 文件内容如下:

hdfs dfs -mkdir -p /spark/jars hdfs dfs -put /opt/spark/jars/* /spark/jars/ 方便起见可以使用 rsync 命令同步 Spark:

值得单独记下的点

  • JDK:1.8.0_291, 下载地址 。
  • Scala:2.12.14, 下载地址 。
  • Python:3.9,Miniconda3, 下载地址 。

落地时建议先做的 5 件事

  1. 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。
  2. 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。
  3. 多智能体只在单智能体触到上下文或专业边界时再拆。
  4. Token、微调和压缩都要有对照数字,避免口号式优化。
  5. 结论写成可检查清单:接口、超时、评测集、回滚版本。

和智能体产品怎么接

龙虾PRO做 OpenClaw 落地时,最该拿走的是「单智能体先做好工具和提示,再谈编排」。数字员工、技能市场和网关应共用同一套评测与权限,而不是各写一套角色人设。

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:按照 虚拟环境准备 (Virtual Environment Preparation) 准备虚拟机。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:按照 Hadoop 集群搭建 (Hadoop Cluster Setup) 搭建 Hadoop 集群。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) JDK:1.8.0_291, 下载地址 。;2) Scala:2.12.14, 下载地址 。;3) Python:3.9,Miniconda3, 下载地址 。;4) 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。;5) 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「Scala 配置」,本文给出了什么结论?

在「Scala 配置」部分,要点是:# Scala export SCALA_HOME=/opt/scala export PATH=$PATH:$SCALA_HOME/bin 方便起见可以使用 rsync 命令同步 Scala: rsync -auvp /opt/scala-2.12.14 leo@vm-02:/opt rsync -auvp /opt/scala-2.12.14 leo@vm-03:/opt Spark 配置 将 Spark 安装包解压缩到 /opt

关于「Spark 配置」,本文给出了什么结论?

在「Spark 配置」部分,要点是:ark 安装包解压缩到 /opt 目录并创建软链接: 启动 Spark cd /opt tar -zxvf spark-3.1.2-bin-hadoop3.2.tgz ln -s /opt/spark-3.1.2-bin-hadoop3.2 /opt/spark 将如下信息添加到 /etc/profile 中: # Spark export SPARK_HOME=/opt/spark export PATH=$PATH:$SPARK_H