W pełni powtarzalne modele równoległe z użyciem karetki

Question

Nov 15, 2012, 07:01 PM

W pełni powtarzalne modele równoległe z użyciem karetki

Kiedy uruchamiam 2 losowe lasy w karetce, otrzymuję dokładnie takie same wyniki, jeśli ustawię losowe ziarno:

library(caret)
library(doParallel)

set.seed(42)
myControl <- trainControl(method='cv', index=createFolds(iris$Species))

set.seed(42)
model1 <- train(Species~., iris, method='rf', trControl=myControl)

set.seed(42)
model2 <- train(Species~., iris, method='rf', trControl=myControl)

> all.equal(predict(model1, type='prob'), predict(model2, type='prob'))
[1] TRUE

Jeśli jednak zarejestruję równoległy back-end, aby przyspieszyć modelowanie, otrzymam inny wynik za każdym razem, gdy uruchomię model:

cl <- makeCluster(detectCores())
registerDoParallel(cl)

set.seed(42)
myControl <- trainControl(method='cv', index=createFolds(iris$Species))

set.seed(42)
model1 <- train(Species~., iris, method='rf', trControl=myControl)

set.seed(42)
model2 <- train(Species~., iris, method='rf', trControl=myControl)

stopCluster(cl)

> all.equal(predict(model1, type='prob'), predict(model2, type='prob'))
[1] "Component 2: Mean relative difference: 0.01813729"
[2] "Component 3: Mean relative difference: 0.02271638"

Czy jest jakiś sposób na rozwiązanie tego problemu? Jedną z sugestii było użyciedoRNG pakiet, aletrain używa zagnieżdżonych pętli, które obecnie nie są obsługiwane:

library(doRNG)
cl <- makeCluster(detectCores())
registerDoParallel(cl)
registerDoRNG()

set.seed(42)
myControl <- trainControl(method='cv', index=createFolds(iris$Species))

set.seed(42)
> model1 <- train(Species~., iris, method='rf', trControl=myControl)
Error in list(e1 = list(args = seq(along = resampleIndex)(), argnames = "iter",  : 
  nested/conditional foreach loops are not supported yet.
See the package's vignette for a work around.

AKTUALIZACJA: Myślałem, że ten problem można rozwiązać za pomocądoSNOW iclusterSetupRNG, ale nie mogłem się tam dostać.

set.seed(42)
library(caret)
library(doSNOW)
cl <- makeCluster(8, type = "SOCK")
registerDoSNOW(cl)

myControl <- trainControl(method='cv', index=createFolds(iris$Species))

clusterSetupRNG(cl, seed=rep(12345,6))
a <- clusterCall(cl, runif, 10000)
model1 <- train(Species~., iris, method='rf', trControl=myControl)

clusterSetupRNG(cl, seed=rep(12345,6))
b <- clusterCall(cl, runif, 10000)
model2 <- train(Species~., iris, method='rf', trControl=myControl)

all.equal(a, b)
[1] TRUE
all.equal(predict(model1, type='prob'), predict(model2, type='prob'))
[1] "Component 2: Mean relative difference: 0.01890339"
[2] "Component 3: Mean relative difference: 0.01656751"

stopCluster(cl)

Co jest szczególnego w foreach i dlaczego nie używa nasion, które zainicjowałem w klastrze? przedmiotya ib są identyczne, więc czemu niemodel1 imodel2?